Fun-ASR est le modèle de reconnaissance vocale sur fichier enregistré d'Alibaba Cloud Model Studio, dédié à la transcription hors ligne d'audio préenregistré.
- Entrée
- audio
- Sortie
- texte
- Prix
- $0.0021/min
Le prix en contexte
Position du prix parmi 11 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Audio
| Langues | Multilingue avec dialectes, 30 langues: chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin, plus accents régionaux), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque |
|---|---|
| Limites audio |
|
| Diarisation | Oui |
| Transcription en streaming | Non |
| Horodatages | Oui |
Modèle
| Modalités | audio → texte |
|---|
- Reconnaissance du chant ajoutée en 2025-12
- Fun-ASR-Nano, publié en open source, est un modèle distinct de ces poids servis
Utilisez Fun-ASR en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());À propos de Fun-ASR
- Il accepte des fichiers jusqu'à 12 heures et 2 Go, gère les tâches en fichier unique et par lots, et reconnaît le chinois (mandarin plus de nombreux dialectes régionaux comme le cantonais, le wu et le hokkien), l'anglais, le japonais, le coréen et des dizaines d'autres langues.
- La documentation officielle met en avant la personnalisation par mots-clés (hotwords) pour la terminologie métier et la diarisation des locuteurs pour les enregistrements multi-locuteurs.
- Toutes deux s'accompagnent de détails pratiques à connaître d'emblée : une table de mots-clés contient jusqu'à 500 entrées et convient à une terminologie qui change rarement, la diarisation est désactivée tant que vous ne l'activez pas et permet de déclarer un nombre de locuteurs attendu, et Alibaba recommande de garder l'audio diarisé sous environ deux heures, faute de quoi la tâche risque d'expirer.
- La transcription est asynchrone (soumettez le fichier, recevez un identifiant de tâche, interrogez le résultat), et les horodatages au niveau de la phrase et du mot en millisecondes sont renvoyés en standard, aux côtés du filtrage des mots sensibles et de la sélection par canal pour les enregistrements multipistes.
- L'étiquetage des émotions ne fait pas partie de ce modèle ; il relève de la lignée Qwen3-ASR.
- Les indices de langue sont acceptés, mais la documentation note que seule la première valeur de la liste est lue.
- Synthorai sert Fun-ASR via son endpoint compatible OpenAI, de sorte que les clients de transcription existants fonctionnent sans modification.
FAQ
Peut-on essayer l'API Fun-ASR gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Fun-ASR sur votre charge de travail réelle avant d'ajouter un moyen de paiement.
Quels sont les points forts de Fun-ASR ?
Accepte des fichiers jusqu'à 12 heures ; personnalisation par mots-clés pour la terminologie métier ; diarisation des locuteurs pour enregistrements multi-locuteurs. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte Fun-ASR ?
Sur Synthorai, Fun-ASR coûte $0.0021 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.
Quelles langues Fun-ASR prend-il en charge ?
Fun-ASR prend en charge Multilingue avec dialectes, 30 langues: chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin, plus accents régionaux), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.
Comment obtenir l'accès à Fun-ASR ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="fun-asr", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.