Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Fun-ASR Realtime

Date de sortie : 2025-09-23

transcription

Fun-ASR Realtime est le modèle de reconnaissance vocale en streaming d'Alibaba : l'audio est diffusé en entrée sur une connexion persistante et le texte est renvoyé en streaming avec une faible latence, sans limite de durée de flux.

Entrée
audio
Sortie
texte
Prix
$0.002/min

Le prix en contexte

Position du prix parmi 11 modèles comparables

Par minute$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Audio

Langues Multilingue avec dialectes, 30 langues: chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin, plus accents régionaux), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque
Limites audio
  • Streaming WebSocket en temps réel, durée illimitée
  • mots-clés (hotwords) à grande échelle basés sur RAG
  • horodatages à la milliseconde
  • détection de tour de parole par VAD
Diarisation Non
Transcription en streaming Oui
Horodatages Oui

Modèle

Modalités audio → texte

La documentation décrit également une reconnaissance des émotions à 7 états dans le guide temps réel.

selon docs officielles Alibaba ↗

Utilisez Fun-ASR Realtime en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-realtime",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

À propos de Fun-ASR Realtime

  • La documentation officielle le positionne pour les sous-titres en direct, les assistants vocaux et la transcription de réunions, et il conserve les atouts de la famille Fun-ASR, à savoir la personnalisation par mots-clés (hotwords) et une couverture multilingue incluant les dialectes régionaux chinois, l'anglais, le japonais et le coréen.
  • La surface temps réel ajoute des contrôles dont les modèles sur fichier n'ont pas besoin : ponctuation sémantique, prédiction de la ponctuation activée par défaut, silence maximal de phrase ajustable qui décide de la clôture d'un énoncé, seuil de bruit vocal pour se régler face au son ambiant, et horodatages au niveau du mot émis au fil du flux.
  • L'audio arrive en PCM, WAV, MP3, Opus, Speex, AAC ou AMR à 8 ou 16 kHz.
  • Deux limites méritent d'être anticipées dans la conception : la diarisation des locuteurs n'est pas disponible sur le chemin temps réel (pour savoir qui a dit quoi, il faut les modèles sur fichier enregistré), et la couverture linguistique varie fortement d'un snapshot daté à l'autre au lieu d'être uniforme dans la famille, alors épinglez le snapshot dont dépend votre jeu de langues.
  • L'étiquetage des émotions, le différenciateur de la lignée Qwen3-ASR, n'est pas proposé ici non plus, et le réglage de la précision par le contexte n'est disponible que sur certains snapshots.
  • Synthorai le rend appelable via la même interface compatible OpenAI utilisée pour le reste de son catalogue audio.

FAQ

Peut-on essayer l'API Fun-ASR Realtime gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Fun-ASR Realtime sur votre charge de travail réelle avant d'ajouter un moyen de paiement.

Quels sont les points forts de Fun-ASR Realtime ?

Transcription en streaming sans limite de durée ; conçu pour les sous-titres en direct et les réunions ; personnalisation par mots-clés avec couverture multilingue. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Fun-ASR Realtime ?

Sur Synthorai, Fun-ASR Realtime coûte $0.002 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.

Quelles langues Fun-ASR Realtime prend-il en charge ?

Fun-ASR Realtime prend en charge Multilingue avec dialectes, 30 langues: chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin, plus accents régionaux), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.

Comment obtenir l'accès à Fun-ASR Realtime ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="fun-asr-realtime", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →