Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Fun-ASR Flash

Date de sortie : 2026-06

transcription

Fun-ASR Flash est la variante hors ligne rapide de la famille de reconnaissance vocale Fun-ASR d'Alibaba, conçue pour transcrire de courts enregistrements pouvant aller jusqu'à cinq minutes.

Entrée
audio
Sortie
texte
Prix
$0.0021/min

Le prix en contexte

Position du prix parmi 11 modèles comparables

Par minute$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Audio

Langues Multilingue avec dialectes, la même liste de 30 langues que les versions principales de Fun-ASR: chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin, plus accents régionaux), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque
Limites audio
  • Reconnaissance rapide synchrone, <=5 min / <=2 Go par fichier audio
  • injection de contexte pour les termes métier
  • plus de 30 langues
  • pas de diarisation
Diarisation Non
Transcription en streaming Oui

Modèle

Modalités audio → texte

Palier synchrone rapide de la famille Fun-ASR.

selon docs officielles Alibaba ↗

Utilisez Fun-ASR Flash en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-flash",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

À propos de Fun-ASR Flash

  • Sa particularité, selon la documentation officielle, est l'injection de contexte par prompt : au lieu de maintenir des listes de mots-clés (hotwords), vous fournissez la terminologie métier directement dans un prompt pour orienter la précision de reconnaissance.
  • C'est le seul modèle de la famille documenté pour cela, avec jusqu'à cinq tours de contexte de quelques centaines de caractères chacun, ce qui convient à une terminologie qui change d'un appel à l'autre plutôt que d'un projet à l'autre.
  • Il conserve la large couverture linguistique de la famille, couvrant le chinois avec ses dialectes régionaux, l'anglais, le japonais, le coréen et de nombreuses langues européennes et d'Asie du Sud-Est.
  • Le reste de l'arbitrage face au modèle de base est tout aussi concret : les appels sont synchrones avec résultats en streaming plutôt qu'en soumission-puis-interrogation, si bien qu'un clip court revient en ligne au lieu de passer par un identifiant de tâche, mais le plafond de cinq minutes remplace celui de douze heures (la limite de 2 Go par fichier demeure, c'est donc la durée qui contraint ici), et la diarisation des locuteurs n'est pas disponible.
  • Lues ensemble, ces différences rendent le choix net au sein de la famille : Fun-ASR pour les archives longues et multi-locuteurs à vocabulaire stable, Fun-ASR Flash pour les clips courts qui exigent une réponse rapide et une terminologie fournie à chaque requête.
  • Sur Synthorai, il est disponible via la surface d'API standard compatible OpenAI.

FAQ

Peut-on essayer l'API Fun-ASR Flash gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Fun-ASR Flash sur votre charge de travail réelle avant d'ajouter un moyen de paiement.

Quels sont les points forts de Fun-ASR Flash ?

Injection de contexte par prompt au lieu de mots-clés ; transcrit de courts enregistrements jusqu'à cinq minutes ; large couverture incluant les dialectes régionaux chinois. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Fun-ASR Flash ?

Sur Synthorai, Fun-ASR Flash coûte $0.0021 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.

Quelles langues Fun-ASR Flash prend-il en charge ?

Fun-ASR Flash prend en charge Multilingue avec dialectes, la même liste de 30 langues que les versions principales de Fun-ASR: chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin, plus accents régionaux), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.

Comment obtenir l'accès à Fun-ASR Flash ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="fun-asr-flash", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →