Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Fun-ASR

Date de sortie : 2025-08-22

transcription

Fun-ASR est le modèle de reconnaissance vocale sur fichier enregistré d'Alibaba Cloud Model Studio, dédié à la transcription hors ligne d'audio préenregistré.

Entrée
audio
Sortie
texte
Prix
$0.0021/min

Le prix en contexte

Position du prix parmi 11 modèles comparables

Par minute$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Audio

Langues Multilingue avec dialectes, 30 langues: chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin, plus accents régionaux), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque
Limites audio
  • Transcription de fichiers en asynchrone jusqu'à 12 h / 2 Go
  • mots-clés (hotwords) et diarisation des locuteurs
  • horodatages de phrase et de mot
  • plus de 30 langues, dialectes chinois compris
Diarisation Oui
Transcription en streaming Non
Horodatages Oui

Modèle

Modalités audio → texte
  • Reconnaissance du chant ajoutée en 2025-12
  • Fun-ASR-Nano, publié en open source, est un modèle distinct de ces poids servis

selon docs officielles Alibaba ↗

Utilisez Fun-ASR en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

À propos de Fun-ASR

  • Il accepte des fichiers jusqu'à 12 heures et 2 Go, gère les tâches en fichier unique et par lots, et reconnaît le chinois (mandarin plus de nombreux dialectes régionaux comme le cantonais, le wu et le hokkien), l'anglais, le japonais, le coréen et des dizaines d'autres langues.
  • La documentation officielle met en avant la personnalisation par mots-clés (hotwords) pour la terminologie métier et la diarisation des locuteurs pour les enregistrements multi-locuteurs.
  • Toutes deux s'accompagnent de détails pratiques à connaître d'emblée : une table de mots-clés contient jusqu'à 500 entrées et convient à une terminologie qui change rarement, la diarisation est désactivée tant que vous ne l'activez pas et permet de déclarer un nombre de locuteurs attendu, et Alibaba recommande de garder l'audio diarisé sous environ deux heures, faute de quoi la tâche risque d'expirer.
  • La transcription est asynchrone (soumettez le fichier, recevez un identifiant de tâche, interrogez le résultat), et les horodatages au niveau de la phrase et du mot en millisecondes sont renvoyés en standard, aux côtés du filtrage des mots sensibles et de la sélection par canal pour les enregistrements multipistes.
  • L'étiquetage des émotions ne fait pas partie de ce modèle ; il relève de la lignée Qwen3-ASR.
  • Les indices de langue sont acceptés, mais la documentation note que seule la première valeur de la liste est lue.
  • Synthorai sert Fun-ASR via son endpoint compatible OpenAI, de sorte que les clients de transcription existants fonctionnent sans modification.

FAQ

Peut-on essayer l'API Fun-ASR gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. De quoi essayer Fun-ASR sur votre charge de travail réelle avant d'ajouter un moyen de paiement.

Quels sont les points forts de Fun-ASR ?

Accepte des fichiers jusqu'à 12 heures ; personnalisation par mots-clés pour la terminologie métier ; diarisation des locuteurs pour enregistrements multi-locuteurs. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Fun-ASR ?

Sur Synthorai, Fun-ASR coûte $0.0021 par minute d'audio transcrit : paiement à l'usage, sans majoration de plateforme, sans abonnement.

Quelles langues Fun-ASR prend-il en charge ?

Fun-ASR prend en charge Multilingue avec dialectes, 30 langues: chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin, plus accents régionaux), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque. Sur Synthorai, vous l'appelez via POST /v1/audio/transcriptions, le format de l'API de transcription d'OpenAI.

Comment obtenir l'accès à Fun-ASR ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="fun-asr", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →