Coût des API de transcription : 7 modèles testés sur le même audio
Sommaire
Synthorai permet désormais de transcrire des fichiers audio avec sept modèles speech-to-text spécialisés, accessibles derrière un même endpoint compatible OpenAI.
Cet endpoint masque des intégrations très différentes. En natif, ces modèles ont peu de points communs. whisper-1 reçoit un fichier en multipart et renvoie {text}. gpt-4o-transcribe utilise le même type d’upload, mais ajoute la consommation de tokens. Le modèle seed-asr de ByteDance utilise le protocole AUC de BytePlus, qwen3-asr-flash d’Alibaba a son propre protocole, et les modèles chirp de Google sont des moteurs de reconnaissance Cloud Speech-to-Text accessibles via OAuth.
Endpoints, mécanismes d’authentification et formats de réponse différents : chaque modèle demande normalement une intégration supplémentaire. Avec la gateway, un seul appel compatible OpenAI suffit. Remplacez gpt-4o-mini-transcribe par seed-asr-bigmodel ou chirp-3, sans modifier le reste du code.
TL;DR
- Le coût de transcription varie d’un facteur 8 entre les sept modèles spécialisés : $0.0020 par minute audio pour seed-asr-bigmodel, contre $0.0164 pour les modèles chirp (mesures du 2026-06-25).
- seed-asr ne détecte pas automatiquement la langue : sans paramètre
language, les enregistrements dans une langue autre que l’anglais ou le chinois renvoient un HTTP 200 avec un texte vide ou romanisé, tout en étant facturés. - À $0.0021 par minute, qwen3-asr-flash est le modèle le moins cher capable de détecter automatiquement toutes les langues testées.
- Seuls les modèles de transcription gpt-4o diffusent le résultat token par token. Les modèles facturés à la minute fonctionnent uniquement en batch.
- Tous les modèles ont obtenu un taux d’erreur proche de 0% sur des voix propres en anglais, espagnol et français. La précision n’est donc pas un critère discriminant ici.
L’appel passe par l’endpoint de transcription compatible OpenAI. Si vous utilisez déjà Whisper, vous pouvez le remplacer directement :
curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-F file=@meeting.mp3 \
-F model=gpt-4o-mini-transcribe
from openai import OpenAI
client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")
with open("meeting.mp3", "rb") as f:
result = client.audio.transcriptions.create(model="gpt-4o-mini-transcribe", file=f)
print(result.text)
La transcription est renvoyée dans text, et le coût facturé figure dans le header de réponse x-total-cost-usd.
Nous avons soumis les sept modèles au même test simple. La nature de ce test détermine la portée de tous les chiffres qui suivent.
Ce que ce test mesure, et ce qu’il ne mesure pas
Nous avons généré, avec une voix text-to-speech standard, des textes du quotidien sans noms propres : une matinée, la météo, une visite au marché. Chaque texte a été produit dans l’une des cinq langues les plus parlées au monde, puis chaque extrait a été transcrit par les sept modèles. Les extraits durent environ 12 à 15 secondes et contiennent une quarantaine de mots prononcés à un rythme normal, sans longs silences. Ils sont encodés en WAV PCM 16 bits, mono, à 16 kHz, soit 256 kbps et environ 2 MB par minute. Le texte source sert de référence, et les durées sont exactes.
Le cas est volontairement simple : un enregistrement propre et scripté, avec un seul locuteur, sans accent, bruit ni jargon. Il permet donc de mesurer correctement ce qui ne dépend pas de la difficulté du contenu audio : le coût, la latence, les langues réellement acceptées et la prise en charge du streaming. Ces caractéristiques sont stables.
Ce n’est pas un benchmark de qualité. Avec de vrais enregistrements comportant des accents, du bruit de fond, du vocabulaire métier, des locuteurs qui se chevauchent ou une heure de contenu, les écarts seraient tout autres. Les résultats présentés ici ne permettent pas de les prévoir. Les chiffres de précision servent uniquement à vérifier un niveau minimal, pas à établir un classement. Les résultats sur le coût, la couverture linguistique et le streaming constituent en revanche une base fiable.
Des modèles ASR spécialisés, pas des modèles multimodaux
Les sept modèles testés sont tous des systèmes speech-to-text spécialisés : whisper-1, gpt-4o-transcribe et gpt-4o-mini-transcribe d’OpenAI ; seed-asr-bigmodel de ByteDance ; qwen3-asr-flash d’Alibaba ; ainsi que chirp-2 et chirp-3 de Google.
La gateway peut aussi envoyer une requête de transcription à un modèle multimodal généraliste comme Gemini, qui produit alors une transcription en traitant l’audio. Nous avons exclu ces modèles, et nous ne les choisirions pas pour cet usage. Google donne la même recommandation pour sa propre gamme : son guide audio Gemini présente Gemini comme un outil permettant de décrire ou résumer un contenu audio, ou de répondre à des questions à son sujet. Pour obtenir la transcription elle-même, il renvoie vers les modèles dédiés : « pour des modèles speech-to-text spécialisés prenant en charge la transcription en temps réel, utilisez l’API Google Cloud Speech-to-Text », c’est-à-dire les modèles Chirp. Un modèle multimodal peut produire une transcription, mais il est conçu pour comprendre l’audio, pas pour restituer exactement ce qui a été dit. Il s’utilise en outre via un appel generateContent de type chat, et non via une API de transcription. Pour une transcription verbatim, un modèle spécialisé est le bon outil. Les fournisseurs qui proposent les deux catégories font la même recommandation.
L’audio peut être envoyé de trois manières :
- Fichier en entrée, réponse batch : vous envoyez un enregistrement complet et recevez toute la transcription dans une seule réponse. Tous les modèles prennent en charge ce mode.
- Fichier en entrée, texte en streaming : le fichier est envoyé de la même façon, mais la transcription est renvoyée progressivement via SSE. Certains modèles le prennent en charge ; les autres fonctionnent uniquement en batch.
- Flux audio en entrée, texte en streaming : reconnaissance en temps réel depuis un micro ou un appel en direct. Ce mode est en cours de développement et n’est pas encore disponible. Tous les résultats ci-dessous concernent donc les deux premiers modes.
Mode de facturation de la transcription
Il existe deux modes de facturation. À la minute audio (whisper-1, seed-asr, qwen3-asr-flash et les modèles Chirp) : vous payez selon la durée réelle de l’enregistrement, quel que soit son contenu. Au token (les modèles gpt-4o) : l’audio est converti en tokens à un rythme fixe, puis les tokens audio en entrée et les tokens de la transcription en sortie sont facturés. Un enregistrement silencieux revient donc moins cher qu’une parole dense.
La facturation au token présente un piège : le tarif d’entrée affiché correspond au texte, alors que les tokens audio sont plus chers (gpt-4o-mini-transcribe affiche $1.25/M en entrée, mais facture l’audio $3/M). Une estimation fondée sur le tarif texte sous-évalue donc le coût. La gateway renvoie le montant réel dans le header x-total-cost-usd. Mieux vaut utiliser cette valeur que tenter de le déduire d’une page tarifaire.
Coût
C’est sur ce point que le test donne les résultats les plus nets, et que les écarts sont les plus importants. Voici le coût par minute d’après le header de facturation. Les tarifs actuels de tous les modèles proposés par la gateway figurent sur la page des modèles :
| Modèle | Coût / min | Latence | Streaming |
|---|---|---|---|
seed-asr-bigmodel | $0.0020 | ≈10s | non |
qwen3-asr-flash | $0.0021 | ≈3s | non |
gpt-4o-mini-transcribe | $0.0031 | ≈3s | token par token |
whisper-1 | $0.0060 | ≈4s | non |
gpt-4o-transcribe | $0.0062 | ≈2s | token par token |
chirp-2 | $0.0164 | ≈3s | non |
chirp-3 | $0.0164 | ≈4s | non |
L’écart est d’environ 8x : $0.0020 par minute pour seed-asr, contre $0.0164 pour les modèles Chirp. Le modèle le moins cher, seed-asr, doit connaître la langue de l’enregistrement, comme expliqué plus loin. C’est donc le meilleur choix si la langue est connue à l’avance. Pour des langues mélangées ou inconnues, l’option la moins chère ne nécessitant aucune configuration est qwen3-asr-flash, à $0.0021. Les modèles Chirp sont de loin les plus chers. Si vous choisissez Chirp, mieux vaut prendre chirp-3 : son prix et sa vitesse sont similaires à ceux de chirp-2, mais sa transcription du mandarin est bien meilleure, comme le montre le tableau de précision.
La façon dont ces chiffres s’appliquent à vos fichiers dépend du mode de facturation. Les modèles à la minute (whisper-1, seed-asr, qwen3-asr-flash et les modèles Chirp) ne tiennent compte que de la durée. Le tarif est donc directement transposable : dix minutes d’audio coûtent dix fois le tarif à la minute, quels que soient le format et le contenu.
Pour les modèles facturés au token, c’est-à-dire les lignes gpt-4o, le coût d’entrée dépend de la durée et non de la taille du fichier, car le fournisseur rééchantillonne l’audio avant la tokenisation. Un MP3 lourd à 320 kbps et notre WAV léger à 16 kHz contenant les mêmes paroles produisent donc un coût en tokens à peu près identique. Compresser les fichiers réduit le stockage nécessaire, pas le coût de transcription. La quantité de parole fait en revanche varier la facture : nos extraits sont prononcés à un rythme normal et ne contiennent pas de temps mort. Un enregistrement plus dense ou plus silencieux coûtera donc légèrement plus ou moins cher en tokens de sortie. Dans tous les cas, le header x-total-cost-usd fait foi.
Précision et couverture linguistique
Pour l’anglais, l’espagnol et le français, tous les modèles acceptant la langue ont obtenu environ 0% d’erreur. Tous franchissent donc ce niveau minimal. Même sur ce test simple, quelques écarts apparaissent en mandarin et en hindi. Ils indiquent surtout quelles langues tester avec vos propres enregistrements, pas quel modèle est le meilleur :
| Modèle | Mandarin (CER) | Hindi (WER) | Couverture |
|---|---|---|---|
seed-asr-bigmodel | 0% | 9% | les cinq langues (paramètre language obligatoire) |
qwen3-asr-flash | 0% | 15% | les cinq langues |
gpt-4o-mini-transcribe | 0% | 4% | les cinq langues |
whisper-1 | 0% | 22% | les cinq langues |
gpt-4o-transcribe | 0% | 13% | les cinq langues |
chirp-2 | 16% | 15% | les cinq langues |
chirp-3 | 2% | 15% | les cinq langues |
Le principal constat ne concerne pas la couverture, mais la détection. seed-asr a transcrit les cinq langues lorsque nous avons fourni le paramètre language, puis le japonais, l’allemand, l’italien et le coréen lors d’un test complémentaire. En revanche, il ne détecte pas la langue automatiquement. Sans language, tout enregistrement dans une langue autre que l’anglais ou le chinois renvoie une chaîne vide ou un résultat romanisé incohérent, avec un statut 200 et sans erreur. Les six autres modèles détectent automatiquement la langue. Cette défaillance silencieuse est le vrai problème : un modèle qui échoue explicitement complique l’intégration ; un modèle qui échoue sans signaler d’erreur provoque un incident en production.
Les écarts en hindi et le résultat en mandarin de chirp-2, avec 16% contre 2% pour chirp-3, montrent qu’il faut tester ces modèles sur vos langues les plus difficiles avant de leur faire confiance. Ils ne permettent pas d’affirmer qu’un modèle est globalement meilleur qu’un autre. La voix synthétique et la méthode de scoring amplifient les valeurs absolues, qui varient aussi d’une exécution à l’autre. Sur des voix propres dans les principales langues, la précision ne distingue pas suffisamment ces modèles. Ce test ne permet donc pas de les départager sur ce critère.
Sortie en streaming
La prise en charge du streaming est une capacité technique, pas un critère de qualité, et elle divise clairement les modèles. Ceux facturés à la minute (whisper-1, seed-asr, qwen3-asr-flash et les deux modèles Chirp) fonctionnent uniquement en batch. La gateway renvoie un statut 400 si vous demandez du streaming. Les modèles gpt-4o diffusent la transcription token par token : gpt-4o-transcribe renvoie les premiers mots en une seconde environ, puis complète progressivement le résultat. C’est le comportement attendu pour une interface qui doit sembler réactive. Le coût reste identique au mode batch. Pour activer le streaming, ajoutez stream=true :
curl -N https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-F file=@meeting.mp3 -F model=gpt-4o-transcribe -F stream=true
# data: {"type":"transcript.text.delta","delta":"When"}
# data: {"type":"transcript.text.delta","delta":" you"} ...
Cache
En pratique, ces modèles ne proposent aucun cache. Les modèles à la minute facturent la durée : répéter une requête n’apporte donc aucune réduction. Nous avons envoyé cinq fois le même extrait à whisper-1 et payé exactement $0.015478 à chaque fois. Les modèles gpt-4o facturés au token n’affichent aucun tarif de cache et n’ont montré que les variations normales entre plusieurs exécutions. Il faut donc dimensionner les coûts à partir du tarif à la minute. Renvoyer le même fichier ne coûte pas moins cher.
Ce qu’il faut vérifier d’abord, et ce qu’il faut tester soi-même
Ce test ne permet pas de déterminer quel modèle sera le plus précis sur vos enregistrements. Il permet en revanche de réduire la liste avant de lancer votre propre évaluation :
- Langues. Vérifiez que le modèle accepte toutes les langues nécessaires et s’il les détecte automatiquement.
seed-asra traité toutes les langues testées, mais uniquement avec un paramètrelanguageexplicite. Sans ce paramètre, les enregistrements dans une langue autre que l’anglais ou le chinois échouent silencieusement. Les six autres modèles détectent automatiquement la langue, ce qui constitue un choix par défaut plus sûr lorsque la langue est mixte ou inconnue. - Streaming. Si la transcription doit être affichée en direct, seuls les modèles
gpt-4odiffusent le résultat token par token. Les modèles facturés à la minute fonctionnent uniquement en batch. - Coût. L’écart est d’environ 8x. Le modèle le moins cher couvrant toutes les langues est
qwen3-asr-flash, à $0.0021. Les modèles Chirp sont les plus chers, etchirp-3est la seule option qui justifie de choisir Chirp plutôt qu’un modèle moins coûteux. Aucun cache ne réduit la facture : le tarif à la minute est bien celui que vous paierez. - Type de modèle. Utilisez un modèle speech-to-text spécialisé, pas un modèle multimodal généraliste. C’est l’outil adapté à une transcription verbatim, et les fournisseurs qui proposent les deux catégories donnent la même recommandation.
Lorsque quelques modèles ont passé ces filtres, il reste à mesurer leur précision sur vos propres données, avec les accents, le bruit et le vocabulaire qui les caractérisent. Vous devrez répondre vous-même à cette question. Aucun benchmark réalisé sur des voix propres ne remplace un test des modèles retenus sur de vrais enregistrements.
Conclusion
Sur des voix propres, scriptées et dans les principales langues, les sept modèles offrent une précision à peu près équivalente. C’est le principal enseignement de ce test : la précision ne permet pas de les départager. Les différences fiables se trouvent ailleurs : le coût varie d’environ 8x, un modèle ne couvre que deux langues sans configuration explicite, et les modèles facturés à la minute ne prennent pas en charge le streaming. Utilisez ces critères pour réduire la liste, pas pour désigner un vainqueur, puis testez les deux ou trois modèles restants sur vos propres enregistrements. Pour la transcription, choisissez aussi un modèle speech-to-text spécialisé plutôt qu’un modèle multimodal généraliste. C’est ce que recommandent les fournisseurs qui développent les deux.
Sources
- OpenAI : guide du speech-to-text
- OpenAI : tarifs de l’API
- Google : compréhension audio avec l’API Gemini, Cloud Speech-to-Text étant recommandé pour la transcription spécialisée
- Google Cloud : modèle de transcription Chirp 3
- BytePlus : présentation de Seed-ASR de ByteDance
Coûts et latences mesurés sur Synthorai le 2026-06-25, avec sept modèles de transcription spécialisés et cinq langues (anglais, mandarin, hindi, espagnol et français), à partir du header x-total-cost-usd et du timing SSE. Les lignes de langue de seed-asr proviennent d’une nouvelle mesure effectuée le 2026-07-04 avec le paramètre language. L’audio a été généré par text-to-speech et était volontairement simple. Les chiffres de précision servent donc à vérifier un niveau minimal, pas à comparer la qualité. Avec des voix réelles, des accents et du bruit, les écarts entre les modèles seraient différents. La latence varie d’une exécution à l’autre. Les tarifs indiqués étaient ceux de la plateforme à cette date. Vérifiez les prix actuels avant de vous y fier.