🎁 Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.
API de transcription audio : 14 modèles, de $0.002 à $0.016 la minute

API de transcription audio : 14 modèles, de $0.002 à $0.016 la minute

Sommaire
  1. Combien coûte une API de transcription audio en 2026 ?
  2. Comment convertir une facturation au token en coût à la minute ?
  3. Que proposent les modèles ASR chinois, et pourquoi sont-ils absents de la plupart des comparatifs ?
  4. Quel modèle choisir pour votre charge de travail ?
  5. FAQ

Une API de transcription audio coûte entre $0.002 et $0.016 la minute au tarif catalogue. Le prix varie donc du simple au huituple pour un service qui semble identique, et les offres les moins chères sont rarement celles mises en avant dans les comparatifs. Notre passerelle donne accès à 14 modèles de transcription, de la famille gpt-4o d’OpenAI facturée au token aux modèles ASR chinois de ByteDance et Alibaba, régulièrement ignorés par les comparatifs internationaux. Cette page dresse un état des lieux du marché : modes de facturation, tarifs à la minute de chaque modèle et critères de choix selon le cas d’usage plutôt que la marque.

TL;DR

  • Les tarifs catalogue à la minute des 14 modèles vont de $0.002 (seed-asr, paraformer, fun-asr-realtime) à $0.016 (Chirp de Google), soit un écart de 1 à 8.
  • Les modèles de transcription gpt-4o d’OpenAI sont facturés au token et non à la minute. Sur les fichiers audio de notre test, leur coût effectif était d’environ $0.0031/min pour le mini et $0.0062/min pour le modèle complet.
  • Les modèles ASR chinois constituent l’offre la moins chère : seed-asr de ByteDance ainsi que les familles paraformer, fun-asr et qwen3 d’Alibaba sont proposés entre $0.002 et $0.0021/min, avec des variantes streaming.
  • Sur de l’audio clair, la précision ne permet pas de les départager. Dans notre test portant sur sept modèles, le taux d’erreur était d’environ 0 % en anglais, en espagnol et en français pour tous les modèles prenant en charge la langue concernée.

Combien coûte une API de transcription audio en 2026 ?

Un tableau donne la réponse la plus juste, car le mode de facturation compte autant que le tarif. Les modèles facturés à la minute prennent uniquement en compte la durée. Ceux facturés au token rééchantillonnent l’audio, puis facturent les tokens d’entrée et de sortie. Leur coût effectif à la minute varie donc légèrement selon la densité de la parole :

ModèleFournisseurFacturationTarif catalogueStreaming
seed-asr-bigmodelByteDanceà la minute$0.002/minnon
paraformer-realtime-v2Alibabaà la minute$0.002/minoui
qwen3-asr-flash-realtimeAlibabaà la minute$0.002/minoui
fun-asr-realtimeAlibabaà la minute$0.002/minoui
fun-asrAlibabaà la minute$0.0021/minnon
fun-asr-flashAlibabaà la minute$0.0021/minnon
fun-asr-mtlAlibabaà la minute$0.0021/minnon
qwen3-asr-flashAlibabaà la minute$0.0021/minnon
gpt-4o-mini-transcribeOpenAIau token≈$0.0031/min mesurétoken par token
whisper-1OpenAIà la minute$0.006/minnon
gpt-4o-transcribeOpenAIau token≈$0.0062/min mesurétoken par token
gpt-4o-transcribe-diarizeOpenAIau tokentarifs au tokentoken par token
chirp-2Googleà la minute$0.016/minnon
chirp-3Googleà la minute$0.016/minnon

Les tarifs catalogue sont disponibles en temps réel sur la page de chaque modèle. Pour les deux modèles gpt-4o, les valeurs ≈$/min correspondent au montant réellement facturé par la passerelle avec les fichiers audio multilingues de notre étude comparative de sept modèles de transcription. Tous les modèles batch du tableau utilisent le même endpoint compatible OpenAI /v1/audio/transcriptions et une seule clé API. Nous avons vérifié que le modèle de diarisation est également pris en charge. Les variantes -realtime sont des modèles streaming dotés de leur propre interface, documentée sur la page de chaque modèle.

Comment convertir une facturation au token en coût à la minute ?

Le coût d’une transcription facturée au token dépend du contenu parlé, pas de la taille du fichier. En pratique, ces modèles se situent au milieu de la fourchette tarifaire. Les modèles de transcription gpt-4o rééchantillonnent l’audio avant la tokenisation. Un MP3 lourd à 320 kbps et un WAV léger à 16 kHz contenant les mêmes paroles coûtent donc à peu près le même prix. Compresser les fichiers réduit le stockage nécessaire, pas le coût de transcription. Avec un débit de parole normal, nous avons mesuré environ $0.0031/min pour gpt-4o-mini-transcribe et $0.0062/min pour gpt-4o-transcribe. Un audio plus dense ou plus silencieux peut faire légèrement varier ces montants dans un sens ou dans l’autre. Pour fixer un plafond strict par heure d’audio, choisissez un modèle facturé à la minute. Avec un modèle facturé au token, vous n’obtiendrez qu’une estimation.

Que proposent les modèles ASR chinois, et pourquoi sont-ils absents de la plupart des comparatifs ?

Les modèles ASR chinois forment à la fois le groupe le moins cher et celui qui offre le plus de possibilités en streaming. Ils sont pourtant rarement testés dans les comparatifs anglophones. seed-asr-bigmodel de ByteDance affiche le tarif le plus bas, à $0.002/min. Alibaba propose trois familles : paraformer, pensée avant tout pour le streaming ; fun-asr, disponible en versions batch, flash, multilingue mtl et temps réel ; et qwen3-asr, décliné en flash et flash-realtime. Toutes coûtent entre $0.002 et $0.0021/min. C’est trois fois moins que whisper-1 et huit fois moins que Chirp.

Nos mesures font ressortir deux réserves. D’abord, seed-asr doit connaître la langue de l’audio avant le traitement. C’est le meilleur choix lorsque la langue est connue, tandis que qwen3-asr-flash, à $0.0021, est le modèle le moins cher ayant détecté automatiquement toutes les langues de notre test. Ensuite, un prix bas n’implique pas une latence élevée : qwen3-asr-flash a traité nos extraits en environ 3 secondes, soit un résultat comparable aux modèles OpenAI. Pour les charges de travail majoritairement en mandarin, cette offre n’est pas seulement moins chère : elle a été conçue sur son marché principal.

Quel modèle choisir pour votre charge de travail ?

Commencez par le mode de facturation et le besoin de streaming. Sur de l’audio clair, la précision ne permettra pas de départager ces modèles. Voici une sélection par scénario :

ScénarioChoixPourquoi
Transcription batch, langue connueseed-asr-bigmodeltarif minimal de $0.002/min ; la langue doit être indiquée
Batch, langues multiples ou inconnuesqwen3-asr-flashdétection automatique la moins chère, latence d’environ 3 s
Sous-titrage en direct / dictéeparaformer-realtime-v2 ou qwen3-asr-flash-realtimestreaming au tarif minimal de $0.002
Streaming de texte partiel au format OpenAIgpt-4o-mini-transcribesortie token par token, ≈$0.0031/min
Identification des locuteurs nécessairegpt-4o-transcribe-diarizeseul modèle de la sélection doté de la diarisation
Remplacement direct de whisperwhisper-1modèle de référence pour la compatibilité à $0.006/min

Une conversation vocale bidirectionnelle n’est pas un cas de transcription. Il s’agit d’un autre produit, avec une structure de coûts différente. Consultez notre étude des tarifs de GPT Realtime pour connaître les coûts de la conversion parole-parole.

FAQ

Combien coûte l’API Whisper ?

whisper-1 est proposé à $0.006 par minute d’audio et seule la durée est facturée. Un fichier d’une heure coûte $0.36, quels que soient son format et son débit. Répéter une requête ne donne droit à aucune remise : nous avons envoyé cinq fois le même extrait et payé le même prix à chaque fois. La moitié des modèles du tableau sont désormais moins chers. Les modèles ASR chinois, à $0.002-$0.0021/min, coûtent trois fois moins que whisper, tandis que le coût mesuré de gpt-4o-mini-transcribe est environ deux fois inférieur.

Un modèle de transcription audio plus cher est-il plus précis ?

Pas sur de l’audio clair. Dans notre test portant sur sept modèles, tous ceux qui prenaient en charge la langue concernée ont obtenu un taux d’erreur proche de 0 % en anglais, en espagnol et en français. Les différences pertinentes se situent au niveau du coût, du streaming, des langues prises en charge et de fonctions comme la diarisation. Pour les fichiers difficiles, avec des accents, du bruit ou une alternance entre plusieurs langues, testez vos propres échantillons. Notre étude sur la transcription montre où les premiers écarts apparaissent, à savoir le mandarin et l’hindi dans notre test.

Quelles API de transcription audio prennent en charge le streaming ?

Deux approches existent. Les modèles de transcription gpt-4o diffusent le texte token par token avec l’interface API d’OpenAI. Chez Alibaba, les modèles temps réel paraformer-realtime-v2, qwen3-asr-flash-realtime et fun-asr-realtime diffusent les résultats en streaming avec une facturation à la minute à partir de $0.002/min. whisper-1, seed-asr et les modèles Chirp renvoient uniquement la transcription complète.

Les 14 modèles sont accessibles via le même endpoint de passerelle et une facturation unifiée. Les tarifs catalogue à jour de chaque modèle figurent sur la page des modèles. Le comparatif du coût de transcription présente les mesures effectuées sur sept modèles, latence et précision comprises.

← Retour au blog