🎁 Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.
API de voz a texto: 14 modelos, de $0.002 a $0.016 por minuto

API de voz a texto: 14 modelos, de $0.002 a $0.016 por minuto

Contenido
  1. ¿Cuánto cuesta una API de voz a texto en 2026?
  2. ¿Cómo se convierte la facturación por tokens en un coste por minuto?
  3. ¿Qué es el nivel de ASR chino y por qué no aparece en la mayoría de las comparativas?
  4. ¿Qué modelo conviene elegir para cada carga de trabajo?
  5. Preguntas frecuentes

Una API de voz a texto cuesta entre $0.002 y $0.016 por minuto según las tarifas publicadas. Es una diferencia de 8x para un servicio que, en principio, hace lo mismo. Además, la opción más barata no suele aparecer en las comparativas. Ofrecemos 14 modelos de transcripción tras un único gateway, desde la familia gpt-4o de OpenAI, facturada por tokens, hasta modelos ASR chinos de ByteDance y Alibaba que las comparativas internacionales suelen pasar por alto. Esta página ofrece una visión general de la categoría: cómo funciona cada modalidad de facturación, cuánto cuesta cada modelo por minuto y cómo elegir según el caso de uso en vez de la marca.

TL;DR

  • Las tarifas publicadas por minuto de los 14 modelos van desde $0.002 (seed-asr, paraformer y fun-asr-realtime) hasta $0.016 (Chirp de Google), una diferencia de 8x.
  • Los modelos de transcripción gpt-4o de OpenAI se facturan por tokens, no por minutos. Con el audio de nuestras pruebas, el coste equivalente fue de unos $0.0031/min para mini y $0.0062/min para el modelo completo.
  • El nivel más barato corresponde a los modelos ASR chinos: seed-asr de ByteDance y las familias paraformer, fun-asr y qwen3 de Alibaba tienen tarifas publicadas de $0.002-$0.0021/min e incluyen variantes con streaming.
  • Con voz limpia, la precisión no marca la diferencia. En nuestra prueba con siete modelos, todos los que admitían el idioma registraron un error de ~0% en inglés, español y francés.

¿Cuánto cuesta una API de voz a texto en 2026?

La respuesta más útil es una tabla, porque la modalidad de facturación importa tanto como la tarifa. Los modelos por minuto cobran según la duración, independientemente del contenido. Los modelos facturados por tokens remuestrean el audio y cobran los tokens de entrada y salida. Su coste efectivo por minuto varía ligeramente según la densidad del habla:

ModeloProveedorFacturaciónTarifa publicadaStreaming
seed-asr-bigmodelByteDancepor minuto$0.002/minno
paraformer-realtime-v2Alibabapor minuto$0.002/min
qwen3-asr-flash-realtimeAlibabapor minuto$0.002/min
fun-asr-realtimeAlibabapor minuto$0.002/min
fun-asrAlibabapor minuto$0.0021/minno
fun-asr-flashAlibabapor minuto$0.0021/minno
fun-asr-mtlAlibabapor minuto$0.0021/minno
qwen3-asr-flashAlibabapor minuto$0.0021/minno
gpt-4o-mini-transcribeOpenAIpor token≈$0.0031/min medidotoken a token
whisper-1OpenAIpor minuto$0.006/minno
gpt-4o-transcribeOpenAIpor token≈$0.0062/min medidotoken a token
gpt-4o-transcribe-diarizeOpenAIpor tokentarifas por tokentoken a token
chirp-2Googlepor minuto$0.016/minno
chirp-3Googlepor minuto$0.016/minno

Las tarifas publicadas se actualizan en la página de cada modelo. Las dos cifras de ≈$/min para los modelos gpt-4o corresponden al importe real facturado a través del gateway con nuestro audio de prueba multilingüe, según el estudio de transcripción con siete modelos. Todos los modelos batch de la tabla se pueden invocar con una única API key mediante el mismo endpoint compatible con OpenAI, /v1/audio/transcriptions; comprobamos que también funciona con el modelo de diarización. Las variantes -realtime son modelos con streaming y tienen una interfaz propia, documentada en la página de cada modelo.

¿Cómo se convierte la facturación por tokens en un coste por minuto?

La transcripción facturada por tokens depende del contenido hablado, no del tamaño del archivo. En la práctica, su precio se sitúa en la zona media de la tabla. Los modelos de transcripción gpt-4o remuestrean el audio antes de tokenizarlo. Por eso, un MP3 pesado a 320 kbps y un WAV ligero a 16 kHz con las mismas palabras cuestan casi lo mismo. Comprimir los archivos reduce el almacenamiento, no el gasto de transcripción. Con voz a un ritmo normal, medimos cerca de $0.0031/min para gpt-4o-mini-transcribe y $0.0062/min para gpt-4o-transcribe. Un audio más denso o con más silencios puede desplazar ligeramente esas cifras en uno u otro sentido. Si el presupuesto exige un límite fijo por hora de audio, un modelo facturado por minuto lo ofrece. Con uno facturado por tokens, solo se puede hacer una estimación.

¿Qué es el nivel de ASR chino y por qué no aparece en la mayoría de las comparativas?

Los modelos ASR chinos forman el bloque más barato de la tabla y el que más opciones de streaming ofrece, pero casi ninguna comparativa en inglés los prueba. seed-asr-bigmodel de ByteDance marca el precio mínimo, con $0.002/min. Alibaba ofrece tres familias: paraformer, centrada en streaming; fun-asr, con variantes batch, flash, mtl multilingüe y realtime; y qwen3-asr, con flash y flash-realtime. Todas cuestan $0.002-$0.0021/min. Es un tercio de la tarifa de whisper-1 y una octava parte de la de Chirp.

Nuestras mediciones muestran dos matices. Primero, seed-asr necesita que se indique de antemano el idioma del audio. Es la opción ganadora cuando el idioma se conoce. En cambio, qwen3-asr-flash, a $0.0021, es el modelo más barato que detectó automáticamente todos los idiomas de nuestra prueba. Segundo, barato no significa lento: qwen3-asr-flash procesó nuestros clips en unos 3 segundos, un tiempo comparable al de los modelos de OpenAI. Para cargas de trabajo donde predomina el mandarín, este nivel no solo es más barato: también juega en casa.

¿Qué modelo conviene elegir para cada carga de trabajo?

Primero hay que elegir según la modalidad de facturación y la necesidad de streaming. Con voz limpia, la precisión no permite distinguir entre estos modelos. Esta es la selección por escenario:

EscenarioElecciónMotivo
Transcripción batch, idioma conocidoseed-asr-bigmodelprecio mínimo de $0.002/min; requiere indicar el idioma
Batch, idiomas mixtos o desconocidosqwen3-asr-flashdetección automática más barata, latencia de ~3s
Subtítulos en directo / dictadoparaformer-realtime-v2 o qwen3-asr-flash-realtimestreaming al precio mínimo de $0.002
Streaming de texto parcial con la interfaz de OpenAIgpt-4o-mini-transcribesalida token a token, ≈$0.0031/min
Se necesitan etiquetas de hablantegpt-4o-transcribe-diarizeel único modelo de la selección con diarización
Sustitución directa de whisperwhisper-1referencia de compatibilidad a $0.006/min

Si el caso de uso es una conversación de voz bidireccional en vez de una transcripción, se trata de otro producto con una estructura de costes distinta. Consulta nuestro estudio de precios de GPT Realtime para ver los costes de voz a voz.

Preguntas frecuentes

¿Cuánto cuesta la API de Whisper?

La tarifa publicada de whisper-1 es de $0.006 por minuto de audio y se factura únicamente por duración. Un archivo de una hora cuesta $0.36, independientemente del formato o el bitrate. Repetir contenido no genera descuentos: enviamos el mismo clip cinco veces y pagamos lo mismo en cada ocasión. La mitad de la tabla ya ofrece precios inferiores. El nivel de ASR chino, a $0.002-$0.0021/min, cuesta un tercio que whisper, mientras que gpt-4o-mini-transcribe registró aproximadamente la mitad.

¿Un modelo de voz a texto más caro ofrece mayor precisión?

No con voz limpia. En nuestra prueba con siete modelos, todos los que admitían el idioma registraron un error de aproximadamente el 0% en inglés, español y francés. Las diferencias relevantes están en el coste, el streaming, la cobertura de idiomas y funciones como la diarización. Para audio difícil, con acentos, ruido o alternancia entre idiomas, conviene hacer una prueba con muestras propias. El estudio de transcripción muestra dónde aparecieron los primeros problemas en nuestra prueba: mandarín e hindi.

¿Qué API de voz a texto admiten streaming?

Hay dos modalidades. Los modelos de transcripción gpt-4o envían texto token a token mediante la interfaz de la API de OpenAI. La familia realtime de Alibaba (paraformer-realtime-v2, qwen3-asr-flash-realtime y fun-asr-realtime) ofrece streaming con tarifas por minuto desde $0.002/min. whisper-1, seed-asr y los modelos Chirp solo devuelven la transcripción completa.

Los 14 modelos funcionan tras el mismo endpoint del gateway y comparten un sistema de facturación unificado. Las tarifas publicadas actuales de todos ellos están en la página de modelos. La comparativa de costes de transcripción incluye las mediciones de siete modelos, con latencia y precisión.

← Volver al blog