🎁 Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.
Coste de las API de transcripción: 7 modelos con el mismo audio

Coste de las API de transcripción: 7 modelos con el mismo audio

Contenido
  1. Qué mide esta prueba y qué no
  2. ASR dedicado, no multimodal
  3. Cómo se factura la transcripción
  4. Coste
  5. Precisión y cobertura de idiomas
  6. Salida en streaming
  7. Caché
  8. Qué revisar primero y qué debes probar por tu cuenta
  9. Conclusión
  10. Fuentes

Synthorai ya permite transcribir audio con siete modelos dedicados de conversión de voz a texto detrás de un único endpoint compatible con OpenAI.

Ese endpoint oculta bastante complejidad, porque las interfaces nativas de estos modelos apenas se parecen entre sí. whisper-1 recibe un archivo mediante una subida multipart y devuelve {text}. gpt-4o-transcribe utiliza la misma subida, pero añade el uso de tokens. seed-asr de ByteDance utiliza el protocolo AUC de BytePlus, qwen3-asr-flash de Alibaba tiene el suyo y los modelos chirp de Google son reconocedores de Cloud Speech-to-Text a los que se accede mediante OAuth.

Distintos endpoints, mecanismos de autenticación y formatos de respuesta. Cada modelo exige una integración adicional. Con el gateway basta una llamada compatible con OpenAI: puedes sustituir gpt-4o-mini-transcribe por seed-asr-bigmodel o chirp-3 sin cambiar nada más en el código.

TL;DR

  • El coste de transcripción varía 8x entre los siete modelos dedicados: desde $0.0020 por minuto de audio con seed-asr-bigmodel hasta $0.0164 con los modelos chirp (mediciones del 2026-06-25).
  • seed-asr no detecta el idioma automáticamente: si no se define language, el audio que no esté en inglés o chino devuelve HTTP 200 con texto vacío o romanizado, y aun así se factura.
  • qwen3-asr-flash, a $0.0021 por minuto, es el modelo más barato que detecta automáticamente todos los idiomas probados.
  • Solo los modelos de transcripción gpt-4o hacen streaming token a token; los modelos con precio por minuto solo funcionan por lotes.
  • Todos los modelos obtuvieron alrededor de un 0% de error con voz limpia en inglés, español y francés: la precisión no es el criterio que los diferencia.

La llamada utiliza el endpoint de transcripción compatible con OpenAI, por lo que puedes usarlo directamente si ya trabajas con Whisper:

curl https://synthorai.io/v1/audio/transcriptions \
  -H "Authorization: Bearer $SYNTHORAI_API_KEY" \
  -F file=@meeting.mp3 \
  -F model=gpt-4o-mini-transcribe
from openai import OpenAI

client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")

with open("meeting.mp3", "rb") as f:
    result = client.audio.transcriptions.create(model="gpt-4o-mini-transcribe", file=f)

print(result.text)

La transcripción se devuelve en text, y el coste facturado aparece en el header de respuesta x-total-cost-usd.

Probamos los siete modelos con la misma prueba sencilla. El diseño de esa prueba condiciona todas las cifras que aparecen a continuación.


Qué mide esta prueba y qué no

Generamos pasajes cotidianos sin nombres propios —una mañana, el tiempo, una visita al mercado— con una voz estándar de texto a voz en cada uno de los cinco idiomas más hablados del mundo. Después transcribimos cada clip con los siete modelos. Cada clip dura entre 12 y 15 segundos y contiene unas 40 palabras pronunciadas a un ritmo normal, sin silencios largos. El audio está codificado como WAV PCM mono de 16 bits a 16 kHz (256 kbps, unos 2 MB por minuto). El texto sirve como referencia exacta y las duraciones también son exactas.

Es un caso deliberadamente sencillo: audio limpio y preparado, con un solo hablante, sin acentos, ruido ni jerga. Por eso resulta útil para medir aspectos que no dependen de la dificultad del audio. Permite comparar el coste, la latencia, los idiomas que acepta cada modelo y si admite streaming. Esos datos son estables.

No es un benchmark de calidad. Las grabaciones reales con acentos, ruido de fondo, vocabulario especializado, hablantes solapados y una hora de duración separan a estos modelos de formas que el audio limpio no permite observar. Nada de lo que aparece aquí predice ese comportamiento. Las cifras de precisión deben interpretarse como una comprobación del mínimo esperado, no como una clasificación. Los resultados de coste, cobertura y streaming sí sirven como referencia de base.

ASR dedicado, no multimodal

Los siete modelos son sistemas dedicados de conversión de voz a texto: whisper-1, gpt-4o-transcribe y gpt-4o-mini-transcribe de OpenAI; seed-asr-bigmodel de ByteDance; qwen3-asr-flash de Alibaba; y chirp-2 y chirp-3 de Google.

El gateway también permite utilizar el endpoint de transcripción con un modelo multimodal generalista como Gemini, que puede transcribir como parte de su capacidad para comprender audio. No los incluimos y tampoco los elegiríamos para transcribir. Google hace la misma distinción en su catálogo: su guía de audio de Gemini presenta el modelo como una herramienta para describir, resumir o responder preguntas sobre un audio, pero remite a otro producto para obtener la transcripción: «para modelos dedicados de conversión de voz a texto con soporte de transcripción en tiempo real, debes utilizar la API Cloud Speech-to-Text de Google» (los modelos Chirp). Un modelo multimodal puede generar una transcripción, pero está diseñado para comprender el audio, no para reproducir exactamente lo que se ha dicho. Además, se accede a él mediante una llamada generateContent de tipo chat, no mediante una API de transcripción. Para una transcripción literal, la herramienta adecuada es un modelo dedicado. El proveedor que ofrece ambos tipos de modelo recomienda lo mismo.

Hay tres formas de enviar el audio:

  • Archivo de entrada, respuesta por lotes: se sube una grabación completa y se obtiene toda la transcripción en una única respuesta. Todos los modelos lo admiten.
  • Archivo de entrada, texto de salida en streaming: se sube el mismo archivo, pero la transcripción se devuelve mediante SSE conforme se genera. Algunos modelos lo admiten; otros solo funcionan por lotes.
  • Audio de entrada en streaming, texto de salida en streaming: reconocimiento en tiempo real de un micrófono o una llamada. Está en desarrollo y todavía no está disponible, por lo que todo lo que aparece a continuación corresponde a los dos primeros modos.

Cómo se factura la transcripción

Hay dos modalidades de facturación. Por minuto de audio (whisper-1, seed-asr, qwen3-asr-flash y los modelos Chirp): se paga por la duración real de la grabación, independientemente de su contenido. Por token (los modelos gpt-4o): el audio se tokeniza a una tasa fija y se cobran esos tokens de entrada más los tokens de salida de la transcripción. Por eso, el silencio cuesta menos que un audio con habla continua.

La modalidad por token tiene una particularidad: el precio de entrada publicado corresponde al texto, pero el audio se factura a una tarifa superior (gpt-4o-mini-transcribe indica $1.25/M para la entrada, pero factura el audio a $3/M). Si estimas el coste con la tarifa de texto, te quedarás corto. El gateway devuelve el importe real en el header x-total-cost-usd; es mejor leerlo directamente que calcularlo a partir de una página de precios.

Coste

La prueba permite medir este apartado con precisión, y también es donde más diferencias aparecen. Coste por minuto según el header de facturación (las tarifas actuales de todos los modelos disponibles en el gateway están en la página de modelos):

ModeloCoste/minLatenciaStreaming
seed-asr-bigmodel$0.0020≈10sno
qwen3-asr-flash$0.0021≈3sno
gpt-4o-mini-transcribe$0.0031≈3stoken a token
whisper-1$0.0060≈4sno
gpt-4o-transcribe$0.0062≈2stoken a token
chirp-2$0.0164≈3sno
chirp-3$0.0164≈4sno

La diferencia es de unas 8x: desde los $0.0020 por minuto de seed-asr hasta los $0.0164 de los modelos Chirp. El modelo más barato, seed-asr, necesita que se indique el idioma del audio, como veremos más adelante. Es la mejor opción cuando se conoce el idioma de antemano. Para audio en varios idiomas o de idioma desconocido, la opción más barata que no requiere configuración es qwen3-asr-flash, a $0.0021. Los modelos Chirp son, con diferencia, los más caros. Si necesitas usar Chirp, conviene elegir chirp-3: cuesta lo mismo y ofrece una velocidad similar a chirp-2, pero transcribe mucho mejor el mandarín, como muestra la tabla de precisión.

La variación de estas cifras con tus propios archivos depende del modelo de facturación. Los modelos con precio por minuto (whisper-1, seed-asr, qwen3-asr-flash y los Chirp) solo facturan según la duración, por lo que la tarifa se puede extrapolar directamente: diez minutos de audio cuestan diez veces la cifra por minuto, sea cual sea el formato o el contenido.

En los modelos con facturación por token (las filas de gpt-4o), el coste de entrada aumenta con la duración, no con el tamaño del archivo, porque el proveedor remuestrea el audio antes de tokenizarlo. Un MP3 de 320 kbps y nuestro WAV ligero de 16 kHz cuestan aproximadamente lo mismo al tokenizar las mismas palabras. Comprimir los archivos reduce el almacenamiento, no el gasto de transcripción. Lo que sí afecta a una factura por tokens es cuánto se habla realmente: nuestros clips tienen un ritmo normal y no contienen silencios. Un audio con más o menos densidad de habla puede costar algo más o menos por los tokens de salida. En todos los casos, el header x-total-cost-usd contiene el importe real.

Precisión y cobertura de idiomas

En inglés, español y francés, todos los modelos que aceptan el idioma obtuvieron alrededor de un 0% de error. Ese es el mínimo esperado y todos lo cumplen. Incluso en una prueba tan sencilla empiezan a aparecer diferencias en mandarín e hindi, pero solo sirven para orientar tus propias pruebas, no para emitir un veredicto:

ModeloMandarín (CER)Hindi (WER)Cobertura
seed-asr-bigmodel0%9%los cinco (requiere language explícito)
qwen3-asr-flash0%15%los cinco
gpt-4o-mini-transcribe0%4%los cinco
whisper-10%22%los cinco
gpt-4o-transcribe0%13%los cinco
chirp-216%15%los cinco
chirp-32%15%los cinco

El dato más importante no es la cobertura, sino la detección. seed-asr transcribió los cinco idiomas cuando enviamos el parámetro language, y también japonés, alemán, italiano y coreano en una prueba posterior. Lo que no hace es detectar el idioma por sí solo: si se omite language, cualquier idioma que no sea inglés o chino devuelve una cadena vacía o texto romanizado sin sentido, con estado 200 y sin ningún error. Los otros seis modelos detectan el idioma automáticamente. Ese fallo silencioso es el resultado realmente relevante: un modelo que falla de forma explícita resulta molesto; uno que falla sin avisar provoca un incidente en producción.

La variación en hindi y el problema con mandarín (chirp-2 obtiene un 16%, algo que chirp-3 corrige) indican que conviene probar esos modelos con los idiomas más difíciles antes de confiar en ellos, no que uno sea mejor que otro. Las cifras absolutas están distorsionadas por la voz sintética y el método de evaluación, y cambian de una ejecución a otra. La conclusión razonable es que, con voz limpia en los idiomas principales, la precisión no diferencia a estos modelos. Esta prueba no permite elegir entre ellos por ese criterio.

Salida en streaming

La capacidad de devolver la transcripción en streaming es una cuestión funcional, no de calidad, y divide claramente los modelos. Los que se facturan por minuto (whisper-1, seed-asr, qwen3-asr-flash y los dos Chirp) solo funcionan por lotes; el gateway devuelve un 400 si se solicita streaming. Los modelos gpt-4o transmiten token a token: gpt-4o-transcribe devuelve las primeras palabras en aproximadamente un segundo y completa el resto después, justo lo que necesita una interfaz con sensación de tiempo real. El coste no cambia respecto al modo por lotes. Para activar el streaming, añade stream=true:

curl -N https://synthorai.io/v1/audio/transcriptions \
  -H "Authorization: Bearer $SYNTHORAI_API_KEY" \
  -F file=@meeting.mp3 -F model=gpt-4o-transcribe -F stream=true
# data: {"type":"transcript.text.delta","delta":"When"}
# data: {"type":"transcript.text.delta","delta":" you"} ...

Caché

En la práctica, estos modelos no utilizan caché. Los que cobran por minuto facturan según la duración, por lo que repetir un audio no ofrece ningún descuento: enviamos el mismo clip a whisper-1 cinco veces y pagamos exactamente $0.015478 en cada ejecución. Los modelos gpt-4o, facturados por token, no publican ninguna tarifa de caché y las repeticiones solo mostraron la variación normal entre ejecuciones. Planifica los costes a partir de la tarifa por minuto; reenviar el mismo archivo no sale más barato.

Qué revisar primero y qué debes probar por tu cuenta

Esta prueba no puede decirte qué modelo ofrece mayor precisión con tus grabaciones. Sí permite descartar opciones antes de ejecutar tu propia evaluación:

  • Idiomas. Comprueba que el modelo admite todos los idiomas que necesitas y si los detecta por sí solo. seed-asr procesó todos los idiomas probados, pero únicamente con un parámetro language explícito; sin él, el audio que no esté en inglés o chino falla de forma silenciosa. Los otros seis modelos detectan el idioma automáticamente, una opción predeterminada más segura para audio mixto o de idioma desconocido.
  • Streaming. Si necesitas una transcripción en directo, solo los modelos gpt-4o transmiten token a token; los modelos con precio por minuto solo funcionan por lotes.
  • Coste. La diferencia es de unas 8x. El modelo más barato con cobertura para todos los idiomas es qwen3-asr-flash, a $0.0021. Los Chirp son los más caros, y chirp-3 es el único motivo para elegir Chirp frente a modelos más baratos. No hay caché que permita reducir el gasto, así que pagarás la tarifa por minuto.
  • Tipo de modelo. Utiliza un modelo dedicado de conversión de voz a texto, no uno multimodal generalista. Es la herramienta adecuada para la transcripción literal, y los proveedores que ofrecen ambos tipos recomiendan lo mismo.

Cuando varios modelos cumplan esos requisitos, queda una pregunta: cuál ofrece mayor precisión con tu propio audio, incluidos sus acentos, ruido y vocabulario. Esa respuesta solo puedes obtenerla mediante tus propias pruebas. Ningún benchmark de voz limpia sustituye a una evaluación de los modelos finalistas con grabaciones reales.

Conclusión

Con voz limpia y preparada en los principales idiomas, los siete modelos ofrecen una precisión similar. Esa es la conclusión más útil de la prueba: la precisión no es el criterio para elegir. Los datos que sí quedan claros, y donde realmente hay diferencias, son los básicos: el coste varía unas 8x, un modelo solo cubre dos idiomas sin configuración explícita y los modelos con precio por minuto no admiten streaming. Utiliza estos criterios para reducir las opciones, no para declarar un ganador, y después prueba los dos o tres modelos finalistas con tu propio audio. Para la transcripción literal, elige además un modelo dedicado de conversión de voz a texto en lugar de uno multimodal generalista, tal como recomiendan los proveedores que desarrollan ambos.


Fuentes

Costes y latencias medidos en Synthorai el 2026-06-25 con siete modelos dedicados de transcripción y cinco idiomas (inglés, mandarín, hindi, español y francés), mediante el header x-total-cost-usd y la temporización de SSE. Las filas de idiomas de seed-asr corresponden a una nueva medición realizada el 2026-07-04 con el parámetro language definido. El audio se generó mediante texto a voz y era deliberadamente sencillo, por lo que las cifras de precisión son una comprobación del mínimo esperado, no un benchmark de calidad; la voz real con acentos y ruido diferenciaría a estos modelos de otra forma. La latencia varía entre ejecuciones. Los precios indicados corresponden a las tarifas de esta plataforma en esa fecha. Comprueba los precios actuales antes de utilizarlos como referencia.

← Volver al blog