Coste de una API de voz: 10 minutos cuestan $0.04-$0.57
Contenido
- ¿Cómo funciona un agente de voz y por qué hay dos arquitecturas?
- ¿Cuánto cuesta por minuto un agente de voz?
- ¿Qué tramo domina el coste de la cascada?
- ¿Cuánto cuesta el texto a voz por minuto de audio?
- ¿Cuándo compensa el precio de la API Realtime?
- ¿Cuánto más rápido es voz a voz que una cascada?
- Preguntas frecuentes
Una conversación de 10 minutos con un agente de voz cuesta entre $0.04 y $0.57 en APIs. Casi toda la diferencia depende de dos decisiones: montar el stack por tu cuenta o usar una API de voz a voz, y elegir una gama de conversión de texto a voz. Medimos todos los tramos en un mismo lote y a través de un único gateway: tres modelos de conversión de voz a texto por minuto de audio, seis modelos de texto a voz por minuto de audio sintetizado, un diálogo de ocho turnos con tres LLM (dos de gama flash y uno de frontera) y una sesión en vivo de GPT Realtime facturada por canal. En este artículo combinamos esos tramos para calcular el precio por minuto de cada arquitectura.
TL;DR
- Un stack en cascada (STT + LLM + TTS) cuesta entre $0.0037 y $0.025 por minuto de conversación; gpt-realtime-2.1 dio $0.057 en nuestras mediciones, mientras que la versión mini, con $0.016, queda dentro del rango de la cascada.
- Con un modelo de gama flash, la voz cuesta más que el modelo: 12 veces más en el stack convencional. Con un modelo de frontera, la proporción se invierte.
- La prima de Realtime paga latencia: medimos 1.7-2.1 s de voz a voz, frente a 4.9-7.7 s en los stacks en cascada.
- La facturación de TTS por carácter hace que un minuto de chino hablado cueste entre 3 y 7 veces menos que uno de inglés en todos los modelos medidos.
¿Cómo funciona un agente de voz y por qué hay dos arquitecturas?
Un agente de voz ejecuta un bucle que convierte lo que dice el usuario en una respuesta que escucha por el altavoz. Todos los diseños disponibles siguen una de estas dos formas. La arquitectura en cascada conecta tres APIs especializadas de forma secuencial: un detector de actividad de voz determina que el usuario ha terminado de hablar, el servicio de conversión de voz a texto transcribe la intervención, un LLM genera una respuesta a partir de la transcripción y del historial, y el servicio de texto a voz la convierte de nuevo en audio. Cada tramo se mide y factura por separado. Por eso la cascada resulta barata y permite sustituir componentes: eliges por separado el STT, el modelo y la voz, y pagas tres importes pequeños.
La arquitectura de voz a voz (Realtime) sustituye esos tres tramos por un único modelo que recibe y genera audio directamente mediante WebSocket. (Synthorai lo admite de forma nativa: el gateway ofrece WebSocket en /v1/realtime, y un SDK existente de OpenAI Realtime funciona sin cambios si apunta a nuestro endpoint; consulta la documentación de la API Realtime. Todas las sesiones Realtime de este artículo se ejecutaron a través de esa conexión). No se genera una transcripción en la ruta principal. El modelo percibe el tono y el ritmo en lugar de leer texto, y el historial de la conversación se conserva en el servidor como tokens de audio que se vuelven a enviar al modelo con cada respuesta. Este diseño aporta dos ventajas que una cascada no puede ofrecer por su propia estructura: latencia de voz a voz inferior a 2 segundos e interrupciones naturales, de modo que el usuario puede interrumpir a mitad de una frase y el modelo lo detecta. También cambia la forma de facturar: en lugar de tres contadores planos, se pagan tarifas distintas por el audio de entrada y de salida, los «canales», además de un coste acumulativo por el historial que la caché debe mantener bajo control.
El resto del artículo calcula el precio exacto de ambas opciones: primero cada tramo de la cascada por separado y después el bucle Realtime, canal por canal.
¿Cuánto cuesta por minuto un agente de voz?
Los seis stacks analizados cuestan entre $0.0037 y $0.057 por minuto de conversación, una diferencia de 15 veces. Conviene distinguir las dos unidades utilizadas a continuación: un minuto de conversación es un minuto de duración real de la llamada; un minuto de audio es un minuto de voz efectiva de una de las partes, que es lo que miden STT y TTS. Mantuvimos constante el escenario: usuario y agente se reparten por igual el tiempo de habla, con cuatro intercambios por minuto y frases breves propias de una conversación de soporte. Los tramos de la cascada se facturaron según las duraciones de audio y los tokens medidos; las cifras de Realtime proceden de una sesión real de ocho turnos:
| Stack | Escucha | Habla | Modelo | $/minuto de conversación | Llamada de 10 min |
|---|---|---|---|---|---|
| Cascada económica (qwen3-asr-flash + deepseek-v4-flash-0731 + google-tts-standard) | $0.0010 | $0.0020 | $0.0006 | $0.0037 | $0.04 |
| Cascada convencional (gpt-4o-mini-transcribe + deepseek + tts-1) | $0.0015 | $0.0076 | $0.0006 | $0.0097 | $0.10 |
| Voz a voz, gpt-realtime-2.1-mini | — | — | — | $0.0159 | $0.16 |
| Cascada con modelo SOTA (gpt-4o-mini-transcribe + gpt-5.6 + tts-1) | $0.0015 | $0.0076 | $0.0110 | $0.0200 | $0.20 |
| Cascada prémium (whisper-1 + gemini-3.7-flash + google-tts-chirp3-hd) | $0.0030 | $0.0172 | $0.0050 | $0.0252 | $0.25 |
| Voz a voz, gpt-realtime-2.1 | — | — | — | $0.0573 | $0.57 |
Hay dos posiciones más relevantes que los extremos. La API Realtime principal cuesta 2.3 veces más incluso que una cascada prémium. Su precio no compra una calidad equivalente, sino prestaciones que una cascada no puede ofrecer: unos 2 segundos de latencia de voz a voz en nuestra sesión, interrupciones nativas, y conservación del tono y del ritmo, o prosodia, porque el audio nunca se convierte en texto. La versión mini, en cambio, queda entre las cascadas convencional y prémium. Por tanto, «cascada frente a Realtime» solo es una comparación directa de precio en la gama principal; con mini, la decisión depende de la latencia y del control, no del coste.
También hicimos una comprobación para que la comparación fuera justa, porque las otras tres cascadas usan modelos de gama flash frente al modelo de voz principal de OpenAI. En la fila con modelo SOTA, la cascada utiliza el modelo de texto de frontera del mismo proveedor: gpt-5.6, a $5 por millón de tokens de entrada y $30 por millón de salida. Aun así, la cascada queda en $0.0200 por minuto de conversación, 2.9 veces por debajo de Realtime principal. Incluso con precios de frontera, un turno de texto mueve dos órdenes de magnitud menos tokens caros que un canal de audio. Igualar la calidad añade $0.010 de modelo por minuto, pero no elimina la diferencia entre arquitecturas.
¿Qué tramo domina el coste de la cascada?
La voz, siempre que el modelo sea de gama flash. En el stack convencional, un minuto de conversación gasta $0.0076 en TTS y $0.0006 en el LLM, una diferencia de 12 veces. Incluso en el stack económico, el tramo de habla triplica el coste del modelo. Al cambiar a gpt-5.6, la estructura se invierte: con $0.00274 por intercambio, el modelo pasa a ser el tramo más caro, con $0.0110 por minuto, 1.4 veces el tramo de habla con tts-1. Con modelos flash, el coste del agente de voz se concentra en la voz; con modelos de frontera, se concentra en el modelo. La conversión de voz a texto queda en medio, entre $0.0010 y $0.0030 por minuto de conversación (tarifas por minuto de nuestro análisis de 14 modelos, verificadas de nuevo en este lote: qwen3-asr-flash $0.00198, gpt-4o-mini-transcribe $0.00294 y whisper-1 $0.006 por minuto de audio).
El modelo cuesta casi nada hasta que entra en juego el razonamiento. Nuestro diálogo de soporte de ocho turnos se estabilizó en unos 310 tokens de entrada y 71 de salida por turno con deepseek-v4-flash-0731, o $0.00016 por intercambio. Con gemini-3.7-flash, el mismo diálogo costó $0.00126 por intercambio, 8 veces más. La distribución de tokens explica el motivo: entre 89 y 361 tokens de razonamiento por turno para generar una respuesta de dos frases. Gemini 3.7 Flash no permite desactivar el razonamiento, así que un agente de voz basado en él paga ese recargo en cada intercambio. En los modelos donde se puede desactivar, un turno de voz es justo el tipo de tarea de un solo paso donde hacerlo resulta seguro.
¿Cuánto cuesta el texto a voz por minuto de audio?
Entre $0.004 y $0.034 por minuto sintetizado, una diferencia de 8.4 veces que los precios por carácter ocultan. Todos los modelos siguientes facturan por carácter de entrada. Sintetizamos pasajes fijos en inglés y chino, medimos el audio devuelto y dividimos el coste por su duración:
| Modelo | Precio de lista | EN $/minuto de audio | ZH $/minuto de audio | ZH frente a EN |
|---|---|---|---|---|
| google-tts-standard | $4/M caracteres | $0.0041 | $0.0007 | 0.18x |
| qwen3-tts-instruct-flash | $11.5/M | $0.0098 | $0.0033 | 0.34x |
| tts-1 | $15/M | $0.0151 | $0.0043 | 0.28x |
| google-tts-neural2 | $16/M | $0.0162 | $0.0030 | 0.18x |
| tts-1-hd | $30/M | $0.0303 | $0.0085 | 0.28x |
| google-tts-chirp3-hd | $30/M | $0.0344 | $0.0052 | 0.15x |
La velocidad del habla es la variable oculta. tts-1-hd y chirp3-hd tienen el mismo precio de lista, $30, pero chirp3-hd lee nuestro pasaje en inglés más rápido y produce menos segundos de audio. Por eso cuesta un 13% más por minuto de audio. En el extremo inferior de la tabla, google-tts-standard genera un minuto sintetizado por menos de la mitad que cualquier otro modelo medido. El precio de lista sirve para ordenar los modelos; solo el coste por minuto de audio permite calcular cuánto cuestan realmente.
La magnitud del resultado en chino nos sorprendió: un minuto de chino hablado consume entre 3 y 7 veces menos caracteres facturables que uno de inglés, porque cada carácter contiene mucha más información oral. Con facturación por carácter, el tramo de habla de un agente de voz en chino cuesta entre un 66% y un 85% menos que el mismo agente en inglés. Esta diferencia se suma a las variaciones por idioma en el número de tokens del texto.
¿Cuándo compensa el precio de la API Realtime?
Cuando el bucle de voz a voz de 2 segundos y las interrupciones nativas compensan el coste, porque la versión principal pierde frente a todas nuestras cascadas si solo se compara el precio. Ambas conversiones oficiales de audio se reprodujeron con exactitud en este lote: 30.0 segundos de audio de entrada se facturaron como 300 tokens, 1 token por cada 100 ms, y 3.7 segundos de salida como 74 tokens, 1 por cada 50 ms. Son las mismas tasas que medimos en nuestro estudio de julio. Con los precios de lista de gpt-realtime-2.1, solo escuchar cuesta $0.0192 por minuto y hablar cuesta $0.0768 por minuto, antes de volver a facturar el historial de la conversación, que hace crecer el coste de las sesiones largas.
La caché hace que ese crecimiento sea más moderado de lo que parece. En nuestra sesión de ocho turnos, la entrada aumentó de 72 a 643 tokens por respuesta, pero en el octavo turno 512 de ellos estaban en caché a $0.40 por millón. En el conjunto de la sesión, el 76% de los tokens de entrada se facturó a la tarifa de caché. El total medido fue de $0.0752 para un intercambio de 1.31 minutos, o $0.0573 por minuto de conversación. Merece la pena desglosar una vez la factura por canales: un 66% correspondió al audio de salida, un 17% al audio de entrada nuevo y un 16% al texto. El modelo también genera una representación textual de cada respuesta, facturada a $24 por millón de tokens de salida de texto. En la práctica, alrededor de una sexta parte de una factura «de voz a voz» corresponde a un modelo de texto. Si aplicamos el mismo perfil de tokens medido a las tarifas de mini, el resultado es $0.0159. Esta cifra es más interesante: queda por debajo de la cascada prémium y conserva la latencia y las interrupciones que la arquitectura en cascada no puede igualar por su propia estructura.
El coste restante de Realtime es operativo, no por token: las sesiones terminan obligatoriamente a los 60 minutos y no pueden reanudarse con el historial de audio. Cualquier conversación que supere ese límite vuelve a empezar con la caché vacía. El estudio de julio explica estos mecanismos en detalle.
¿Cuánto más rápido es voz a voz que una cascada?
Entre 2.3 y 4.5 veces en los stacks anteriores, y la diferencia aumenta a medida que la cascada incorpora componentes más sofisticados. Usamos los mismos seis stacks de la tabla de costes y la misma unidad por barra: un turno de conversación, medido desde la solicitud hasta completar la respuesta con una carga realista, una intervención de 5 segundos y una respuesta de dos frases. Las barras de la cascada suman las medianas de tres ejecuciones por tramo:
Las cascadas tardan 4.9 s en el stack económico, 5.6 s en el convencional, 5.7 s con el modelo SOTA y 7.7 s en el prémium. Ambos modelos de voz a voz se mantienen en el mismo intervalo: 1.6-2.1 s para gpt-realtime-2.1-mini durante 4 turnos en vivo y 1.7-2.1 s para gpt-realtime-2.1 durante 8.
Al comparar el gráfico con la tabla de costes, la relación queda clara: en la cascada, el precio y la latencia avanzan en sentidos opuestos. El stack económico es la cascada más barata y también la más rápida. El prémium cuesta 6.8 veces más y tarda 2.8 segundos adicionales, porque sus componentes caros, un modelo que razona y una voz HD, también son lentos. En voz a voz, ambos modelos se mantienen en torno a 2 segundos con independencia de la gama. La versión mini es a la vez más barata que dos cascadas y más rápida que las cuatro.
Los datos también dejan otras tres conclusiones. Primero, el LLM es el cuello de botella de latencia en todas las cascadas, y el razonamiento obligatorio casi duplica el tiempo: gemini-3.7-flash dedica 4.5 segundos a elaborar una respuesta de dos frases, frente a los 2.6 de deepseek y los 2.7 de gpt-5.6. El mismo recargo de razonamiento que multiplica por 8 los tokens también deja al stack prémium en último lugar. Segundo, incluso eligiendo el componente más rápido medido para cada tramo, gpt-4o-mini-transcribe, deepseek y google-tts-standard, el mínimo sigue siendo de 4.1 segundos, más del doble que Realtime. Y eso sin añadir la espera del detector de actividad de voz para confirmar el final de la intervención ni la reproducción del audio. Tercero, las filas de la cascada muestran tiempos secuenciales hasta completar toda la respuesta. Una cascada de producción que envía el streaming del LLM a un TTS también por streaming puede solapar los dos tramos más largos y recortar gran parte de la diferencia. Pero ese solapamiento exige desarrollo y ajuste, mientras que la API Realtime entrega sus 2 segundos desde la primera sesión WebSocket.
¿Dónde se consume realmente el tiempo de un turno en cascada? Sobre todo en las tres solicitudes, no en su contenido. La red pura tiene poco peso: un viaje de ida y vuelta HTTPS con la conexión activa hasta el edge de la API tardó unos 0.09 segundos. Tres tramos en serie suman alrededor de 0.3 segundos de red por turno, más un handshake TLS de 0.2 segundos si la conexión está fría. El coste dominante es el despacho fijo de cada solicitud. Lo aislamos repitiendo los tramos del stack más rápido con cargas casi vacías: una respuesta LLM de un token seguía tardando 2.5 segundos, transcribir un clip de medio segundo llevaba 1.6 segundos y sintetizar dos palabras requería 0.4 segundos. Estos mínimos suman 4.4 segundos, frente a los 4.1 segundos de las cargas completas, una diferencia dentro del margen de medición. Casi todo el tiempo de un turno en cascada es overhead por solicitud. El contenido real, 70 tokens de respuesta en vez de 1 o un clip 10 veces más largo, viaja casi gratis. La consecuencia práctica tiene dos caras: acortar las respuestas de la cascada no la hará más rápida, pero cualquier medida que elimine o solape una solicitud, como encadenar los tramos mediante streaming o mantener conexiones persistentes, ataca el coste real. La API Realtime lleva esa lógica al extremo al mantener un único socket, por lo que cada turno evita iniciar un nuevo ciclo de solicitud.
Preguntas frecuentes
¿Cuál es la forma más barata de ejecutar un agente de voz?
La cascada económica: qwen3-asr-flash para escuchar, deepseek-v4-flash-0731 como modelo y google-tts-standard para hablar. Cuesta $0.0037 por minuto de conversación, unos $0.04 por una llamada de 10 minutos. Es 15 veces más barata que la versión principal de voz a voz; a cambio, se pierde latencia de voz a voz y gestión natural de las interrupciones.
¿GPT Realtime cuesta más que un stack en cascada?
La versión principal, sí: gpt-realtime-2.1 dio $0.0573 por minuto de conversación, 2.3 veces más que nuestra cascada prémium y 15 veces más que la económica. gpt-realtime-2.1-mini no: con $0.0159 por minuto de conversación y el mismo perfil de tokens, queda entre las cascadas convencional y prémium. En la gama mini, la elección depende de la latencia y del control, no del precio.
¿Qué parte de un agente de voz cuesta más?
El texto a voz en todas las cascadas con modelo flash analizadas: entre $0.002 y $0.017 por minuto de conversación, frente a entre $0.0006 y $0.005 para un LLM flash, 12 veces más en el stack convencional. Con un modelo de frontera se invierte la proporción: gpt-5.6 cuesta $0.0110 por minuto, frente a los $0.0076 de tts-1. Dentro de TTS, la elección del modelo produce una diferencia de 8.4 veces por minuto de audio, el mayor margen medido en un solo componente.
¿El idioma de la conversación cambia el coste?
En el tramo de habla, mucho: con facturación por carácter, un minuto de chino hablado cuesta entre 3 y 7 veces menos que uno de inglés en los seis modelos TTS medidos, porque cada carácter transmite más información oral. Las tarifas de voz a texto fueron iguales para ambos idiomas en los tres modelos que volvimos a verificar. En el texto, las diferencias dependen de cómo varía la tokenización por idioma.
Mediciones realizadas el 2026-08-17 a través del gateway de Synthorai, con todos los tramos en un único lote: seis modelos TTS sintetizaron pasajes fijos en inglés y chino, y la duración se obtuvo de los archivos devueltos, con dos ejecuciones por modelo; tres modelos STT procesaron los clips de referencia estándar, calculando el coste por minuto a partir de los headers de facturación; tres LLM, dos de gama flash y uno de frontera, ejecutaron un diálogo de soporte con guion de ocho turnos y registramos el consumo por turno; medimos la latencia de cada tramo, con una intervención de 5 segundos para STT, un turno estable del diálogo para el LLM y una respuesta de dos frases para TTS, n=3 y tiempo hasta completar toda la respuesta; ejecutamos una prueba de mínimos con payloads reducidos en los mismos tramos, una respuesta de un token, un clip de medio segundo y una síntesis de dos palabras, n=3, junto con la medición de ida y vuelta al edge de la API con conexiones activas y frías; y realizamos sesiones en vivo de GPT Realtime, con intervenciones de 5 segundos, ocho turnos en la versión principal y cuatro en mini, facturadas canal por canal mediante los eventos de uso de response.done. El coste de mini se calculó aplicando a sus precios de lista el perfil de tokens medido en la sesión de la versión principal, mientras que su intervalo de latencia se midió en su propia sesión. Los cálculos de las cascadas suponen un reparto equitativo del tiempo de habla y cuatro intercambios por minuto; las tarifas corresponden a los precios de lista del catálogo de modelos en el momento de la medición. seed-tts-2.0 está incorporado, pero se excluyó hasta obtener mediciones estables. Los precios y las velocidades de habla cambian; repite las mediciones antes de decidir una arquitectura.
Artículos relacionados de la misma serie: precios de conversión de voz a texto en 14 modelos, cómo funciona el precio de GPT Realtime, coste en tokens de las imágenes de entrada, precios de generación de vídeo.