Custo de API para agente de voz: chamada de 10 min por $0.04–$0.57
Conteúdo
- Como funciona um agente de voz e por que existem duas arquiteturas?
- Quanto custa um agente de voz por minuto?
- Qual trecho da cascata mais pesa na conta?
- Quanto custa text-to-speech por minuto de áudio?
- Quando o preço da API realtime compensa?
- Quanto mais rápido é o voz a voz em relação à cascata?
- Perguntas frequentes
Uma conversa de 10 minutos com um agente de voz custa entre $0.04 e $0.57 em APIs. Quase toda essa diferença vem de duas decisões: montar o stack por conta própria ou usar uma API de voz a voz, e qual categoria de text-to-speech escolher. Medimos todos os trechos pelo mesmo gateway, no mesmo lote: três modelos de reconhecimento de fala cobrados por minuto de áudio, seis modelos de text-to-speech cobrados pelo minuto de áudio efetivamente sintetizado, um diálogo de oito turnos com três LLMs (dois modelos flash e um frontier) e uma sessão ao vivo do GPT Realtime faturada por lane. A seguir, combinamos esses trechos para calcular o preço por minuto de cada arquitetura.
TL;DR
- Um stack em cascata (STT + LLM + TTS) custa de $0.0037 a $0.025 por minuto de conversa; o gpt-realtime-2.1 ficou em $0.057, enquanto o mini, a $0.016, entra na faixa da cascata.
- Com um modelo flash como cérebro, a voz custa mais do que o próprio cérebro: 12x mais na configuração intermediária. Com um modelo frontier, essa relação se inverte.
- O adicional do realtime paga pela latência: medimos 1.7-2.1 s de voz a voz, contra 4.9-7.7 s nas configurações em cascata.
- A cobrança de TTS por caractere torna o chinês falado de 3 a 7x mais barato por minuto de áudio do que o inglês em todos os modelos medidos.
Como funciona um agente de voz e por que existem duas arquiteturas?
Um agente de voz transforma continuamente a fala do usuário em uma resposta reproduzida no ouvido dele. Todas as soluções do mercado seguem uma de duas arquiteturas. A cascata conecta três APIs especializadas em sequência: um detector de atividade de voz decide quando o usuário terminou de falar, o reconhecimento de fala transcreve o enunciado, uma LLM produz uma resposta usando a transcrição e o histórico da conversa, e o text-to-speech converte essa resposta novamente em áudio. Cada trecho é um serviço separado e cobrado individualmente. Por isso, a cascata é barata e permite trocar componentes: você escolhe STT, cérebro e voz de forma independente e recebe três cobranças pequenas.
A arquitetura voz a voz (realtime) substitui os três trechos por um único modelo, que recebe e produz áudio diretamente via WebSocket. (A Synthorai oferece esse fluxo de forma nativa: o gateway usa WebSocket em /v1/realtime, e um SDK existente do OpenAI Realtime funciona sem alterações quando configurado com nosso endpoint; consulte a documentação da API realtime. Todas as sessões realtime deste artigo passaram por essa conexão.) Não há transcrição no caminho principal. O modelo ouve tom e ritmo, não uma transcrição, e o histórico da conversa fica no servidor como tokens de áudio, reenviados ao modelo a cada resposta. Essa arquitetura oferece duas coisas que uma cascata não consegue entregar por sua própria estrutura: latência de voz a voz abaixo de 2 segundos e barge-in natural, permitindo que o usuário interrompa no meio de uma frase e seja ouvido pelo modelo. A forma de cobrança também muda: em vez de três medidores fixos, há tarifas separadas para entrada e saída de áudio, as “lanes”, além de uma cobrança cumulativa pelo histórico, que depende do cache para não crescer demais.
O restante do artigo calcula o custo dessas duas arquiteturas: primeiro, cada trecho da cascata em seu próprio medidor; depois, o loop realtime lane por lane.
Quanto custa um agente de voz por minuto?
Nas seis configurações avaliadas, o custo ficou entre $0.0037 e $0.057 por minuto de conversa, uma diferença de 15x. É preciso separar duas unidades: minuto de conversa é um minuto de duração total da chamada; minuto de áudio é um minuto de fala efetiva de um dos lados, que é a unidade cobrada por STT e TTS. Mantivemos o mesmo cenário em todos os testes: tempo de fala dividido igualmente entre usuário e agente, quatro interações por minuto e enunciados curtos, típicos de suporte. Os trechos da cascata foram cobrados pelas durações de áudio e contagens de tokens medidas; os números de realtime vieram de uma sessão ao vivo de oito turnos:
| Configuração | Escuta | Fala | Cérebro | $/minuto de conversa | Chamada de 10 min |
|---|---|---|---|---|---|
| Cascata, econômica (qwen3-asr-flash + deepseek-v4-flash-0731 + google-tts-standard) | $0.0010 | $0.0020 | $0.0006 | $0.0037 | $0.04 |
| Cascata, intermediária (gpt-4o-mini-transcribe + deepseek + tts-1) | $0.0015 | $0.0076 | $0.0006 | $0.0097 | $0.10 |
| Voz a voz, gpt-realtime-2.1-mini | — | — | — | $0.0159 | $0.16 |
| Cascata, cérebro SOTA (gpt-4o-mini-transcribe + gpt-5.6 + tts-1) | $0.0015 | $0.0076 | $0.0110 | $0.0200 | $0.20 |
| Cascata, premium (whisper-1 + gemini-3.7-flash + google-tts-chirp3-hd) | $0.0030 | $0.0172 | $0.0050 | $0.0252 | $0.25 |
| Voz a voz, gpt-realtime-2.1 | — | — | — | $0.0573 | $0.57 |
Duas posições na tabela são mais relevantes do que os extremos. A API realtime principal custa 2.3x mais até do que uma cascata premium. Esse adicional não compra apenas paridade de qualidade, mas recursos que a cascata não consegue oferecer: latência de voz a voz próxima de 2 segundos em nossa sessão, barge-in nativo e preservação de tom e ritmo, ou prosódia, porque o áudio nunca é convertido em texto. O mini, por outro lado, fica entre as cascatas intermediária e premium. Portanto, “cascata vs realtime” só é uma comparação efetiva de preço no tier principal; no mini, a decisão envolve latência e controle, não custo.
Também fizemos uma comparação equivalente, já que as outras três cascatas usam modelos flash contra o modelo de voz principal da OpenAI. Na linha com cérebro SOTA, usamos o modelo de texto frontier do mesmo fornecedor, o gpt-5.6, a $5 de entrada e $30 de saída por milhão. Mesmo assim, a cascata fica em $0.0200 por minuto de conversa, 2.9x abaixo do realtime principal. Isso acontece porque um turno de texto, mesmo com preços de modelo frontier, movimenta duas ordens de grandeza menos tokens caros do que uma lane de áudio. A paridade de qualidade custa $0.010 de cérebro por minuto, mas não elimina a diferença estrutural entre as arquiteturas.
Qual trecho da cascata mais pesa na conta?
A voz, desde que o cérebro seja um modelo flash. Na configuração intermediária, um minuto de conversa gasta $0.0076 em TTS e $0.0006 na LLM, uma diferença de 12x. Mesmo na configuração econômica, o trecho de fala custa o triplo do cérebro. Ao trocar o cérebro pelo gpt-5.6, a estrutura se inverte: a $0.00274 por interação, o cérebro passa a ser o maior trecho, com $0.0110 por minuto, 1.4x o custo de fala do tts-1. Com modelos flash, o custo do agente se concentra na voz; com modelos frontier, concentra-se no cérebro. O reconhecimento de fala fica no meio, entre $0.0010 e $0.0030 por minuto de conversa (tarifas por minuto da nossa análise de 14 modelos, verificadas novamente neste lote: qwen3-asr-flash $0.00198, gpt-4o-mini-transcribe $0.00294, whisper-1 $0.006 por minuto de áudio).
O cérebro custa quase nada até o reasoning entrar em cena. Nosso diálogo de suporte com oito turnos estabilizou em cerca de 310 tokens de entrada e 71 de saída por turno no deepseek-v4-flash-0731, ou $0.00016 por interação. No gemini-3.7-flash, o mesmo diálogo custou $0.00126 por interação, 8x mais. A divisão dos tokens mostra o motivo: o modelo gastou de 89 a 361 tokens de reasoning por turno para elaborar uma resposta de duas frases. Não é possível desativar o thinking no Gemini 3.7 Flash, então um agente de voz baseado nele paga esse custo de reasoning em todas as interações. Nos modelos em que é possível desligá-lo, um turno de voz é justamente o tipo de tarefa simples em que desativá-lo é seguro.
Quanto custa text-to-speech por minuto de áudio?
De $0.004 a $0.034 por minuto sintetizado, uma diferença de 8.4x que o preço por caractere esconde. Todos os modelos abaixo cobram por caractere de entrada. Por isso, sintetizamos trechos fixos em inglês e chinês, medimos o áudio retornado e dividimos o custo pela duração:
| Modelo | Preço de tabela | EN $/minuto de áudio | ZH $/minuto de áudio | ZH vs EN |
|---|---|---|---|---|
| google-tts-standard | $4/M de caracteres | $0.0041 | $0.0007 | 0.18x |
| qwen3-tts-instruct-flash | $11.5/M | $0.0098 | $0.0033 | 0.34x |
| tts-1 | $15/M | $0.0151 | $0.0043 | 0.28x |
| google-tts-neural2 | $16/M | $0.0162 | $0.0030 | 0.18x |
| tts-1-hd | $30/M | $0.0303 | $0.0085 | 0.28x |
| google-tts-chirp3-hd | $30/M | $0.0344 | $0.0052 | 0.15x |
A velocidade da fala é a variável oculta. O tts-1-hd e o chirp3-hd têm o mesmo preço de tabela, $30, mas o chirp3-hd lê nosso trecho em inglês mais rapidamente e produz menos segundos de áudio. Por isso, custa 13% mais por minuto de áudio. Na outra ponta da tabela, o google-tts-standard entrega um minuto sintetizado por menos da metade do preço de qualquer outro modelo medido. O preço de tabela permite ordenar os modelos; somente a tarifa por minuto de áudio mostra o custo real.
O resultado da coluna em chinês foi maior do que esperávamos: um minuto de chinês falado consome de 3 a 7x menos caracteres faturáveis do que um minuto de inglês, porque cada caractere concentra mais fala. Com cobrança por caractere, o trecho de fala de um agente em chinês custa de 66 a 85% menos do que o mesmo agente em inglês. Essa diferença se soma às variações de tokens entre idiomas no lado do texto.
Quando o preço da API realtime compensa?
Quando o loop de voz a voz em 2 segundos e o tratamento nativo de interrupções geram valor suficiente. Considerando apenas preço, o modelo principal perde para todas as cascatas que montamos. As duas conversões oficiais de áudio foram reproduzidas exatamente neste lote: 30.0 segundos de áudio de entrada geraram cobrança de 300 tokens, ou 1 token por 100 ms, e 3.7 segundos de saída geraram 74 tokens, ou 1 a cada 50 ms. São as mesmas taxas medidas em nosso estudo de julho. Com os preços de tabela do gpt-realtime-2.1, isso representa $0.0192 por minuto apenas para ouvir e $0.0768 por minuto para falar, antes da cobrança repetida do histórico da conversa, que se acumula em sessões longas.
Esse acúmulo é menos agressivo do que parece por causa do cache. Em nossa sessão de oito turnos, a entrada cresceu de 72 para 643 tokens por resposta, mas, no oitavo turno, 512 deles estavam em cache a $0.40 por milhão. Durante toda a sessão, 76% dos tokens de entrada foram cobrados pela tarifa de cache. O custo total medido foi de $0.0752 para uma conversa de 1.31 minuto, ou $0.0573 por minuto de conversa. A divisão por lane ajuda a entender essa conta: 66% para saída de áudio, 17% para entrada de áudio nova e 16% para texto. O modelo também emite uma versão em texto de cada resposta, cobrada à tarifa de saída de texto de $24 por milhão. Na prática, cerca de um sexto da conta de uma solução “voz a voz” corresponde à fatura de um modelo de texto. Aplicando o mesmo perfil de tokens medido às tarifas do mini, o custo fica em $0.0159. Esse é o número mais relevante: o mini custa menos do que a cascata premium e mantém a latência e o barge-in que a arquitetura em cascata não consegue oferecer por sua própria estrutura.
O custo restante do realtime é operacional, não por token: as sessões são encerradas obrigatoriamente após 60 minutos e não podem ser retomadas com o histórico de áudio. Qualquer conversa que ultrapasse esse limite recomeça com cache frio. O estudo de julho detalha esse funcionamento.
Quanto mais rápido é o voz a voz em relação à cascata?
De 2.3x a 4.5x nas configurações acima, e a diferença cresce conforme a cascata fica mais sofisticada. O gráfico usa as mesmas seis configurações da tabela de custos e a mesma unidade em cada barra: um turno de conversa, medido da requisição até a conclusão da resposta com uma carga realista, composta por um enunciado de 5 segundos na entrada e uma resposta de duas frases na saída. As barras da cascata somam as medianas de três execuções de cada trecho:
Em números, os turnos da cascata somam 4.9 s na configuração econômica, 5.6 s na intermediária, 5.7 s com cérebro SOTA e 7.7 s na premium. Os dois tiers de voz a voz permanecem na mesma faixa: 1.6-2.1 s para o gpt-realtime-2.1-mini em 4 turnos ao vivo e 1.7-2.1 s para o gpt-realtime-2.1 em 8.
A comparação com a tabela de custos deixa o trade-off evidente: na cascata, custo e latência seguem direções opostas. A configuração econômica é, ao mesmo tempo, a cascata mais barata e mais rápida. A premium custa 6.8x mais e demora 2.8 segundos a mais, porque os componentes caros, um cérebro que delibera e uma voz HD, também são lentos. No voz a voz, os dois modelos permanecem na mesma faixa de 2 segundos, independentemente do tier. Assim, o mini é simultaneamente mais barato do que duas cascatas e mais rápido do que todas as quatro.
Os números também mostram outros três pontos. Primeiro, a LLM é o gargalo de latência em todas as cascatas, e o reasoning obrigatório quase dobra esse tempo: o gemini-3.7-flash leva 4.5 segundos para elaborar uma resposta de duas frases, contra 2.6 do deepseek e 2.7 do gpt-5.6. O mesmo custo de reasoning que multiplica os tokens por 8 também coloca a configuração premium em último lugar na latência. Segundo, mesmo escolhendo o componente mais rápido medido em cada trecho, gpt-4o-mini-transcribe, deepseek e google-tts-standard, o piso ainda é de 4.1 segundos, mais do que o dobro da faixa do realtime. Isso sem incluir a espera do detector de atividade de voz para identificar o fim da fala nem a reprodução do áudio. Terceiro, as linhas da cascata representam tempos sequenciais até a resposta completa. Em produção, uma cascata que encaminha o streaming da LLM para um TTS também em streaming sobrepõe os dois maiores trechos e pode reduzir boa parte da diferença. Essa sobreposição, porém, exige implementação e ajuste. Os 2 segundos da API realtime já aparecem na primeira sessão WebSocket aberta.
Onde uma cascata gasta o tempo de cada turno? Principalmente nas três requisições, não no conteúdo processado. A rede bruta representa uma parte pequena: um round trip HTTPS com conexão aquecida até a borda da API levou cerca de 0.09 segundo. Três trechos sequenciais, portanto, adicionam aproximadamente 0.3 segundo de rede pura por turno, além de um handshake TLS de 0.2 segundo quando a conexão está fria. O principal custo é o overhead fixo de dispatch de cada requisição. Para isolá-lo, executamos novamente os trechos da configuração mais rápida com payloads quase vazios: uma resposta de LLM com um token ainda levou 2.5 segundos, um clipe de meio segundo levou 1.6 segundo para ser transcrito e uma síntese de duas palavras levou 0.4 segundo. Esses pisos somam 4.4 segundos, contra 4.1 segundos com os payloads completos, valores equivalentes dentro da margem de ruído da medição. Quase todo o tempo de um turno em cascata é overhead por requisição; o conteúdo efetivo, 70 tokens de resposta em vez de 1 ou um clipe 10x mais longo, é processado praticamente de graça. Isso leva a duas conclusões: respostas mais curtas não tornam a cascata mais rápida, mas qualquer otimização que remova ou sobreponha uma requisição, como streaming entre trechos e conexões persistentes, ataca o custo real. A API realtime leva essa lógica ao extremo: mantém um único socket aberto, então nenhum turno paga um novo ciclo de requisição.
Perguntas frequentes
Qual é a forma mais barata de operar um agente de voz?
A cascata econômica: qwen3-asr-flash para ouvir, deepseek-v4-flash-0731 como cérebro e google-tts-standard para falar, por $0.0037 por minuto de conversa ou cerca de $0.04 em uma chamada de 10 minutos. Ela custa 15x menos do que o modelo principal de voz a voz; em troca, perde latência de voz a voz e tratamento natural de interrupções.
O GPT Realtime é mais caro do que um stack em cascata?
O modelo principal é: o gpt-realtime-2.1 ficou em $0.0573 por minuto de conversa, 2.3x o custo da nossa cascata premium e 15x o da econômica. O gpt-realtime-2.1-mini não é: a $0.0159 por minuto de conversa com o mesmo perfil de tokens, ele fica entre as cascatas intermediária e premium. No tier mini, portanto, a escolha envolve latência e controle, não preço.
Qual parte de um agente de voz custa mais?
Text-to-speech, em todas as cascatas com cérebro flash que avaliamos: de $0.002 a $0.017 por minuto de conversa, contra $0.0006 a $0.005 para uma LLM flash, uma diferença de 12x na configuração intermediária. Um cérebro frontier inverte essa relação: o gpt-5.6 custa $0.0110 por minuto, contra $0.0076 do tts-1. Entre os modelos de TTS, a diferença por minuto de áudio chega a 8.4x, a maior alavanca individual medida.
O idioma da conversa altera o custo?
No trecho de fala, muito: a cobrança por caractere torna um minuto de chinês falado de 3 a 7x mais barato do que o inglês nos seis modelos de TTS medidos, porque cada caractere concentra mais fala. As tarifas de reconhecimento de fala foram iguais nos dois idiomas nos três modelos que verificamos novamente. No lado do texto, as diferenças seguem as variações de tokenização entre idiomas.
Medido em 2026-08-17 pelo gateway da Synthorai, com todos os trechos no mesmo lote: seis modelos de TTS sintetizando passagens fixas em inglês e chinês, com a duração do áudio lida nos arquivos retornados, duas execuções por modelo; três modelos de STT nos clipes de referência padrão, com o custo por minuto obtido nos headers de cobrança; um diálogo de suporte roteirizado com oito turnos em três LLMs, dois modelos flash e um frontier, registrando o uso por turno; um teste de latência por trecho, com um enunciado de 5 segundos para STT, um turno em estado estável para a LLM e uma resposta de duas frases para TTS, n=3, medindo o tempo até a resposta completa; um teste de piso com payload mínimo nos mesmos trechos, usando uma resposta de um token, um clipe de meio segundo e uma síntese de duas palavras, n=3, além dos tempos de round trip com conexão aquecida e fria até a borda da API; e sessões ao vivo do GPT Realtime, com enunciados de 5 segundos, oito turnos no modelo principal e quatro no mini, cobradas lane por lane a partir dos eventos de uso response.done. O custo do mini foi calculado aplicando as tarifas de tabela do mini ao perfil de tokens medido na sessão do modelo principal, enquanto a faixa de latência do mini veio de sua própria sessão. As composições em cascata pressupõem divisão igual do tempo de fala e quatro interações por minuto; as tarifas são os preços de tabela do catálogo de modelos na data da medição. O seed-tts-2.0 já está integrado, mas foi excluído até termos medições estáveis. Preços e velocidades de fala mudam; meça novamente antes de definir uma arquitetura.
Da mesma série: preços de reconhecimento de fala em 14 modelos, como funciona a cobrança do GPT Realtime, custos de tokens para entrada de imagens, preços de geração de vídeo.