🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.
Custo de APIs de transcrição: 7 modelos com o mesmo áudio

Custo de APIs de transcrição: 7 modelos com o mesmo áudio

Conteúdo
  1. O que este teste mede e o que não mede
  2. ASR dedicado, não multimodal
  3. Como a transcrição é cobrada
  4. Custo
  5. Acurácia e cobertura de idiomas
  6. Streaming da saída
  7. Cache
  8. O que verificar primeiro e o que testar por conta própria
  9. Conclusão
  10. Fontes

A Synthorai agora transcreve áudio usando sete modelos dedicados de reconhecimento de fala por meio de um único endpoint compatível com OpenAI.

Esse endpoint esconde bastante complexidade, porque as interfaces nativas desses modelos são muito diferentes. whisper-1 recebe um arquivo por upload multipart e retorna {text}. gpt-4o-transcribe usa o mesmo tipo de upload, mas também informa o uso de tokens. O seed-asr, da ByteDance, usa o protocolo AUC da BytePlus; o qwen3-asr-flash, da Alibaba, tem um protocolo próprio; e os modelos chirp, do Google, são recognizers do Cloud Speech-to-Text acessados via OAuth.

Cada modelo tem endpoints, autenticação e formatos de resposta diferentes, o que normalmente exigiria uma integração adicional. Pelo gateway, todos usam a mesma chamada compatível com OpenAI: troque gpt-4o-mini-transcribe por seed-asr-bigmodel ou chirp-3, sem alterar mais nada no código.

TL;DR

  • O custo da transcrição varia 8x entre os sete modelos dedicados: $0.0020 por minuto de áudio no seed-asr-bigmodel e $0.0164 nos modelos chirp, conforme medição de 2026-06-25.
  • O seed-asr não detecta o idioma automaticamente: sem definir language, áudios que não estejam em inglês ou chinês retornam HTTP 200 com texto vazio ou romanizado e ainda são cobrados.
  • Por $0.0021 por minuto, o qwen3-asr-flash é o modelo mais barato que detecta automaticamente todos os idiomas testados.
  • Apenas os modelos de transcrição gpt-4o fazem streaming token a token; os modelos cobrados por minuto funcionam somente em batch.
  • Todos os modelos registraram cerca de 0% de erro em falas nítidas em inglês, espanhol e francês: a acurácia não é o critério que os diferencia.

A chamada usa o endpoint de transcrição compatível com OpenAI. Se você já usa Whisper, basta substituir o endpoint:

curl https://synthorai.io/v1/audio/transcriptions \
  -H "Authorization: Bearer $SYNTHORAI_API_KEY" \
  -F file=@meeting.mp3 \
  -F model=gpt-4o-mini-transcribe
from openai import OpenAI

client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")

with open("meeting.mp3", "rb") as f:
    result = client.audio.transcriptions.create(model="gpt-4o-mini-transcribe", file=f)

print(result.text)

A transcrição vem em text, e o custo cobrado fica no header de resposta x-total-cost-usd.

Submetemos os sete modelos ao mesmo teste simples. O formato desse teste determina como todos os números abaixo devem ser interpretados.


O que este teste mede e o que não mede

Geramos textos cotidianos sem nomes próprios, sobre temas como uma manhã, o clima e uma ida ao mercado, usando uma voz padrão de text-to-speech em cada um dos cinco idiomas mais falados do mundo. Depois, transcrevemos cada trecho com os sete modelos. Cada áudio tem cerca de 12 a 15 segundos, aproximadamente 40 palavras em ritmo normal e sem longos períodos de silêncio. O formato é WAV PCM de 16 bits, mono, 16 kHz, com 256 kbps e cerca de 2 MB por minuto. O texto original serve como referência, e as durações são exatas.

O teste é propositalmente fácil: áudio limpo e roteirizado, com um único locutor, sem sotaques, ruído ou jargão. Isso permite medir características que não dependem da dificuldade do áudio. Custo, latência, idiomas aceitos e suporte a streaming são dados estáveis.

Não é um benchmark de qualidade. Gravações reais, com sotaques, ruído de fundo, vocabulário específico, falas sobrepostas e uma hora de duração, diferenciam esses modelos de maneiras que um áudio limpo não consegue mostrar. Nada aqui permite prever esse desempenho. Trate os números de acurácia como uma verificação mínima, não como um ranking. Custo, cobertura de idiomas e streaming são a baseline em que você pode realmente se apoiar.

ASR dedicado, não multimodal

Os sete modelos avaliados são sistemas dedicados de reconhecimento de fala: whisper-1, gpt-4o-transcribe e gpt-4o-mini-transcribe, da OpenAI; seed-asr-bigmodel, da ByteDance; qwen3-asr-flash, da Alibaba; e chirp-2 e chirp-3, do Google.

O gateway também permite usar no endpoint de transcrição um modelo multimodal genérico como o Gemini, que pode transcrever como parte da compreensão do áudio. Não incluímos esses modelos e não os escolheríamos para transcrição. O próprio Google faz essa distinção: o guia de áudio do Gemini apresenta o modelo como uma forma de descrever, resumir ou responder a perguntas sobre áudio. Para obter a transcrição propriamente dita, recomenda outra solução: “para modelos dedicados de speech-to-text com suporte a transcrição em tempo real, use a API Google Cloud Speech-to-Text”, ou seja, os modelos Chirp. Um modelo multimodal consegue gerar uma transcrição, mas foi criado para compreender o áudio, não para registrar exatamente o que foi dito. Além disso, ele é acessado por uma chamada de chat generateContent, não por uma API de transcrição. Para reconhecimento de fala literal, o modelo dedicado é a ferramenta certa. O fornecedor que oferece as duas opções também recomenda essa abordagem.

Há três formas de enviar o áudio:

  • Arquivo de entrada, resposta em batch: envie uma gravação completa e receba toda a transcrição em uma única resposta. Todos os modelos oferecem esse modo.
  • Arquivo de entrada, texto de saída em streaming: o upload é o mesmo, mas a transcrição é retornada por SSE à medida que é produzida. Alguns modelos oferecem esse recurso; outros funcionam somente em batch.
  • Áudio de entrada em streaming, texto de saída em streaming: reconhecimento em tempo real de um microfone ou chamada ao vivo. Esse modo ainda está em desenvolvimento e não está disponível. Portanto, todo o conteúdo abaixo trata dos dois primeiros modos.

Como a transcrição é cobrada

Há dois modelos de cobrança. Por minuto de áudio (whisper-1, seed-asr, qwen3-asr-flash e os modelos Chirp): a cobrança considera a duração total da gravação, seja qual for o conteúdo. Por token (os modelos gpt-4o): o áudio é tokenizado a uma taxa fixa, e a cobrança inclui os tokens de entrada e os tokens da transcrição gerada. Por isso, períodos de silêncio custam menos do que falas densas.

A cobrança por token tem uma particularidade: a tarifa de entrada publicada é para texto, mas o áudio custa mais (gpt-4o-mini-transcribe anuncia $1.25/M para entrada, mas cobra $3/M pelo áudio). Se você estimar o custo usando a tarifa de texto, o valor ficará abaixo do real. O gateway retorna a cobrança exata no header x-total-cost-usd; use esse valor em vez de estimativas baseadas na página de preços.

Custo

É o aspecto que o teste mede com mais clareza e também o que mais varia. A tabela mostra o custo por minuto conforme o header de cobrança. As tarifas atuais de todos os modelos disponíveis no gateway estão na página de modelos:

ModeloCusto / minLatênciaStreaming
seed-asr-bigmodel$0.0020≈10snão
qwen3-asr-flash$0.0021≈3snão
gpt-4o-mini-transcribe$0.0031≈3stoken a token
whisper-1$0.0060≈4snão
gpt-4o-transcribe$0.0062≈2stoken a token
chirp-2$0.0164≈3snão
chirp-3$0.0164≈4snão

A diferença é de cerca de 8x: $0.0020 por minuto no seed-asr e $0.0164 nos modelos Chirp. O seed-asr, que é o mais barato, precisa receber o idioma do áudio explicitamente, como veremos adiante. Ele é a melhor opção quando o idioma já é conhecido. Para áudios em vários idiomas ou de idioma desconhecido, a opção mais barata que dispensa configuração é o qwen3-asr-flash, por $0.0021. Os modelos Chirp são, por larga margem, os mais caros. Se você optar pelo Chirp, escolha chirp-3: ele tem o mesmo preço e desempenho do chirp-2, mas transcreve mandarim muito melhor, como mostra a tabela de acurácia.

A variação desses valores nos seus próprios arquivos depende do modelo de cobrança. Nos modelos cobrados por minuto (whisper-1, seed-asr, qwen3-asr-flash e os Chirp), apenas a duração importa. A tarifa pode ser aplicada diretamente: dez minutos de áudio custam dez vezes o valor por minuto, independentemente do formato ou conteúdo.

Nos modelos cobrados por token, as linhas gpt-4o, o custo de entrada varia com a duração, não com o tamanho do arquivo, porque o provedor faz resampling do áudio antes da tokenização. Um MP3 pesado de 320 kbps e nosso WAV enxuto de 16 kHz, com as mesmas palavras, geram praticamente o mesmo custo em tokens. Comprimir os arquivos reduz o armazenamento, não o custo da transcrição. O que altera uma cobrança por token é a quantidade de fala: nossos trechos têm ritmo normal e não contêm períodos ociosos. Áudios com falas mais densas ou mais intervalos custam um pouco mais ou menos em tokens de saída. Em todos os casos, o valor definitivo está no header x-total-cost-usd.

Acurácia e cobertura de idiomas

Em inglês, espanhol e francês, todos os modelos que aceitam o idioma registraram cerca de 0% de erro. Esse é o mínimo esperado, e todos atingiram esse nível. Mesmo neste teste simples, mandarim e hindi começam a revelar diferenças. Use esses resultados apenas para orientar os testes com idiomas mais difíceis, não como veredito:

ModeloMandarim (CER)Hindi (WER)Cobertura
seed-asr-bigmodel0%9%todos os cinco (language explícito obrigatório)
qwen3-asr-flash0%15%todos os cinco
gpt-4o-mini-transcribe0%4%todos os cinco
whisper-10%22%todos os cinco
gpt-4o-transcribe0%13%todos os cinco
chirp-216%15%todos os cinco
chirp-32%15%todos os cinco

O dado mais relevante não é a cobertura, mas a detecção do idioma. O seed-asr transcreveu os cinco idiomas quando passamos o parâmetro language. Em uma rodada posterior, também transcreveu japonês, alemão, italiano e coreano. O modelo não detecta o idioma sozinho: sem language, qualquer idioma além de inglês ou chinês retorna uma string vazia ou texto romanizado sem sentido, com status 200 e sem erro. Os outros seis fazem a detecção automática. Essa falha silenciosa é a descoberta mais importante: um modelo que retorna um erro explícito causa transtorno; um que falha silenciosamente causa um incidente em produção.

A variação em hindi e a diferença em mandarim, com 16% no chirp-2 e correção no chirp-3, indicam que esses modelos devem ser testados nos idiomas mais difíceis antes de serem adotados. Não provam que um modelo seja melhor que outro. Os valores absolutos são afetados pela voz sintética e pelo método de pontuação, além de variarem entre execuções. A conclusão correta é que, em falas nítidas nos principais idiomas, esses modelos não se diferenciam pela acurácia. Portanto, este teste não permite escolher com base nesse critério.

Streaming da saída

O suporte a streaming é um recurso, não uma medida de qualidade, e divide os modelos em dois grupos. Os modelos cobrados por minuto (whisper-1, seed-asr, qwen3-asr-flash e os dois Chirp) funcionam somente em batch; o gateway retorna 400 quando o streaming é solicitado. Os modelos gpt-4o fazem streaming token a token: gpt-4o-transcribe retorna as primeiras palavras em cerca de um segundo e preenche o restante progressivamente, como exige uma interface com resposta em tempo real. O custo é o mesmo do modo batch. Para usar streaming, adicione stream=true:

curl -N https://synthorai.io/v1/audio/transcriptions \
  -H "Authorization: Bearer $SYNTHORAI_API_KEY" \
  -F file=@meeting.mp3 -F model=gpt-4o-transcribe -F stream=true
# data: {"type":"transcript.text.delta","delta":"When"}
# data: {"type":"transcript.text.delta","delta":" you"} ...

Cache

Na prática, esses modelos não usam cache. Nos modelos cobrados por minuto, repetir o conteúdo não gera desconto: enviamos o mesmo trecho cinco vezes para whisper-1 e pagamos exatamente $0.015478 em todas elas. Os modelos gpt-4o, cobrados por token, não anunciam tarifa de cache e apresentaram apenas a variação normal entre execuções repetidas. Planeje os custos com base na tarifa por minuto; reenviar o mesmo arquivo não reduz o preço.

O que verificar primeiro e o que testar por conta própria

Este teste não determina qual modelo oferece a maior acurácia nas suas gravações. Ele ajuda a definir os critérios de corte antes da sua própria avaliação:

  • Idiomas. Confirme se o modelo aceita todos os idiomas necessários e se faz a detecção automaticamente. O seed-asr processou todos os idiomas testados, mas somente com o parâmetro language explícito; sem ele, áudios que não estejam em inglês ou chinês falham silenciosamente. Os outros seis fazem detecção automática, uma opção padrão mais segura para áudios mistos ou de idioma desconhecido.
  • Streaming. Se você precisa de transcrição em tempo real, apenas os modelos gpt-4o fazem streaming token a token. Os modelos cobrados por minuto funcionam somente em batch.
  • Custo. A diferença é de cerca de 8x. O modelo mais barato com suporte a todos os idiomas é o qwen3-asr-flash, por $0.0021. Os Chirp são os mais caros, e chirp-3 é o único motivo para escolher Chirp em vez de modelos mais baratos. Como não há cache, a tarifa por minuto é o custo efetivo.
  • Tipo de modelo. Use um modelo dedicado de reconhecimento de fala, não um multimodal genérico. É a ferramenta certa para transcrição literal, e os fornecedores que oferecem os dois tipos também fazem essa recomendação.

Depois que alguns modelos passarem por esses filtros, resta avaliar a acurácia no seu próprio áudio, com seus sotaques, ruídos e vocabulário. Essa resposta depende dos seus testes. Nenhum benchmark com fala limpa substitui a avaliação dos modelos restantes em gravações reais.

Conclusão

Em falas nítidas e roteirizadas nos principais idiomas, os sete modelos têm acurácia semelhante. Essa é a conclusão mais útil do teste: a acurácia não é o principal critério de escolha. O que o teste estabelece com clareza, e o que realmente varia, é a baseline: o custo muda cerca de 8x, um modelo cobre apenas dois idiomas sem configuração explícita e os modelos cobrados por minuto não fazem streaming. Use esses critérios para reduzir as opções, não para declarar um vencedor. Depois, teste os dois ou três finalistas com seu próprio áudio. Para reconhecimento de fala, prefira um modelo dedicado a um multimodal genérico, como recomendam os próprios fornecedores que desenvolvem ambos.


Fontes

Custos e latências medidos na Synthorai em 2026-06-25 com sete modelos dedicados de transcrição e cinco idiomas (inglês, mandarim, hindi, espanhol e francês), usando o header x-total-cost-usd e a temporização via SSE. As linhas de idiomas do seed-asr refletem uma nova medição feita em 2026-07-04 com o parâmetro language definido. O áudio foi gerado por text-to-speech e é propositalmente simples. Portanto, os números de acurácia representam uma verificação mínima, não um benchmark de qualidade; falas reais com sotaques e ruído diferenciariam os modelos de outra forma. A latência varia entre execuções. Os preços publicados correspondem às tarifas da plataforma nessa data. Verifique os valores atuais antes de usá-los como referência.

← Voltar ao blog