🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.
APIs de transcrição de áudio: 14 modelos, de $0.002 a $0.016 por minuto

APIs de transcrição de áudio: 14 modelos, de $0.002 a $0.016 por minuto

Conteúdo
  1. Quanto custa uma API de transcrição de áudio em 2026?
  2. Como converter a cobrança por token em custo por minuto?
  3. O que é a faixa chinesa de ASR e por que ela não aparece na maioria dos comparativos?
  4. Qual modelo escolher para sua carga de trabalho?
  5. Perguntas frequentes

Uma API de transcrição de áudio custa entre $0.002 e $0.016 por minuto conforme o preço de tabela. É uma diferença de 8x para serviços que parecem fazer a mesma coisa, e a faixa mais barata não costuma aparecer na maioria dos comparativos. Operamos 14 modelos de transcrição em um único gateway, desde a família gpt-4o da OpenAI, cobrada por token, até modelos chineses de ASR da ByteDance e da Alibaba, normalmente ignorados em análises internacionais. Este artigo mapeia a categoria: como funcionam os diferentes formatos de cobrança, qual é o preço por minuto de cada modelo e como escolher pela carga de trabalho, não pela marca.

TL;DR

  • Os preços de tabela por minuto dos 14 modelos vão de $0.002 (seed-asr, paraformer, fun-asr-realtime) a $0.016 (Chirp, do Google), uma diferença de 8x.
  • Os modelos de transcrição gpt-4o da OpenAI são cobrados por token, não por minuto. Nos áudios que medimos, o custo ficou em cerca de $0.0031/min para o mini e $0.0062/min para o modelo completo.
  • A faixa mais barata é a de ASR chinês: seed-asr da ByteDance e as famílias paraformer, fun-asr e qwen3 da Alibaba custam entre $0.002-$0.0021/min e incluem variantes com streaming.
  • Em áudio limpo, precisão não é o diferencial. Em nosso teste com sete modelos, todos os que aceitavam o idioma tiveram uma taxa de erro de ~0% em inglês, espanhol e francês.

Quanto custa uma API de transcrição de áudio em 2026?

A resposta mais precisa está na tabela, porque o formato de cobrança é tão relevante quanto o preço. Modelos cobrados por minuto consideram a duração, independentemente do conteúdo. Já os modelos cobrados por token reamostram o áudio e cobram pelos tokens de entrada e saída. O custo efetivo por minuto varia um pouco conforme a densidade da fala:

ModeloProvedorCobrançaPreço de tabelaStreaming
seed-asr-bigmodelByteDancepor minuto$0.002/minnão
paraformer-realtime-v2Alibabapor minuto$0.002/minsim
qwen3-asr-flash-realtimeAlibabapor minuto$0.002/minsim
fun-asr-realtimeAlibabapor minuto$0.002/minsim
fun-asrAlibabapor minuto$0.0021/minnão
fun-asr-flashAlibabapor minuto$0.0021/minnão
fun-asr-mtlAlibabapor minuto$0.0021/minnão
qwen3-asr-flashAlibabapor minuto$0.0021/minnão
gpt-4o-mini-transcribeOpenAIpor token≈$0.0031/min medidotoken a token
whisper-1OpenAIpor minuto$0.006/minnão
gpt-4o-transcribeOpenAIpor token≈$0.0062/min medidotoken a token
gpt-4o-transcribe-diarizeOpenAIpor tokenpreços por tokentoken a token
chirp-2Googlepor minuto$0.016/minnão
chirp-3Googlepor minuto$0.016/minnão

Os preços de tabela atualizados estão na página de cada modelo. Os dois valores aproximados em $/min dos modelos gpt-4o correspondem ao custo real dos áudios multilíngues que processamos pelo gateway no estudo de transcrição com sete modelos. Os modelos batch acima podem ser chamados pelo mesmo endpoint /v1/audio/transcriptions, compatível com a API da OpenAI, usando uma única API key. Confirmamos que isso também inclui o modelo de diarização. As variantes -realtime oferecem streaming por uma interface própria, documentada na página de cada modelo.

Como converter a cobrança por token em custo por minuto?

Na transcrição cobrada por token, o custo acompanha o conteúdo falado, não o tamanho do arquivo. Na prática, esses modelos ficam no meio da tabela. Os modelos de transcrição gpt-4o reamostram o áudio antes da tokenização. Por isso, um MP3 pesado de 320 kbps e um WAV enxuto de 16 kHz com as mesmas palavras custam praticamente o mesmo. Comprimir os arquivos reduz o armazenamento, não o gasto com transcrição. Em fala com ritmo normal, medimos cerca de $0.0031/min para o gpt-4o-mini-transcribe e $0.0062/min para o gpt-4o-transcribe. Áudios com fala mais densa ou mais silêncio alteram um pouco esses valores. Se o orçamento exigir um teto rígido por hora de áudio, use um modelo cobrado por minuto. Com cobrança por token, o valor é uma estimativa.

O que é a faixa chinesa de ASR e por que ela não aparece na maioria dos comparativos?

Os modelos chineses de ASR formam a faixa mais barata da tabela e também concentram mais opções de streaming. Mesmo assim, quase nunca são testados em comparativos publicados em inglês. O seed-asr-bigmodel da ByteDance tem o menor preço, $0.002/min. A Alibaba oferece três famílias: paraformer, voltada primeiro a streaming; fun-asr, com variantes batch, flash, multilíngue mtl e realtime; e qwen3-asr, nas versões flash e flash-realtime. Todas custam entre $0.002-$0.0021/min. Isso equivale a um terço do preço do whisper-1 e a um oitavo do preço do Chirp.

Nossas medições revelaram duas ressalvas. Primeiro, o seed-asr precisa receber antecipadamente o idioma do áudio. É a melhor opção quando o idioma já é conhecido. Já o qwen3-asr-flash, a $0.0021, foi o modelo mais barato a detectar automaticamente todos os idiomas testados. Segundo, preço baixo não significa lentidão: o qwen3-asr-flash processou nossos clipes em cerca de 3 segundos, com latência comparável à dos modelos da OpenAI. Para cargas de trabalho concentradas em mandarim, essa faixa não é apenas mais barata; são modelos desenvolvidos no próprio mercado do idioma.

Qual modelo escolher para sua carga de trabalho?

Comece pelo formato de cobrança e pela necessidade de streaming. Em áudio limpo, a precisão não diferencia esses modelos. Lista curta por cenário:

CenárioEscolhaMotivo
Transcrição batch, idioma conhecidoseed-asr-bigmodelmenor preço, $0.002/min; exige indicação do idioma
Batch, idiomas mistos ou desconhecidosqwen3-asr-flashdetecção automática mais barata, latência de ~3s
Legendas ao vivo / ditadoparaformer-realtime-v2 ou qwen3-asr-flash-realtimestreaming pelo preço mínimo de $0.002
Streaming parcial de texto no formato da OpenAIgpt-4o-mini-transcribesaída token a token, ≈$0.0031/min
Identificação de falantesgpt-4o-transcribe-diarizeúnico modelo da lista com diarização
Substituição direta do whisperwhisper-1referência de compatibilidade a $0.006/min

Se a aplicação for uma conversa de voz bidirecional, e não apenas transcrição, trata-se de outro produto, com custos diferentes. Consulte nosso estudo de preços do GPT Realtime para ver os custos de speech-to-speech.

Perguntas frequentes

Quanto custa a API do Whisper?

O preço de tabela do whisper-1 é $0.006 por minuto de áudio, cobrado apenas pela duração. Um arquivo de uma hora custa $0.36, independentemente do formato ou bitrate. Repetições não recebem desconto: enviamos o mesmo clipe cinco vezes e pagamos o mesmo valor em todas elas. Metade dos modelos da tabela já é mais barata. A faixa chinesa de ASR, com preços de $0.002-$0.0021/min, custa um terço do valor do whisper, enquanto o custo medido do gpt-4o-mini-transcribe foi aproximadamente a metade.

Um modelo de transcrição de áudio mais caro é mais preciso?

Não em áudio limpo. Em nosso teste com sete modelos, todos os que aceitavam o idioma tiveram uma taxa de erro próxima de 0% em inglês, espanhol e francês. As diferenças relevantes estão no custo, streaming, cobertura de idiomas e recursos como diarização. Para áudio difícil, com sotaques, ruído ou alternância entre idiomas, teste com suas próprias amostras. O estudo de transcrição mostra onde surgiram os primeiros problemas em nossos testes: mandarim e hindi.

Quais APIs de transcrição de áudio oferecem streaming?

Há dois formatos. Os modelos de transcrição gpt-4o fazem streaming de texto token a token pela interface da API da OpenAI. A família realtime da Alibaba, formada por paraformer-realtime-v2, qwen3-asr-flash-realtime e fun-asr-realtime, oferece streaming com cobrança por minuto a partir de $0.002/min. whisper-1, seed-asr e os modelos Chirp retornam apenas a transcrição completa.

Os 14 modelos são executados pelo mesmo endpoint do gateway, com cobrança unificada. Os preços de tabela atualizados estão na página de modelos. O estudo de custos de transcrição traz o comparativo medido entre sete modelos, incluindo latência e precisão.

← Voltar ao blog