APIs de transcrição de áudio: 14 modelos, de $0.002 a $0.016 por minuto
Conteúdo
Uma API de transcrição de áudio custa entre $0.002 e $0.016 por minuto conforme o preço de tabela. É uma diferença de 8x para serviços que parecem fazer a mesma coisa, e a faixa mais barata não costuma aparecer na maioria dos comparativos. Operamos 14 modelos de transcrição em um único gateway, desde a família gpt-4o da OpenAI, cobrada por token, até modelos chineses de ASR da ByteDance e da Alibaba, normalmente ignorados em análises internacionais. Este artigo mapeia a categoria: como funcionam os diferentes formatos de cobrança, qual é o preço por minuto de cada modelo e como escolher pela carga de trabalho, não pela marca.
TL;DR
- Os preços de tabela por minuto dos 14 modelos vão de $0.002 (seed-asr, paraformer, fun-asr-realtime) a $0.016 (Chirp, do Google), uma diferença de 8x.
- Os modelos de transcrição gpt-4o da OpenAI são cobrados por token, não por minuto. Nos áudios que medimos, o custo ficou em cerca de $0.0031/min para o mini e $0.0062/min para o modelo completo.
- A faixa mais barata é a de ASR chinês: seed-asr da ByteDance e as famílias paraformer, fun-asr e qwen3 da Alibaba custam entre $0.002-$0.0021/min e incluem variantes com streaming.
- Em áudio limpo, precisão não é o diferencial. Em nosso teste com sete modelos, todos os que aceitavam o idioma tiveram uma taxa de erro de ~0% em inglês, espanhol e francês.
Quanto custa uma API de transcrição de áudio em 2026?
A resposta mais precisa está na tabela, porque o formato de cobrança é tão relevante quanto o preço. Modelos cobrados por minuto consideram a duração, independentemente do conteúdo. Já os modelos cobrados por token reamostram o áudio e cobram pelos tokens de entrada e saída. O custo efetivo por minuto varia um pouco conforme a densidade da fala:
| Modelo | Provedor | Cobrança | Preço de tabela | Streaming |
|---|---|---|---|---|
| seed-asr-bigmodel | ByteDance | por minuto | $0.002/min | não |
| paraformer-realtime-v2 | Alibaba | por minuto | $0.002/min | sim |
| qwen3-asr-flash-realtime | Alibaba | por minuto | $0.002/min | sim |
| fun-asr-realtime | Alibaba | por minuto | $0.002/min | sim |
| fun-asr | Alibaba | por minuto | $0.0021/min | não |
| fun-asr-flash | Alibaba | por minuto | $0.0021/min | não |
| fun-asr-mtl | Alibaba | por minuto | $0.0021/min | não |
| qwen3-asr-flash | Alibaba | por minuto | $0.0021/min | não |
| gpt-4o-mini-transcribe | OpenAI | por token | ≈$0.0031/min medido | token a token |
| whisper-1 | OpenAI | por minuto | $0.006/min | não |
| gpt-4o-transcribe | OpenAI | por token | ≈$0.0062/min medido | token a token |
| gpt-4o-transcribe-diarize | OpenAI | por token | preços por token | token a token |
| chirp-2 | por minuto | $0.016/min | não | |
| chirp-3 | por minuto | $0.016/min | não |
Os preços de tabela atualizados estão na página de cada modelo. Os dois valores aproximados em $/min dos modelos gpt-4o correspondem ao custo real dos áudios multilíngues que processamos pelo gateway no estudo de transcrição com sete modelos. Os modelos batch acima podem ser chamados pelo mesmo endpoint /v1/audio/transcriptions, compatível com a API da OpenAI, usando uma única API key. Confirmamos que isso também inclui o modelo de diarização. As variantes -realtime oferecem streaming por uma interface própria, documentada na página de cada modelo.
Como converter a cobrança por token em custo por minuto?
Na transcrição cobrada por token, o custo acompanha o conteúdo falado, não o tamanho do arquivo. Na prática, esses modelos ficam no meio da tabela. Os modelos de transcrição gpt-4o reamostram o áudio antes da tokenização. Por isso, um MP3 pesado de 320 kbps e um WAV enxuto de 16 kHz com as mesmas palavras custam praticamente o mesmo. Comprimir os arquivos reduz o armazenamento, não o gasto com transcrição. Em fala com ritmo normal, medimos cerca de $0.0031/min para o gpt-4o-mini-transcribe e $0.0062/min para o gpt-4o-transcribe. Áudios com fala mais densa ou mais silêncio alteram um pouco esses valores. Se o orçamento exigir um teto rígido por hora de áudio, use um modelo cobrado por minuto. Com cobrança por token, o valor é uma estimativa.
O que é a faixa chinesa de ASR e por que ela não aparece na maioria dos comparativos?
Os modelos chineses de ASR formam a faixa mais barata da tabela e também concentram mais opções de streaming. Mesmo assim, quase nunca são testados em comparativos publicados em inglês. O seed-asr-bigmodel da ByteDance tem o menor preço, $0.002/min. A Alibaba oferece três famílias: paraformer, voltada primeiro a streaming; fun-asr, com variantes batch, flash, multilíngue mtl e realtime; e qwen3-asr, nas versões flash e flash-realtime. Todas custam entre $0.002-$0.0021/min. Isso equivale a um terço do preço do whisper-1 e a um oitavo do preço do Chirp.
Nossas medições revelaram duas ressalvas. Primeiro, o seed-asr precisa receber antecipadamente o idioma do áudio. É a melhor opção quando o idioma já é conhecido. Já o qwen3-asr-flash, a $0.0021, foi o modelo mais barato a detectar automaticamente todos os idiomas testados. Segundo, preço baixo não significa lentidão: o qwen3-asr-flash processou nossos clipes em cerca de 3 segundos, com latência comparável à dos modelos da OpenAI. Para cargas de trabalho concentradas em mandarim, essa faixa não é apenas mais barata; são modelos desenvolvidos no próprio mercado do idioma.
Qual modelo escolher para sua carga de trabalho?
Comece pelo formato de cobrança e pela necessidade de streaming. Em áudio limpo, a precisão não diferencia esses modelos. Lista curta por cenário:
| Cenário | Escolha | Motivo |
|---|---|---|
| Transcrição batch, idioma conhecido | seed-asr-bigmodel | menor preço, $0.002/min; exige indicação do idioma |
| Batch, idiomas mistos ou desconhecidos | qwen3-asr-flash | detecção automática mais barata, latência de ~3s |
| Legendas ao vivo / ditado | paraformer-realtime-v2 ou qwen3-asr-flash-realtime | streaming pelo preço mínimo de $0.002 |
| Streaming parcial de texto no formato da OpenAI | gpt-4o-mini-transcribe | saída token a token, ≈$0.0031/min |
| Identificação de falantes | gpt-4o-transcribe-diarize | único modelo da lista com diarização |
| Substituição direta do whisper | whisper-1 | referência de compatibilidade a $0.006/min |
Se a aplicação for uma conversa de voz bidirecional, e não apenas transcrição, trata-se de outro produto, com custos diferentes. Consulte nosso estudo de preços do GPT Realtime para ver os custos de speech-to-speech.
Perguntas frequentes
Quanto custa a API do Whisper?
O preço de tabela do whisper-1 é $0.006 por minuto de áudio, cobrado apenas pela duração. Um arquivo de uma hora custa $0.36, independentemente do formato ou bitrate. Repetições não recebem desconto: enviamos o mesmo clipe cinco vezes e pagamos o mesmo valor em todas elas. Metade dos modelos da tabela já é mais barata. A faixa chinesa de ASR, com preços de $0.002-$0.0021/min, custa um terço do valor do whisper, enquanto o custo medido do gpt-4o-mini-transcribe foi aproximadamente a metade.
Um modelo de transcrição de áudio mais caro é mais preciso?
Não em áudio limpo. Em nosso teste com sete modelos, todos os que aceitavam o idioma tiveram uma taxa de erro próxima de 0% em inglês, espanhol e francês. As diferenças relevantes estão no custo, streaming, cobertura de idiomas e recursos como diarização. Para áudio difícil, com sotaques, ruído ou alternância entre idiomas, teste com suas próprias amostras. O estudo de transcrição mostra onde surgiram os primeiros problemas em nossos testes: mandarim e hindi.
Quais APIs de transcrição de áudio oferecem streaming?
Há dois formatos. Os modelos de transcrição gpt-4o fazem streaming de texto token a token pela interface da API da OpenAI. A família realtime da Alibaba, formada por paraformer-realtime-v2, qwen3-asr-flash-realtime e fun-asr-realtime, oferece streaming com cobrança por minuto a partir de $0.002/min. whisper-1, seed-asr e os modelos Chirp retornam apenas a transcrição completa.
Os 14 modelos são executados pelo mesmo endpoint do gateway, com cobrança unificada. Os preços de tabela atualizados estão na página de modelos. O estudo de custos de transcrição traz o comparativo medido entre sete modelos, incluindo latência e precisão.