Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

Chirp 3 vs Fun-ASR Flash

vs

Qual usar e quando

Ambos cobram por minuto de áudio e o fun-asr-flash sai 7.6x mais barato, $0.0021 contra $0.016 - mas é a ferramenta mais estreita: apenas reconhecimento síncrono, até 5 minutos ou 2GB por arquivo, 30+ idiomas, sem diarização. O chirp-3 cobre 29 locais GA mais 82 em prévia, processa lotes de até uma hora e fluxos em tempo real, e diariza em 14 idiomas. Escolha o fun-asr-flash para clipes curtos em volume; escolha o chirp-3 quando precisar de diarização, arquivos longos ou a lista de locais mais ampla.

Preços

Chirp 3 Fun-ASR Flash Δ
Por minuto de áudio $0.016 $0.0021 7.6×

Tarifas do catálogo em tempo real, lidas no momento do build; a página de cada modelo traz a tabela de preços atual.

Onde cada um fica: preço por minuto de áudio entre os 12 modelos de transcrição de áudio com esta unidade de cobrança (escala logarítmica)

Chirp 3 · $0.016 Fun-ASR Flash · $0.0021

Capacidades

Chirp 3 Fun-ASR Flash
Diarização de locutor sim não
Streaming sim sim
Timestamps sim -

Especificações

Chirp 3 Fun-ASR Flash
Modalidades de entrada áudio áudio
Modalidades de saída texto texto
Lançamento 2025-10-13 2026-06
Limites

Auto-detected audio decoding

sync Recognize <1 min, BatchRecognize 1 min - 1 hr (<=20 min with word timestamps), StreamingRecognize for real-time

speaker diarization in BatchRecognize and Recognize (14 languages)

utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported

language-agnostic transcription

29 GA + 82 preview locales

Synchronous fast recognition, <=5 min / <=2GB per audio

context injection for domain terms

30+ languages

no diarization

Idiomas

29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize

diarization covers 14 of them

Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak

As especificações são transcritas da documentação de cada provedor; quando um provedor não publica um dado, a linha é omitida, e não inferida. Fontes completas: Chirp 3 · Fun-ASR Flash

Troque de um para o outro mudando uma linha

Os dois ids estão em todas as abas abaixo; o par de linhas destacado é a única alteração. O endpoint, a chave e o formato da requisição são os mesmos.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-3",
    # model="fun-asr-flash",  # descomente esta linha, comente a linha acima
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Obtenha sua chave de API →

Perguntas frequentes

Qual é mais barato, Chirp 3 ou Fun-ASR Flash?

Fun-ASR Flash sai mais barato na linha “Por minuto de áudio” ($0.0021 contra $0.016, 7.6× de diferença). Outras linhas podem pender para o outro lado: a tabela acima mostra todos os preços, e o custo real depende do seu mix de uso.

Posso fazer um teste A/B de Chirp 3 contra Fun-ASR Flash sem duas integrações?

Sim. Os dois são servidos pelo mesmo endpoint compatível com OpenAI, com uma única chave de API. Para trocar, basta mudar uma linha, a string do modelo; assim você pode direcionar uma parte do tráfego para cada um e comparar as contas diretamente.

Chirp 3 e Fun-ASR Flash suportam diarização de locutor?

A tabela de capacidades acima responde modelo a modelo, direto da documentação de cada provedor. Diarização, streaming e timestamps aparecem em linhas separadas porque os modelos diferem nos três.

Comparações relacionadas

Dos nossos estudos com medições