Chirp 3 vs Fun-ASR Flash
Qual usar, quando — veredito curado, não uma tabela de benchmark
Ambos cobram por minuto de áudio e o fun-asr-flash sai 7.6x mais barato, $0.0021 contra $0.016 — mas é a ferramenta mais estreita: apenas reconhecimento síncrono, até 5 minutos ou 2GB por arquivo, 30+ idiomas, sem diarização. O chirp-3 cobre 29 locais GA mais 82 em prévia, processa lotes de até uma hora e fluxos em tempo real, e diariza em 14 idiomas. Escolha o fun-asr-flash para clipes curtos em volume; escolha o chirp-3 quando precisar de diarização, arquivos longos ou a lista de locais mais ampla.
Preços
| Chirp 3 | Fun-ASR Flash | Δ | |
|---|---|---|---|
| Por minuto de áudio | $0.016 | $0.0021 | 7.6× |
Tarifas do catálogo em tempo real no momento do build; a página de cada modelo contém o cartão atual.
Onde eles se posicionam — preço por minuto de áudio entre todos os 11 modelos de fala para texto nesta unidade de cobrança (escala logarítmica)
Capacidades
| Chirp 3 | Fun-ASR Flash | |
|---|---|---|
| Diarização de locutor | sim | não |
| Streaming | sim | sim |
| Timestamps | sim | — |
Especificações
| Chirp 3 | Fun-ASR Flash | |
|---|---|---|
| Modalidades de entrada | áudio | áudio |
| Modalidades de saída | texto | texto |
| Lançamento | 2025-10-13 | 2026-06 |
| Limites | Auto-detected audio decoding sync Recognize <1 min, BatchRecognize 1 min–1 hr (<=20 min with word timestamps), StreamingRecognize for real-time speaker diarization in BatchRecognize and Recognize (14 languages) utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported language-agnostic transcription 29 GA + 82 preview locales | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization |
| Idiomas | 29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize diarization covers 14 of them | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak |
As especificações são transcritas da documentação de cada fornecedor; uma linha que um fornecedor não publica é omitida em vez de ser inferida. Fontes completas: Chirp 3 · Fun-ASR Flash
Alterne entre eles com uma linha
Ambos os IDs estão em todas as abas abaixo — o par de linhas destacado é a única edição. Mesmo endpoint, mesma chave, mesmo formato de requisição.
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-3",
# model="fun-asr-flash", # descomente esta linha, comente a linha acima
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-3",
// model: "fun-asr-flash", // descomente esta linha, comente a linha acima
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-3" \
# -F model="fun-asr-flash" \ # descomente esta linha, comente a linha acima
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-3",
// Model: "fun-asr-flash", // descomente esta linha, comente a linha acima
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-3")
// .model("fun-asr-flash") // descomente esta linha, comente a linha acima
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());FAQ
Qual é mais barato, Chirp 3 ou Fun-ASR Flash?
Fun-ASR Flash é mais barato em por minuto de áudio ($0.0021 vs $0.016, com 7.6× de diferença). Outras linhas podem apontar para o outro lado — a tabela acima traz o quadro completo, e o custo real depende do seu mix.
Posso fazer um teste A/B de Chirp 3 contra Fun-ASR Flash sem duas integrações?
Sim. Ambos são servidos pelo mesmo endpoint compatível com OpenAI com uma única chave de API — a troca é uma alteração de uma linha na string do modelo, de modo que você pode rotear uma fração do tráfego para cada um e comparar as faturas diretamente.
Chirp 3 e Fun-ASR Flash suportam diarização de locutor?
A tabela de capacidades acima responde a isso por modelo, direto da documentação de cada fornecedor — diarização, streaming e timestamps são listados separadamente porque os modelos diferem nos três.