🎁 Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Chirp 3 vs Fun-ASR Flash

vs

Lequel, quand — verdict de synthèse, pas un tableau de benchmarks

Les deux facturent à la minute d'audio et fun-asr-flash revient 7.6x moins cher, $0.0021 contre $0.016 — mais c'est l'outil le plus étroit : reconnaissance synchrone seulement, jusqu'à 5 minutes ou 2GB par fichier, 30+ langues, sans diarisation. chirp-3 couvre 29 locales GA plus 82 en préversion, traite des lots jusqu'à une heure et des flux en temps réel, et diarise dans 14 langues. Prenez fun-asr-flash pour des clips courts en volume ; prenez chirp-3 quand il vous faut la diarisation, des fichiers longs ou la liste de locales plus large.

Tarification

Chirp 3 Fun-ASR Flash Δ
Par minute d'audio $0.016 $0.0021 7.6×

Tarifs issus du catalogue en direct au moment de la compilation ; chaque page de modèle présente la fiche actuelle.

Où ils se situent — prix par minute d'audio sur l'ensemble des 11 modèles speech-to-text pour cette unité de facturation (échelle logarithmique)

Chirp 3 · $0.016 Fun-ASR Flash · $0.0021
$0.002 · Fun-ASR Realtime $0.016 · Chirp 2

Capacités

Chirp 3 Fun-ASR Flash
Diarisation des locuteurs oui non
Streaming oui oui
Horodatages oui

Spécifications

Chirp 3 Fun-ASR Flash
Modalités d'entrée audio audio
Modalités de sortie texte texte
Sortie 2025-10-13 2026-06
Limites

Auto-detected audio decoding

sync Recognize <1 min, BatchRecognize 1 min–1 hr (<=20 min with word timestamps), StreamingRecognize for real-time

speaker diarization in BatchRecognize and Recognize (14 languages)

utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported

language-agnostic transcription

29 GA + 82 preview locales

Synchronous fast recognition, <=5 min / <=2GB per audio

context injection for domain terms

30+ languages

no diarization

Langues

29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize

diarization covers 14 of them

Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak

Les spécifications sont transcrites à partir de la documentation de chaque fournisseur ; une ligne qu'un fournisseur ne publie pas est omise plutôt que déduite. Sources complètes : Chirp 3 · Fun-ASR Flash

Basculez de l'un à l'autre avec une seule ligne

Les deux ids sont dans chaque onglet ci-dessous — la paire de lignes en surbrillance est la seule modification. Même endpoint, même clé, même structure de requête.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-3",
    # model="fun-asr-flash",  # décommentez cette ligne, commentez celle du dessus
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Obtenir une clé API →

FAQ

Lequel est le moins cher, Chirp 3 ou Fun-ASR Flash ?

Fun-ASR Flash est moins cher sur par minute d'audio ($0.0021 contre $0.016, avec un écart de 7.6×). D'autres lignes peuvent indiquer l'inverse — le tableau ci-dessus contient la fiche complète, et le coût réel dépend de votre combinaison.

Puis-je faire un test A/B de Chirp 3 par rapport à Fun-ASR Flash sans deux intégrations ?

Oui. Les deux sont servis via le même endpoint compatible OpenAI avec une seule clé API — le basculement est un changement de chaîne de modèle en une ligne, vous pouvez donc diriger une fraction du trafic vers chacun et comparer les factures directement.

Chirp 3 et Fun-ASR Flash prennent-ils en charge la diarisation des locuteurs ?

Le tableau des capacités ci-dessus y répond par modèle, directement à partir de la documentation de chaque fournisseur — la diarisation, le streaming et les horodatages sont listés séparément car les modèles diffèrent sur ces trois points.

Comparaisons associées

Issu de nos études mesurées