🎁 Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Chirp 3 vs Seed ASR

vs

Lequel, quand — verdict de synthèse, pas un tableau de benchmarks

Les deux facturent à la minute d'audio et diarisent tous les deux ; seed-asr-bigmodel revient 8x moins cher, $0.002 contre $0.016, et prend des fichiers bien plus longs — jusqu'à 5 heures et 512MB en mode asynchrone, contre une heure pour le mode lot de chirp-3 — avec des horodatages à la phrase et au mot. chirp-3 répond par l'ampleur : 29 locales GA plus 82 en préversion, contre un ensemble par défaut mandarin, anglais, cantonais et dialectes chinois chez seed-asr-bigmodel, avec 39 clés de langue à fixer explicitement. Choisissez sur la durée des enregistrements et la locale, pas sur le prix.

Tarification

Chirp 3 Seed ASR Δ
Par minute d'audio $0.016 $0.002

Tarifs issus du catalogue en direct au moment de la compilation ; chaque page de modèle présente la fiche actuelle.

Où ils se situent — prix par minute d'audio sur l'ensemble des 11 modèles speech-to-text pour cette unité de facturation (échelle logarithmique)

Chirp 3 · $0.016 Seed ASR · $0.002
$0.002 · Fun-ASR Realtime $0.016 · Chirp 2

Capacités

Chirp 3 Seed ASR
Diarisation des locuteurs oui oui
Streaming oui oui
Horodatages oui oui

Spécifications

Chirp 3 Seed ASR
Modalités d'entrée audio audio
Modalités de sortie texte texte
Sortie 2025-10-13
Limites

Auto-detected audio decoding

sync Recognize <1 min, BatchRecognize 1 min–1 hr (<=20 min with word timestamps), StreamingRecognize for real-time

speaker diarization in BatchRecognize and Recognize (14 languages)

utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported

language-agnostic transcription

29 GA + 82 preview locales

Async audio-file mode: <512MB, <5 hours, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A (raw PCM also accepted), results returned within 3 hours and retained 7 days

speaker diarization via enable_speaker_info (audio-file API only, best with <=10 speakers, no diarization on the streaming API)

sentence + word segmentation with start_time/end_time via show_utterances

language identification via enable_lid

hotwords/context up to 800 tokens and 20 rounds

per-call billing

Langues

29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize

diarization covers 14 of them

With `language` empty the model covers Mandarin, English, Cantonese, Shanghainese, Minnan, Sichuan and Shaanxi dialects

39 language keys can be pinned explicitly (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), plus optional auto-detection (enable_auto_lang)

Les spécifications sont transcrites à partir de la documentation de chaque fournisseur ; une ligne qu'un fournisseur ne publie pas est omise plutôt que déduite. Sources complètes : Chirp 3 · Seed ASR

Basculez de l'un à l'autre avec une seule ligne

Les deux ids sont dans chaque onglet ci-dessous — la paire de lignes en surbrillance est la seule modification. Même endpoint, même clé, même structure de requête.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-3",
    # model="seed-asr-bigmodel",  # décommentez cette ligne, commentez celle du dessus
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Obtenir une clé API →

FAQ

Lequel est le moins cher, Chirp 3 ou Seed ASR ?

Seed ASR est moins cher sur par minute d'audio ($0.002 contre $0.016, avec un écart de 8.0×). D'autres lignes peuvent indiquer l'inverse — le tableau ci-dessus contient la fiche complète, et le coût réel dépend de votre combinaison.

Puis-je faire un test A/B de Chirp 3 par rapport à Seed ASR sans deux intégrations ?

Oui. Les deux sont servis via le même endpoint compatible OpenAI avec une seule clé API — le basculement est un changement de chaîne de modèle en une ligne, vous pouvez donc diriger une fraction du trafic vers chacun et comparer les factures directement.

Chirp 3 et Seed ASR prennent-ils en charge la diarisation des locuteurs ?

Le tableau des capacités ci-dessus y répond par modèle, directement à partir de la documentation de chaque fournisseur — la diarisation, le streaming et les horodatages sont listés séparément car les modèles diffèrent sur ces trois points.

Comparaisons associées

Issu de nos études mesurées