Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Chirp 3 vs Seed ASR

vs

Lequel choisir, et quand

Les deux facturent à la minute d'audio et diarisent tous les deux ; seed-asr-bigmodel revient 8x moins cher, $0.002 contre $0.016, et prend des fichiers bien plus longs - jusqu'à 5 heures et 512MB en mode asynchrone, contre une heure pour le mode lot de chirp-3 - avec des horodatages à la phrase et au mot. chirp-3 répond par l'ampleur : 29 locales GA plus 82 en préversion, contre un ensemble par défaut mandarin, anglais, cantonais et dialectes chinois chez seed-asr-bigmodel, avec 39 clés de langue à fixer explicitement. Choisissez sur la durée des enregistrements et la locale, pas sur le prix.

Tarifs

Chirp 3 Seed ASR Δ
Par minute d'audio $0.016 $0.002 8×

Tarifs relevés dans le catalogue en direct à la génération du site ; la page de chaque modèle affiche la grille tarifaire à jour.

Leur position : prix par minute d'audio, parmi les 12 modèles de transcription vocale facturés dans cette unité (échelle logarithmique)

Chirp 3 · $0.016 Seed ASR · $0.002

Capacités

Chirp 3 Seed ASR
Diarisation des locuteurs oui oui
Streaming oui oui
Horodatages oui oui

Spécifications

Chirp 3 Seed ASR
Modalités d'entrée audio audio
Modalités de sortie texte texte
Date de sortie 2025-10-13 2025-12-05
Limites

Auto-detected audio decoding

sync Recognize <1 min, BatchRecognize 1 min - 1 hr (<=20 min with word timestamps), StreamingRecognize for real-time

speaker diarization in BatchRecognize and Recognize (14 languages)

utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported

language-agnostic transcription

29 GA + 82 preview locales

Async audio-file mode: <512MB, <5 hours, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A (raw PCM also accepted), results returned within 3 hours and retained 7 days

speaker diarization via enable_speaker_info (audio-file API only, best with <=10 speakers, no diarization on the streaming API)

sentence + word segmentation with start_time/end_time via show_utterances

language identification via enable_lid

hotwords/context up to 800 tokens and 20 rounds

per-call billing

Langues

29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize

diarization covers 14 of them

With `language` empty the model covers Mandarin, English, Cantonese, Shanghainese, Minnan, Sichuan and Shaanxi dialects

39 language keys can be pinned explicitly (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), plus optional auto-detection (enable_auto_lang)

Les spécifications sont reprises de la documentation de chaque fournisseur ; quand un fournisseur ne publie pas une valeur, la ligne est omise et non déduite. Sources complètes : Chirp 3 · Seed ASR

Passez de l'un à l'autre en changeant une seule ligne

Les deux identifiants figurent dans chaque onglet ci-dessous : les deux lignes surlignées sont le seul changement. Même endpoint, même clé, même format de requête.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-3",
    # model="seed-asr-bigmodel",  # décommentez cette ligne, commentez celle du dessus
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Obtenez votre clé API →

FAQ

Lequel est le moins cher, Chirp 3 ou Seed ASR ?

Seed ASR est moins cher sur la ligne « Par minute d'audio » ($0.002 contre $0.016, soit un écart de 8.0×). D'autres lignes peuvent dire l'inverse : le tableau ci-dessus donne la grille tarifaire complète, et le coût réel dépend de la composition de votre trafic.

Puis-je faire un test A/B entre Chirp 3 et Seed ASR sans deux intégrations ?

Oui. Les deux passent par le même endpoint compatible OpenAI, avec une seule clé API. Pour passer de l'un à l'autre, il suffit de changer l'identifiant du modèle, soit une ligne : vous pouvez donc envoyer une part du trafic à chacun et comparer directement les factures.

Chirp 3 et Seed ASR prennent-ils en charge la diarisation des locuteurs ?

Le tableau des capacités ci-dessus répond modèle par modèle, d'après la documentation de chaque fournisseur. La diarisation, le streaming et les horodatages y figurent séparément, car les modèles diffèrent sur ces trois points.

Comparatifs associés

Nos études, mesures à l'appui