Neu Kostenlos registrieren und 10 Aufrufe gratis nutzen. Bis zu 1 $, ohne Kreditkarte.

Chirp 3 vs Seed ASR

vs

Welches Modell wofür

Beide rechnen pro Audiominute ab und beide trennen Sprecher; seed-asr-bigmodel ist 8x günstiger, $0.002 gegenüber $0.016, und nimmt weit längere Dateien - bis zu 5 Stunden und 512MB im asynchronen Modus, gegenüber einer Stunde im Stapelmodus von chirp-3 - mit Zeitstempeln auf Satz- und Wortebene. chirp-3 antwortet stattdessen mit Breite: 29 GA- plus 82 Vorschau-Locales, gegenüber einem Standardsatz aus Mandarin, Englisch, Kantonesisch und chinesischen Dialekten bei seed-asr-bigmodel, mit 39 explizit setzbaren Sprachschlüsseln. Wählen Sie nach Aufnahmelänge und Locale, nicht nach Preis.

Preise

Chirp 3 Seed ASR Δ
Pro Audiominute $0.016 $0.002 8×

Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.

Einordnung: Preis pro Audiominute aller 12 Speech-to-Text-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Chirp 3 · $0.016 Seed ASR · $0.002

Fähigkeiten

Chirp 3 Seed ASR
Sprecherdiarisierung ja ja
Streaming ja ja
Zeitstempel ja ja

Spezifikationen

Chirp 3 Seed ASR
Eingabemodalitäten Audio Audio
Ausgabemodalitäten Text Text
Veröffentlicht 2025-10-13 2025-12-05
Limits

Auto-detected audio decoding

sync Recognize <1 min, BatchRecognize 1 min - 1 hr (<=20 min with word timestamps), StreamingRecognize for real-time

speaker diarization in BatchRecognize and Recognize (14 languages)

utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported

language-agnostic transcription

29 GA + 82 preview locales

Async audio-file mode: <512MB, <5 hours, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A (raw PCM also accepted), results returned within 3 hours and retained 7 days

speaker diarization via enable_speaker_info (audio-file API only, best with <=10 speakers, no diarization on the streaming API)

sentence + word segmentation with start_time/end_time via show_utterances

language identification via enable_lid

hotwords/context up to 800 tokens and 20 rounds

per-call billing

Sprachen

29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize

diarization covers 14 of them

With `language` empty the model covers Mandarin, English, Cantonese, Shanghainese, Minnan, Sichuan and Shaanxi dialects

39 language keys can be pinned explicitly (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), plus optional auto-detection (enable_auto_lang)

Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: Chirp 3 · Seed ASR

Eine Zeile genügt für den Wechsel

Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-3",
    # model="seed-asr-bigmodel",  # diese Zeile einkommentieren, die darüberliegende auskommentieren
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

API-Schlüssel erstellen →

FAQ

Welches Modell ist günstiger: Chirp 3 oder Seed ASR?

Seed ASR ist bei Pro Audiominute günstiger ($0.002 vs. $0.016, Faktor 8.0). Bei anderen Zeilen kann es umgekehrt sein. Die Tabelle oben zeigt alle Preise, und die tatsächlichen Kosten hängen von Ihrem Mix ab.

Kann ich Chirp 3 gegen Seed ASR A/B-testen, ohne zweimal zu integrieren?

Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.

Unterstützen Chirp 3 und Seed ASR Sprecherdiarisierung?

Das beantwortet die Tabelle der Fähigkeiten oben für jedes Modell einzeln, direkt aus der Dokumentation des jeweiligen Anbieters. Diarisierung, Streaming und Zeitstempel stehen dort getrennt, weil sich die Modelle in allen drei Punkten unterscheiden.

Verwandte Vergleiche

Aus unseren Studien mit eigenen Messungen