Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Chirp 3

Veröffentlicht 2025-10-13

transcription

Chirp 3 ist die neueste Generation von Googles mehrsprachigen, ASR-spezifischen generativen Modellen auf der Speech-to-Text-v2-API, allgemein verfügbar seit Oktober 2025 in den Multi-Regionen USA und EU.

Eingabe
Audio
Ausgabe
Text
Preis
$0.016/min

Preis im Vergleich

Preisposition unter 11 vergleichbaren Modellen

Pro Minute$0.016/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Audio

Sprachen 29 GA- und 82 Preview-Locales (111 insgesamt) über StreamingRecognize, Recognize und BatchRecognize hinweg; die Diarisierung deckt 14 davon ab
Audio-Limits
  • Automatisch erkannte Audiodekodierung
  • synchrones Recognize <1 Min., BatchRecognize 1 Min. - 1 Std. (<=20 Min. mit Wort-Zeitstempeln), StreamingRecognize für Echtzeit
  • Sprecher-Diarisierung in BatchRecognize und Recognize (14 Sprachen)
  • Zeitstempel auf Äußerungsebene (nur StreamingRecognize), Zeitstempel auf Wortebene als nicht unterstützt gelistet
  • sprachunabhängige Transkription
  • 29 GA- und 82 Preview-Locales
Sprecher-Diarisierung Ja
Streaming-Transkription Ja
Zeitstempel Ja

Modell

Modalitäten Audio → Text
  • Die offizielle Modell-id lautet chirp_3
  • Private Preview am 2025-04-11, GA am 2025-10-13 laut den Speech-to-Text-Release-Notes
  • Abrechnung pro Audio

laut Offizielle Google-Dokumentation ↗

Chirp 3 in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-3",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Über Chirp 3

  • Die offizielle Dokumentation hebt eine gegenüber früheren Chirp-Modellen verbesserte Genauigkeit und Geschwindigkeit hervor sowie zwei neue Fähigkeiten: Sprecher-Diarisierung und automatische Spracherkennung.
  • Es veröffentlicht mehr als hundert Locales über allgemein verfügbare und Preview-Stufen hinweg, erzeugt automatische Interpunktion und Großschreibung und akzeptiert Speech Adaptation mit bis zu 1.000 Phrasen-Hinweisen, wobei Google empfiehlt, so wenige Einträge wie möglich zu verwenden, damit Begriffe außerhalb der Adaptation nicht schlechter erkannt werden.
  • Streaming-, synchrone und Batch-Erkennung werden allesamt unterstützt, und die Diarisierung steht in der Batch-Erkennung für vierzehn Sprachen zur Verfügung.
  • Zu den neuen Steuerungen zählen ein Custom Prompt in der Preview, um die Formatierung des Transkripts zu lenken, ein Denoiser-Flag, zu dem Google warnt, dass es menschliche Hintergrundstimmen nicht entfernen kann, und eine Endpointing-Empfindlichkeit mit standard, short oder supershort.
  • Das Upgrade ist nicht rein additiv, und die Lücken sollten Sie vor dem Wechsel prüfen: Chirp 3 dokumentiert Zeitstempel auf Äußerungs- statt auf Wortebene, dokumentiert weder Sprachübersetzung noch einen Schimpfwortfilter und begrenzt Batch-Audio auf eine Stunde, bei aktivierten Zeitstempeln auf zwanzig Minuten, gegenüber den acht Stunden von Chirp 2.
  • Auf Synthorai ist Chirp 3 über dieselbe OpenAI-kompatible Transkriptionsschnittstelle erreichbar wie jedes andere Sprachmodell.

FAQ

Lässt sich die Chirp 3 API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Chirp 3 mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.

Worin ist Chirp 3 am besten?

Sprecher-Diarisierung und automatische Spracherkennung; transkribiert mehr als 100 Sprachen und Varianten; Speech Adaptation mit bis zu 1.000 Phrasen-Hinweisen. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Chirp 3?

Chirp 3 kostet auf Synthorai $0.016 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.

Welche Sprachen unterstützt Chirp 3?

Chirp 3 unterstützt 29 GA- und 82 Preview-Locales (111 insgesamt) über StreamingRecognize, Recognize und BatchRecognize hinweg; die Diarisierung deckt 14 davon ab. Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.

Wie erhalte ich Zugang zu Chirp 3?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="chirp-3", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →