Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Chirp 2

transcription

Chirp 2 ist das mehrsprachige Modell für automatische Spracherkennung von Google Cloud, bereitgestellt über die Speech-to-Text-v2-API.

Eingabe
Audio
Ausgabe
Text
Preis
$0.016/min

Preis im Vergleich

Preisposition unter 11 vergleichbaren Modellen

Pro Minute$0.016/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Audio

Sprachen Je nach Methode unterschiedlich: BatchRecognize bietet die umfassendste Abdeckung, und Recognize liegt „auf dem Niveau von Chirp“; StreamingRecognize ist auf 16 Locales beschränkt (Chinesisch vereinfacht/traditionell, Kantonesisch, Englisch AU/IN/GB/US, Französisch CA/FR, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch (Brasilien), Spanisch ES/US)
Audio-Limits
  • Automatisch erkannte Audiodekodierung
  • synchrones Recognize <1 Min., BatchRecognize 1 Min. bis 8 Std., StreamingRecognize für Echtzeit
  • optionale Zeitstempel auf Wortebene
  • sprachunabhängige Transkription (das Modell leitet die vorherrschende gesprochene Sprache ab und transkribiert in dieser)
  • keine eigenständige Sprachidentifikation
  • keine Sprecher-Diarisierung
  • Sprachübersetzung unterstützt
Sprecher-Diarisierung Nein
Streaming-Transkription Ja
Zeitstempel Ja

Modell

Modalitäten Audio → Text
  • Die offizielle Speech-to-Text-V2-Modell-id lautet chirp_2 (mit Unterstrich)
  • GA, mit regionaler GA-Erweiterung (us-central1/europe-west4/asia-southeast1) am 2025-01-27
  • Abrechnung pro Audio

laut Offizielle Google-Dokumentation ↗

Chirp 2 in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-2",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Über Chirp 2

  • Google positioniert es als Verbesserung des ursprünglichen Chirp in Genauigkeit und Geschwindigkeit und ergänzt Zeitstempel auf Wortebene, Model Adaptation (Phrasen-Biasing) und Sprachübersetzung.
  • Es bietet automatische Interpunktion und Großschreibung, sprachunabhängige Transkription, bei der das Modell die vorherrschende gesprochene Sprache ableitet und in dieser transkribiert, sowie einen Schimpfwortfilter und unterstützt Streaming-, synchrone und Batch-Erkennung für Audio von unter einer Minute bis zu acht Stunden, der längsten Batch-Obergrenze aller Chirp-Modelle.
  • Streaming deckt sechzehn Locales ab, während Batch die umfangreichste Sprachunterstützung der Familie trägt.
  • Zeitstempel auf Wortebene sind opt-in, und Google merkt an, dass Transkriptionsqualität und -geschwindigkeit bei aktivierten Zeitstempeln leicht nachlassen; der zurückgegebene Konfidenzwert auf Wortebene ist dokumentiert als kein echter Konfidenzwert.
  • Adaptation nimmt einfache Wörter und Phrasen entgegen, Klassen-Token und benutzerdefinierte Klassen werden jedoch nicht unterstützt.
  • Die Sprachübersetzung arbeitet mit asymmetrischen Paaren, siebenundzwanzig Ausgangssprachen nach US-Englisch und achtzehn Zielsprachen daraus, und erzwungene Normalisierung sowie ein Denoiser runden den Funktionsumfang ab.
  • Die eine erhebliche Lücke ist die Sprecher-Diarisierung, die Google als nicht unterstützt führt; genau diese Fähigkeit ist der Grund, auf Chirp 3 zu wechseln.
  • Die Verfügbarkeit beschränkt sich auf einen kleinen Satz von Regionen.
  • Synthorai stellt die Chirp-2-Transkription über seinen OpenAI-kompatiblen Audio-Endpoint bereit.

FAQ

Lässt sich die Chirp 2 API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Chirp 2 mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.

Worin ist Chirp 2 am besten?

Bessere Genauigkeit und Geschwindigkeit als der Vorgänger; Zeitstempel auf Wortebene und Sprachübersetzung; Audio von unter einer Minute bis zu acht Stunden. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet Chirp 2?

Chirp 2 kostet auf Synthorai $0.016 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.

Welche Sprachen unterstützt Chirp 2?

Chirp 2 unterstützt Je nach Methode unterschiedlich: BatchRecognize bietet die umfassendste Abdeckung, und Recognize liegt „auf dem Niveau von Chirp“; StreamingRecognize ist auf 16 Locales beschränkt (Chinesisch vereinfacht/traditionell, Kantonesisch, Englisch AU/IN/GB/US, Französisch CA/FR, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch (Brasilien), Spanisch ES/US). Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.

Wie erhalte ich Zugang zu Chirp 2?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="chirp-2", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →