Chirp 2 ist das mehrsprachige Modell für automatische Spracherkennung von Google Cloud, bereitgestellt über die Speech-to-Text-v2-API.
- Eingabe
- Audio
- Ausgabe
- Text
- Preis
- $0.016/min
Preis im Vergleich
Preisposition unter 11 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Audio
| Sprachen | Je nach Methode unterschiedlich: BatchRecognize bietet die umfassendste Abdeckung, und Recognize liegt „auf dem Niveau von Chirp“; StreamingRecognize ist auf 16 Locales beschränkt (Chinesisch vereinfacht/traditionell, Kantonesisch, Englisch AU/IN/GB/US, Französisch CA/FR, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch (Brasilien), Spanisch ES/US) |
|---|---|
| Audio-Limits |
|
| Sprecher-Diarisierung | Nein |
| Streaming-Transkription | Ja |
| Zeitstempel | Ja |
Modell
| Modalitäten | Audio → Text |
|---|
- Die offizielle Speech-to-Text-V2-Modell-id lautet chirp_2 (mit Unterstrich)
- GA, mit regionaler GA-Erweiterung (us-central1/europe-west4/asia-southeast1) am 2025-01-27
- Abrechnung pro Audio
Chirp 2 in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/audio/transcriptions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-2",
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-2",
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-2" \
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-2",
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-2")
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());Über Chirp 2
- Google positioniert es als Verbesserung des ursprünglichen Chirp in Genauigkeit und Geschwindigkeit und ergänzt Zeitstempel auf Wortebene, Model Adaptation (Phrasen-Biasing) und Sprachübersetzung.
- Es bietet automatische Interpunktion und Großschreibung, sprachunabhängige Transkription, bei der das Modell die vorherrschende gesprochene Sprache ableitet und in dieser transkribiert, sowie einen Schimpfwortfilter und unterstützt Streaming-, synchrone und Batch-Erkennung für Audio von unter einer Minute bis zu acht Stunden, der längsten Batch-Obergrenze aller Chirp-Modelle.
- Streaming deckt sechzehn Locales ab, während Batch die umfangreichste Sprachunterstützung der Familie trägt.
- Zeitstempel auf Wortebene sind opt-in, und Google merkt an, dass Transkriptionsqualität und -geschwindigkeit bei aktivierten Zeitstempeln leicht nachlassen; der zurückgegebene Konfidenzwert auf Wortebene ist dokumentiert als kein echter Konfidenzwert.
- Adaptation nimmt einfache Wörter und Phrasen entgegen, Klassen-Token und benutzerdefinierte Klassen werden jedoch nicht unterstützt.
- Die Sprachübersetzung arbeitet mit asymmetrischen Paaren, siebenundzwanzig Ausgangssprachen nach US-Englisch und achtzehn Zielsprachen daraus, und erzwungene Normalisierung sowie ein Denoiser runden den Funktionsumfang ab.
- Die eine erhebliche Lücke ist die Sprecher-Diarisierung, die Google als nicht unterstützt führt; genau diese Fähigkeit ist der Grund, auf Chirp 3 zu wechseln.
- Die Verfügbarkeit beschränkt sich auf einen kleinen Satz von Regionen.
- Synthorai stellt die Chirp-2-Transkription über seinen OpenAI-kompatiblen Audio-Endpoint bereit.
FAQ
Lässt sich die Chirp 2 API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Chirp 2 mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.
Worin ist Chirp 2 am besten?
Bessere Genauigkeit und Geschwindigkeit als der Vorgänger; Zeitstempel auf Wortebene und Sprachübersetzung; Audio von unter einer Minute bis zu acht Stunden. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Chirp 2?
Chirp 2 kostet auf Synthorai $0.016 pro transkribierter Audiominute. Nutzungsbasierte Abrechnung, ohne Plattform-Aufschlag, ohne Abo.
Welche Sprachen unterstützt Chirp 2?
Chirp 2 unterstützt Je nach Methode unterschiedlich: BatchRecognize bietet die umfassendste Abdeckung, und Recognize liegt „auf dem Niveau von Chirp“; StreamingRecognize ist auf 16 Locales beschränkt (Chinesisch vereinfacht/traditionell, Kantonesisch, Englisch AU/IN/GB/US, Französisch CA/FR, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch (Brasilien), Spanisch ES/US). Auf Synthorai rufen Sie das Modell über POST /v1/audio/transcriptions auf, das OpenAI-Transkriptions-API-Format.
Wie erhalte ich Zugang zu Chirp 2?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="chirp-2", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.