Google TTS Chirp 3: HD ist die Stufe, die Google als neueste Generation der Text-to-Speech-Technologie bezeichnet, angetrieben von seiner neuesten Generation generativer Modelle und beschrieben als etwas, das Realismus und emotionale Resonanz liefert.
- Eingabe
- Text $30/M
- Ausgabe
- Audio
- Kontext
- 4K
Preis im Vergleich
Preisposition unter 7 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Sprachsynthese
| Synthesesprachen | ar-XA, bn-IN, bg-BG, yue-HK, hr-HR, cs-CZ, da-DK, nl-BE, nl-NL, en-AU, en-IN, en-GB, en-US, et-EE, fi-FI, fr-CA, fr-FR, de-DE, el-GR, gu-IN, he-IL, hi-IN, hu-HU, id-ID, it-IT, ja-JP, kn-IN, ko-KR, lv-LV, lt-LT, ml-IN, cmn-CN, mr-IN, nb-NO, pl-PL, pt-BR, pa-IN, ro-RO, ru-RU, sr-RS, sk-SK, sl-SI, es-ES, es-US, sw-KE, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN und vi-VN. |
|---|---|
| Stimmen | Die Stimmen sind nach Sternen benannt und mit einem Geschlecht veröffentlicht: Achernar, Achird, Algenib, Algieba, Alnilam, Aoede, Autonoe, Callirrhoe, Charon, Despina, Enceladus, Erinome, Fenrir, Gacrux, Iapetus, Kore, Laomedeia, Leda, Orus, Pulcherrima, Puck, Rasalgethi, Sadachbia, Sadaltager, Schedar, Sulafat, Umbriel, Vindemiatrix, Zephyr und Zubenelgenubi. Ein Locale-Präfix bildet die id, z. B. en-US-Chirp3-HD-Charon. Google beschreibt den Satz als 30 verschiedene Stile über viele Sprachen hinweg. |
| Eingabelimit | 5,000 Bytes Anbieter geben dieses Limit in unterschiedlichen Einheiten an: Bei nicht lateinischem Text ist ein Byte-Limit kein Zeichen-Limit. |
| Streaming-Synthese | Ja |
| SSML | Vorschau, nur synchrone Anfragen |
| Stimmsteuerung | Numerische Parameter |
| Was akzeptiert wird |
|
| Abrechnungseinheit | Pro Eingabezeichen Der Anbieter gibt nicht an, ob ein Mehrbyte-Zeichen einmal berechnet wird; eine CJK-Kostenschätzung allein aus diesem Tarif ist daher nicht als verlässlich dokumentiert. |
| Endpunkte und Formate |
|
Modell
| Modalitäten | Text → Audio |
|---|
- Googles neueste Text-to-Speech-Generation, angetrieben von seinen neuesten generativen Modellen und beschrieben als etwas, das Realismus und emotionale Resonanz liefert
- die Vergleichstabelle nennt dialogorientierte Agenten als vorgesehenen Einsatzzweck und führt sie auf der Preisseite unter Latest TTS models statt unter Legacy. US$0.00003 pro Zeichen (US$30 pro 1 Million Zeichen), wobei die erste 1 Million Zeichen jeden Monat kostenlos ist
Google TTS Chirp 3 HD in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="google-tts-chirp3-hd",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "google-tts-chirp3-hd",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "google-tts-chirp3-hd",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "google-tts-chirp3-hd",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("google-tts-chirp3-hd")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über Google TTS Chirp 3 HD
- Die Vergleichstabelle nennt dialogorientierte Agenten als vorgesehenen Einsatzzweck, und die Stimmenseite ergänzt, dass diese Stimmen in 30 verschiedenen Stilen über viele Sprachen hinweg kommen, geeignet für Echtzeit- und Standardanwendungen, mit fortgeschrittenen Audio-Steuerungen und latenzarmer Echtzeitkommunikation per Text-Streaming.
- Dieser letzte Punkt ist die schärfste Trennlinie gegenüber Standard und Neural2: Chirp 3: HD ist der einzige Stimmtyp in jener Tabelle, dessen Streaming-Spalte yes lautet.
- Die Stimmen sind nach Sternen statt nach Buchstaben benannt, Achernar, Algenib, Aoede, Charon, Kore, Leda, Puck, Sulafat, Zephyr, Zubenelgenubi und die übrigen, jeweils mit einem Geschlecht veröffentlicht und mit einer Locale zu ids wie en-US-Chirp3-HD-Charon kombiniert.
- Die Sprachabdeckung ist eine veröffentlichte BCP-47-Liste, die von ar-XA und bn-IN über cmn-CN, ja-JP und sw-KE bis vi-VN reicht, und die Stufe ist allgemein verfügbar auf den Endpunkten global, us und eu sowie asia-southeast1, europe-west2 und asia-northeast1.
- Das Standard-Antwortformat ist LINEAR16; Streaming ergänzt ALAW, MULAW, OGG_OPUS und PCM, während Batch zusätzlich MP3 hinzufügt, sodass MP3 hier keine Streaming-Option ist.
- Ihre Steuerungen sind eigenständig und allesamt noch Preview: Tempo über speaking_rate zwischen 0.25 und 2.0, Pausen-Tags wie [pause short] und [pause long], die nur im markup-Eingabefeld und nie im Text funktionieren, eigene Aussprachen in IPA oder X-SAMPA sowie SSML, beschränkt auf synchrone Anfragen, wobei nicht gelistete Tags stillschweigend ignoriert werden.
- Google warnt, dass das Modell unnatürlich platzierte Pausen-Tags missachten kann.
- Der Preis liegt bei US$0.00003 pro Zeichen, angegeben als US$30 pro 1 Million Zeichen, mit der ersten 1 Million kostenlos, und die Stufe liegt außerhalb des Geltungsbereichs von Regionalisierung und Datenresidenz.
- Synthorai stellt es über den OpenAI-kompatiblen Endpoint /v1/audio/speech bereit.
FAQ
Lässt sich die Google TTS Chirp 3 HD API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um Google TTS Chirp 3 HD mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.
Worin ist Google TTS Chirp 3 HD am besten?
30 verschiedene Stile über viele Sprachen hinweg; nach Sternen benannte Stimmen und latenzarmes Text-Streaming; Tempo, Pausen-Tags und eigene Aussprachen in Preview. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet Google TTS Chirp 3 HD?
Google TTS Chirp 3 HD kostet auf Synthorai $30 pro Million Input-Tokens und $0 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.
Unterstützt Google TTS Chirp 3 HD Prompt-Caching?
Google TTS Chirp 3 HD hat auf Synthorai derzeit keinen Cache-Lese-Rabatt. Prompt-Caching gilt weiterhin für andere Modelle auf dem Gateway; cache-fähige Alternativen finden Sie in der Preistabelle. Caching-Vergleich der Anbieter →
Wie erhalte ich Zugang zu Google TTS Chirp 3 HD?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="google-tts-chirp3-hd", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.