🎁 Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Google TTS Chirp 3 HD vs TTS-1 HD

vs

Welches und wann — kuratiertes Fazit, keine Benchmark-Tabelle

Beide berechnen $30 pro Million Zeichen und beide streamen, der Unterschied liegt also in Kontrolle und Länge: google-tts-chirp3-hd nimmt 5000 Bytes pro Anfrage, bietet numerische Stimmparameter und führt SSML als Vorschau, während tts-1-hd 4096 Zeichen nimmt und gar keine Stimmkontrolle bietet. Die Abdeckung ist auf beiden breit, auch wenn die Liste von tts-1-hd dem Sprachsatz von Whisper folgt statt einer aufgezählten Locale-Liste. Nehmen Sie google-tts-chirp3-hd, wenn Sie den Vortrag formen müssen, tts-1-hd, wenn die Standardstimme reicht.

Preise

Google TTS Chirp 3 HD TTS-1 HD Δ
Pro 1M Zeichen $30 $30 =

Preise aus dem Live-Katalog zum Zeitpunkt des Builds; jede Modellseite enthält die aktuelle Übersicht.

Wo sie stehen — Preis pro 1M Zeichen über alle 7 Text-to-Speech-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Fähigkeiten

Google TTS Chirp 3 HD TTS-1 HD
Streaming ja ja
SSML preview undocumented
Abrechnungseinheit character character

Spezifikationen

Google TTS Chirp 3 HD TTS-1 HD
Input-Modalitäten Text Text
Ausgabemodalitäten Audio Audio
Request-Limit 5000 bytes 4096 characters
Stimmen Voices are named after stars and published with a gender: Achernar, Achird, Algenib, Algieba, Alnilam, Aoede, Autonoe, Callirrhoe, Charon, Despina, Enceladus, Erinome, Fenrir, Gacrux, Iapetus, Kore, Laomedeia, Leda, Orus, Pulcherrima, Puck, Rasalgethi, Sadachbia, Sadaltager, Schedar, Sulafat, Umbriel, Vindemiatrix, Zephyr and Zubenelgenubi. A locale prefix forms the id, e.g. en-US-Chirp3-HD-Charon. Google describes the set as 30 distinct styles across many languages. alloy, ash, coral, echo, fable, onyx, nova, sage and shimmer, a smaller set than the full 13-voice TTS list, and voices are currently optimized for English.
Sprachen ar-XA, bn-IN, bg-BG, yue-HK, hr-HR, cs-CZ, da-DK, nl-BE, nl-NL, en-AU, en-IN, en-GB, en-US, et-EE, fi-FI, fr-CA, fr-FR, de-DE, el-GR, gu-IN, he-IL, hi-IN, hu-HU, id-ID, it-IT, ja-JP, kn-IN, ko-KR, lv-LV, lt-LT, ml-IN, cmn-CN, mr-IN, nb-NO, pl-PL, pt-BR, pa-IN, ro-RO, ru-RU, sr-RS, sk-SK, sl-SI, es-ES, es-US, sw-KE, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN and vi-VN. Generally follows the Whisper model’s language support: Afrikaans, Arabic, Armenian, Azerbaijani, Belarusian, Bosnian, Bulgarian, Catalan, Chinese, Croatian, Czech, Danish, Dutch, English, Estonian, Finnish, French, Galician, German, Greek, Hebrew, Hindi, Hungarian, Icelandic, Indonesian, Italian, Japanese, Kannada, Kazakh, Korean, Latvian, Lithuanian, Macedonian, Malay, Marathi, Maori, Nepali, Norwegian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tagalog, Tamil, Thai, Turkish, Ukrainian, Urdu, Vietnamese and Welsh, despite voices being optimized for English
Sprachsteuerung
  • Voice controls are Preview: pace via speaking_rate 0.25 to 2.0
  • pause tags [pause short], [pause long] and [pause] accepted only in the markup input field, never in text, and the model may disregard tags placed unnaturally
  • custom pronunciations in IPA or X-SAMPA
  • SSML support is Preview and synchronous-only, unsupported for streaming requests, with unlisted tags ignored and say-as interpret-as=expletive or bleep not supported
none
Limits

Content limit of 5,000 total bytes per synthesize request. Default response format LINEAR16

streaming supports ALAW, MULAW, OGG_OPUS and PCM, batch adds MP3, so MP3 is not available on the streaming path. The only voice type Google's comparison table marks as streaming-capable. Generally available in the global, us and eu endpoints plus asia-southeast1, europe-west2 and asia-northeast1, but out of scope for regionalization and data residency. Billed per character including spaces and newlines, with all SSML tags except <mark> counted.

Speech generation endpoint (v1/audio/speech) only, with Chat Completions, Responses, Realtime, Batch and Fine-tuning all listed as not supported

input text is capped at 4096 characters

output mp3 (default), opus, aac, flac, wav or pcm (raw 24 kHz 16-bit signed little-endian samples)

realtime playback via chunked transfer encoding

Die Spezifikationen sind aus der Dokumentation der jeweiligen Anbieter übernommen; eine Zeile, die ein Anbieter nicht veröffentlicht, wird weggelassen und nicht abgeleitet. Vollständige Quellen: Google TTS Chirp 3 HD · TTS-1 HD

Mit einer Zeile zwischen ihnen wechseln

Beide IDs befinden sich in jedem Tab unten — das hervorgehobene Zeilenpaar ist die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiche Request-Struktur.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="google-tts-chirp3-hd",
    # model="tts-1-hd",  # diese Zeile einkommentieren, die darüberliegende auskommentieren
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

API-Schlüssel holen →

FAQ

Welches ist günstiger, Google TTS Chirp 3 HD oder TTS-1 HD?

Sie listen dieselbe pro 1m zeichen ($30), daher ist der Preis hier nicht ausschlaggebend — siehe die Spezifikationen und Fähigkeiten unten.

Kann ich Google TTS Chirp 3 HD gegen TTS-1 HD ohne zwei Integrationen A/B-testen?

Ja. Beide werden über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel bereitgestellt — der Wechsel ist eine einzeilige Änderung des Modell-Strings, sodass Sie einen Bruchteil des Traffics an jedes Modell leiten und die Rechnungen direkt vergleichen können.

Wie wird Text-to-Speech abgerechnet?

Pro Zeichen des Eingabetextes, mit einer Zeichenobergrenze pro Anfrage, die in der Spezifikationstabelle angegeben ist. Lange Skripte müssen bei beiden Modellen über mehrere Anfragen hinweg aufgeteilt werden.

Verwandte Vergleiche