Neu Kostenlos registrieren und 10 Aufrufe gratis nutzen. Bis zu 1 $, ohne Kreditkarte.

Google TTS Chirp 3 HD vs BytePlus Seed TTS 2.0

vs

Welches Modell wofür

Nach den Katalogfakten sind diese beiden austauschbar: google-tts-chirp3-hd und seed-tts-2.0 berechnen beide $30 pro Million Eingabe-Token, beide bieten ein 4096-Token-Kontextfenster, und beide nehmen Text an und geben Audio unter derselben Sprachfunktion zurück. Da es keinen Preis-, Kontext- oder Modalitätsunterschied abzuwägen gibt, läuft die Entscheidung auf die Anbieterpräferenz hinaus - Google für google-tts-chirp3-hd, ByteDance für seed-tts-2.0 - und darauf, welche Sprachausgabe Ihre Zuhörer in einem A/B-Test tatsächlich bevorzugen. Die Budget- und Prompt-Längen-Planung kann für beide identisch erfolgen.

Preise

Google TTS Chirp 3 HD BytePlus Seed TTS 2.0 Δ
Pro 1M Zeichen $30 $30 =

Preise aus dem Live-Katalog, Stand des letzten Builds. Die aktuellen Preise stehen auf der jeweiligen Modellseite.

Einordnung: Preis pro 1M Zeichen aller 7 Text-to-Speech-Modelle mit dieser Abrechnungseinheit (logarithmische Skala)

Fähigkeiten

Google TTS Chirp 3 HD BytePlus Seed TTS 2.0
Streaming ja ja
SSML preview unsupported
Abrechnungseinheit character character

Spezifikationen

Google TTS Chirp 3 HD BytePlus Seed TTS 2.0
Eingabemodalitäten Text Text
Ausgabemodalitäten Audio Audio
Veröffentlicht 2025-03 2025-10-16
Limit pro Anfrage 5000 bytes -
Stimmen Voices are named after stars and published with a gender: Achernar, Achird, Algenib, Algieba, Alnilam, Aoede, Autonoe, Callirrhoe, Charon, Despina, Enceladus, Erinome, Fenrir, Gacrux, Iapetus, Kore, Laomedeia, Leda, Orus, Pulcherrima, Puck, Rasalgethi, Sadachbia, Sadaltager, Schedar, Sulafat, Umbriel, Vindemiatrix, Zephyr and Zubenelgenubi. A locale prefix forms the id, e.g. en-US-Chirp3-HD-Charon. Google describes the set as 30 distinct styles across many languages.

TTS 2.0 voices carry *_uranus_bigtts speaker IDs and are listed by scenario (General, Entertainment, Education, Dubbing, AudioBook, RolePlay, CustomerService) on the Voice List page

per-voice emotion via audio_params.emotion with emotion_scale 1 to 5 (default 4), speech_rate and loudness_rate in [-50, 100], and post_process.pitch in [-12, 12].

Sprachen ar-XA, bn-IN, bg-BG, yue-HK, hr-HR, cs-CZ, da-DK, nl-BE, nl-NL, en-AU, en-IN, en-GB, en-US, et-EE, fi-FI, fr-CA, fr-FR, de-DE, el-GR, gu-IN, he-IL, hi-IN, hu-HU, id-ID, it-IT, ja-JP, kn-IN, ko-KR, lv-LV, lt-LT, ml-IN, cmn-CN, mr-IN, nb-NO, pl-PL, pt-BR, pa-IN, ro-RO, ru-RU, sr-RS, sk-SK, sl-SI, es-ES, es-US, sw-KE, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN and vi-VN. English, Chinese, Japanese, German, French, Mexican Spanish, Indonesian Bahasa, Brazilian Portuguese, Italian and Korean
Stimmsteuerung
  • Voice controls are Preview: pace via speaking_rate 0.25 to 2.0
  • pause tags [pause short], [pause long] and [pause] accepted only in the markup input field, never in text, and the model may disregard tags placed unnaturally
  • custom pronunciations in IPA or X-SAMPA
  • SSML support is Preview and synchronous-only, unsupported for streaming requests, with unlisted tags ignored and say-as interpret-as=expletive or bleep not supported
context_texts and section_id are TTS 2.0 only: a plain-language instruction steers rate, emotion, volume and style (only the first list value takes effect, and its text is not billed), and section_id links up to 30 rounds or 10 minutes of earlier synthesis as historical context.
Limits

Content limit of 5,000 total bytes per synthesize request. Default response format LINEAR16

streaming supports ALAW, MULAW, OGG_OPUS and PCM, batch adds MP3, so MP3 is not available on the streaming path. The only voice type Google's comparison table marks as streaming-capable. Generally available in the global, us and eu endpoints plus asia-southeast1, europe-west2 and asia-northeast1, but out of scope for regionalization and data residency. Billed per character including spaces and newlines, with all SSML tags except <mark> counted.

Integration via uni-directional streaming HTTP, uni- or bi-directional streaming WebSocket and online SDK

sampling rate 24K/16K/8K on the uni-directional streaming and non-streaming interfaces, 48K/24K/16K/8K on the bi-directional interface

output PCM, OGG_OPUS or MP3 (WAV is accepted but returns multiple headers when streaming)

SSML is not supported

Die Spezifikationen stammen aus der Dokumentation des jeweiligen Anbieters. Veröffentlicht ein Anbieter eine Angabe nicht, lassen wir die Zeile weg, statt sie zu schätzen. Vollständige Quellen: Google TTS Chirp 3 HD · BytePlus Seed TTS 2.0

Eine Zeile genügt für den Wechsel

Beide IDs stehen in jedem Tab unten. Die beiden hervorgehobenen Zeilen sind die einzige Änderung. Gleicher Endpunkt, gleicher Schlüssel, gleiches Anfrageformat.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="google-tts-chirp3-hd",
    # model="seed-tts-2.0",  # diese Zeile einkommentieren, die darüberliegende auskommentieren
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

API-Schlüssel erstellen →

FAQ

Welches Modell ist günstiger: Google TTS Chirp 3 HD oder BytePlus Seed TTS 2.0?

Bei Pro 1M Zeichen kosten beide gleich viel ($30). Der Preis entscheidet hier also nichts; ausschlaggebend sind die Spezifikationen und Fähigkeiten weiter unten.

Kann ich Google TTS Chirp 3 HD gegen BytePlus Seed TTS 2.0 A/B-testen, ohne zweimal zu integrieren?

Ja. Beide laufen über denselben OpenAI-kompatiblen Endpunkt mit einem API-Schlüssel. Für den Wechsel ändern Sie nur eine Zeile, den Modellnamen. So können Sie einen Teil des Traffics an jedes Modell schicken und die Kosten direkt vergleichen.

Wie wird Text-to-Speech abgerechnet?

Pro Zeichen des Eingabetexts, mit einer Obergrenze für die Zeichenzahl pro Anfrage, die in der Spezifikationstabelle steht. Lange Texte müssen Sie bei beiden Modellen auf mehrere Anfragen aufteilen.

Verwandte Vergleiche

Aus unseren Studien mit eigenen Messungen