🎁 Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Google TTS Chirp 3 HD vs TTS-1 HD

vs

Lequel, quand — verdict de synthèse, pas un tableau de benchmarks

Les deux facturent $30 par million de caractères et diffusent tous les deux, donc l'écart porte sur le contrôle et la longueur : google-tts-chirp3-hd prend 5000 octets par requête, expose des paramètres numériques de voix et liste SSML en préversion, tandis que tts-1-hd prend 4096 caractères et n'offre aucun contrôle de voix. La couverture est large des deux côtés, même si la liste de tts-1-hd suit le jeu de langues de Whisper plutôt qu'une liste de locales énumérée. Prenez google-tts-chirp3-hd quand il faut façonner le rendu, tts-1-hd quand la voix par défaut suffit.

Tarification

Google TTS Chirp 3 HD TTS-1 HD Δ
Par 1M caractères $30 $30 =

Tarifs issus du catalogue en direct au moment de la compilation ; chaque page de modèle présente la fiche actuelle.

Où ils se situent — prix pour 1M de caractères sur l'ensemble des 7 modèles text-to-speech pour cette unité de facturation (échelle logarithmique)

Capacités

Google TTS Chirp 3 HD TTS-1 HD
Streaming oui oui
SSML preview undocumented
Unité de facturation character character

Spécifications

Google TTS Chirp 3 HD TTS-1 HD
Modalités d'entrée texte texte
Modalités de sortie audio audio
Limite de requêtes 5000 bytes 4096 characters
Voix Voices are named after stars and published with a gender: Achernar, Achird, Algenib, Algieba, Alnilam, Aoede, Autonoe, Callirrhoe, Charon, Despina, Enceladus, Erinome, Fenrir, Gacrux, Iapetus, Kore, Laomedeia, Leda, Orus, Pulcherrima, Puck, Rasalgethi, Sadachbia, Sadaltager, Schedar, Sulafat, Umbriel, Vindemiatrix, Zephyr and Zubenelgenubi. A locale prefix forms the id, e.g. en-US-Chirp3-HD-Charon. Google describes the set as 30 distinct styles across many languages. alloy, ash, coral, echo, fable, onyx, nova, sage and shimmer, a smaller set than the full 13-voice TTS list, and voices are currently optimized for English.
Langues ar-XA, bn-IN, bg-BG, yue-HK, hr-HR, cs-CZ, da-DK, nl-BE, nl-NL, en-AU, en-IN, en-GB, en-US, et-EE, fi-FI, fr-CA, fr-FR, de-DE, el-GR, gu-IN, he-IL, hi-IN, hu-HU, id-ID, it-IT, ja-JP, kn-IN, ko-KR, lv-LV, lt-LT, ml-IN, cmn-CN, mr-IN, nb-NO, pl-PL, pt-BR, pa-IN, ro-RO, ru-RU, sr-RS, sk-SK, sl-SI, es-ES, es-US, sw-KE, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN and vi-VN. Generally follows the Whisper model’s language support: Afrikaans, Arabic, Armenian, Azerbaijani, Belarusian, Bosnian, Bulgarian, Catalan, Chinese, Croatian, Czech, Danish, Dutch, English, Estonian, Finnish, French, Galician, German, Greek, Hebrew, Hindi, Hungarian, Icelandic, Indonesian, Italian, Japanese, Kannada, Kazakh, Korean, Latvian, Lithuanian, Macedonian, Malay, Marathi, Maori, Nepali, Norwegian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tagalog, Tamil, Thai, Turkish, Ukrainian, Urdu, Vietnamese and Welsh, despite voices being optimized for English
Contrôle vocal
  • Voice controls are Preview: pace via speaking_rate 0.25 to 2.0
  • pause tags [pause short], [pause long] and [pause] accepted only in the markup input field, never in text, and the model may disregard tags placed unnaturally
  • custom pronunciations in IPA or X-SAMPA
  • SSML support is Preview and synchronous-only, unsupported for streaming requests, with unlisted tags ignored and say-as interpret-as=expletive or bleep not supported
none
Limites

Content limit of 5,000 total bytes per synthesize request. Default response format LINEAR16

streaming supports ALAW, MULAW, OGG_OPUS and PCM, batch adds MP3, so MP3 is not available on the streaming path. The only voice type Google's comparison table marks as streaming-capable. Generally available in the global, us and eu endpoints plus asia-southeast1, europe-west2 and asia-northeast1, but out of scope for regionalization and data residency. Billed per character including spaces and newlines, with all SSML tags except <mark> counted.

Speech generation endpoint (v1/audio/speech) only, with Chat Completions, Responses, Realtime, Batch and Fine-tuning all listed as not supported

input text is capped at 4096 characters

output mp3 (default), opus, aac, flac, wav or pcm (raw 24 kHz 16-bit signed little-endian samples)

realtime playback via chunked transfer encoding

Les spécifications sont transcrites à partir de la documentation de chaque fournisseur ; une ligne qu'un fournisseur ne publie pas est omise plutôt que déduite. Sources complètes : Google TTS Chirp 3 HD · TTS-1 HD

Basculez de l'un à l'autre avec une seule ligne

Les deux ids sont dans chaque onglet ci-dessous — la paire de lignes en surbrillance est la seule modification. Même endpoint, même clé, même structure de requête.

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="google-tts-chirp3-hd",
    # model="tts-1-hd",  # décommentez cette ligne, commentez celle du dessus
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Obtenir une clé API →

FAQ

Lequel est le moins cher, Google TTS Chirp 3 HD ou TTS-1 HD ?

Ils affichent la même valeur pour par 1m caractères ($30), donc le prix ne permet pas de trancher ici — consultez les spécifications et les capacités ci-dessous.

Puis-je faire un test A/B de Google TTS Chirp 3 HD par rapport à TTS-1 HD sans deux intégrations ?

Oui. Les deux sont servis via le même endpoint compatible OpenAI avec une seule clé API — le basculement est un changement de chaîne de modèle en une ligne, vous pouvez donc diriger une fraction du trafic vers chacun et comparer les factures directement.

Comment la synthèse vocale est-elle facturée ?

Par caractère de texte en entrée, avec un plafond de caractères par requête indiqué dans le tableau des spécifications. Les scripts longs doivent être segmentés sur plusieurs requêtes pour chacun des modèles.

Comparaisons associées