🎁 Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Google TTS Chirp 3 HD

Google Synthèse vocaleStreaming
Entrée$30/M
Contexte4K

Prix catalogue du fournisseur : sans majoration de plateforme, paiement à l'usage. Ce sont les prix catalogue officiels. Les clients connectés peuvent voir les prix effectifs incluant les remises de l’espace de travail sur /console/pricing.

Utilisez Google TTS Chirp 3 HD en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="google-tts-chirp3-hd",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Spécifications et limites

Audio

Langues
ar-XA, bn-IN, bg-BG, yue-HK, hr-HR, cs-CZ, da-DK, nl-BE, nl-NL, en-AU, en-IN, en-GB, en-US, et-EE, fi-FI, fr-CA, fr-FR, de-DE, el-GR, gu-IN, he-IL, hi-IN, hu-HU, id-ID, it-IT, ja-JP, kn-IN, ko-KR, lv-LV, lt-LT, ml-IN, cmn-CN, mr-IN, nb-NO, pl-PL, pt-BR, pa-IN, ro-RO, ru-RU, sr-RS, sk-SK, sl-SI, es-ES, es-US, sw-KE, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN et vi-VN.
Limites audio
  • Limite de contenu de 5 000 octets au total par requête de synthèse. Format de réponse par défaut LINEAR16
  • le streaming prend en charge ALAW, MULAW, OGG_OPUS et PCM, le mode par lots ajoute MP3, si bien que MP3 n'est pas disponible sur la voie streaming. Seul type de voix que le tableau comparatif de Google marque comme compatible avec le streaming. En disponibilité générale sur les endpoints global, us et eu ainsi que sur asia-southeast1, europe-west2 et asia-northeast1, mais hors du périmètre de régionalisation et de résidence des données. Facturé au caractère, espaces et sauts de ligne compris, toutes les balises SSML sauf <mark> étant comptées

Temps réel

Voix
Les voix portent des noms d'étoiles et sont publiées avec un genre : Achernar, Achird, Algenib, Algieba, Alnilam, Aoede, Autonoe, Callirrhoe, Charon, Despina, Enceladus, Erinome, Fenrir, Gacrux, Iapetus, Kore, Laomedeia, Leda, Orus, Pulcherrima, Puck, Rasalgethi, Sadachbia, Sadaltager, Schedar, Sulafat, Umbriel, Vindemiatrix, Zephyr et Zubenelgenubi. Un préfixe de locale forme l'identifiant, par ex. en-US-Chirp3-HD-Charon. Google décrit l'ensemble comme 30 styles distincts dans de nombreuses langues.
Session
  • Les contrôles de voix sont en préversion : le rythme via speaking_rate de 0.25 à 2.0
  • les balises de pause [pause short], [pause long] et [pause] ne sont acceptées que dans le champ d'entrée markup, jamais dans text, et le modèle peut ignorer les balises placées de façon peu naturelle
  • prononciations personnalisées en IPA ou X-SAMPA
  • la prise en charge de SSML est en préversion et synchrone uniquement, non prise en charge pour les requêtes en streaming, les balises non répertoriées étant ignorées et say-as interpret-as=expletive ou bleep n'étant pas pris en charge

Modèle

Modalités
texte → audio
  • La dernière génération de synthèse vocale de Google, animée par ses derniers modèles génératifs et décrite comme offrant réalisme et résonance émotionnelle
  • le tableau comparatif désigne les agents conversationnels comme usage visé et la page de tarification la range sous les modèles TTS les plus récents (Latest) plutôt que sous les modèles hérités (Legacy). 0,00003 $ US par caractère (30 $ US par million de caractères) avec le premier million de caractères gratuit chaque mois

selon docs officielles Google ↗

À propos de Google TTS Chirp 3 HD

30 styles distincts dans de nombreuses langues
Voix nommées d'après des étoiles et streaming de texte à faible latence
Rythme, balises de pause et prononciations personnalisées en préversion

Google TTS Chirp 3: HD est le palier que Google présente comme la dernière génération de sa technologie de synthèse vocale, animée par sa dernière génération de modèles génératifs et décrite comme offrant réalisme et résonance émotionnelle.

  • Le tableau comparatif désigne les agents conversationnels comme usage visé, et la page des voix ajoute que ces voix se déclinent en 30 styles distincts dans de nombreuses langues, adaptés aux applications temps réel comme classiques, avec des contrôles audio avancés et une communication temps réel à faible latence par streaming de texte.
  • Ce dernier point est la démarcation la plus nette face à Standard et Neural2 : Chirp 3: HD est le seul type de voix de ce tableau dont la colonne streaming indique oui.
  • Les voix portent des noms d'étoiles plutôt que des lettres, Achernar, Algenib, Aoede, Charon, Kore, Leda, Puck, Sulafat, Zephyr, Zubenelgenubi et les autres, chacune publiée avec un genre et combinée à une locale pour former des identifiants comme en-US-Chirp3-HD-Charon.
  • La couverture linguistique est une liste BCP-47 publiée qui va de ar-XA et bn-IN à cmn-CN, ja-JP et sw-KE jusqu'à vi-VN, et le palier est en disponibilité générale sur les endpoints global, us et eu, ainsi que sur asia-southeast1, europe-west2 et asia-northeast1.
  • Le format de réponse par défaut est LINEAR16 ; le streaming ajoute ALAW, MULAW, OGG_OPUS et PCM, tandis que le mode par lots ajoute MP3 par-dessus, si bien que MP3 n'est pas une option en streaming ici.
  • Ses contrôles lui sont propres et sont tous encore en préversion : le rythme via speaking_rate entre 0.25 et 2.0, des balises de pause comme [pause short] et [pause long] qui ne fonctionnent que dans le champ d'entrée markup et jamais dans text, des prononciations personnalisées en IPA ou X-SAMPA, et un SSML restreint aux requêtes synchrones dont les balises non répertoriées sont ignorées en silence.
  • Google avertit que le modèle peut ignorer les balises de pause placées de façon peu naturelle.
  • La tarification est de 0,00003 $ US par caractère, soit 30 $ US par million de caractères, avec le premier million gratuit, et le palier se situe hors du périmètre de régionalisation et de résidence des données.
  • Synthorai le sert via l'endpoint /v1/audio/speech compatible OpenAI.

FAQ

Peut-on essayer l'API Google TTS Chirp 3 HD gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $30/M de tokens en entrée, ce crédit couvre à lui seul environ 8 requêtes de ~4K tokens sur Google TTS Chirp 3 HD.

Quels sont les points forts de Google TTS Chirp 3 HD ?

30 styles distincts dans de nombreuses langues ; voix nommées d'après des étoiles et streaming de texte à faible latence ; rythme, balises de pause et prononciations personnalisées en préversion. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Google TTS Chirp 3 HD ?

Sur Synthorai, Google TTS Chirp 3 HD coûte $30 par million de tokens en entrée et $0 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme.

Google TTS Chirp 3 HD prend-il en charge la mise en cache des prompts ?

Google TTS Chirp 3 HD n'a pas de remise sur les lectures de cache sur Synthorai aujourd'hui. La mise en cache des prompts s'applique toujours aux autres modèles de la passerelle ; voir la table des prix pour les alternatives compatibles avec le cache. Comparatif de la mise en cache par fournisseur →

Comment obtenir l'accès à Google TTS Chirp 3 HD ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="google-tts-chirp3-hd", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Modèles associés

Obtenez votre clé API gratuite Comparez votre coût →