Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Google TTS Chirp 3 HD

Google TTS Chirp 3: HD è il livello che Google definisce l'ultima generazione della tecnologia Text-to-Speech, alimentato dalla sua ultima generazione di modelli generativi e descritto come capace di offrire realismo e risonanza emotiva.

Input
testo $30/M
Output
audio
Contesto
4K

Il prezzo nel contesto

Posizione del prezzo tra 7 modelli comparabili

Input$30/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Sintesi vocale

Lingue di sintesi ar-XA, bn-IN, bg-BG, yue-HK, hr-HR, cs-CZ, da-DK, nl-BE, nl-NL, en-AU, en-IN, en-GB, en-US, et-EE, fi-FI, fr-CA, fr-FR, de-DE, el-GR, gu-IN, he-IL, hi-IN, hu-HU, id-ID, it-IT, ja-JP, kn-IN, ko-KR, lv-LV, lt-LT, ml-IN, cmn-CN, mr-IN, nb-NO, pl-PL, pt-BR, pa-IN, ro-RO, ru-RU, sr-RS, sk-SK, sl-SI, es-ES, es-US, sw-KE, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN e vi-VN.
Voci Le voci prendono il nome da stelle e sono pubblicate con un genere: Achernar, Achird, Algenib, Algieba, Alnilam, Aoede, Autonoe, Callirrhoe, Charon, Despina, Enceladus, Erinome, Fenrir, Gacrux, Iapetus, Kore, Laomedeia, Leda, Orus, Pulcherrima, Puck, Rasalgethi, Sadachbia, Sadaltager, Schedar, Sulafat, Umbriel, Vindemiatrix, Zephyr e Zubenelgenubi. Un prefisso di locale forma l'id, ad es. en-US-Chirp3-HD-Charon. Google descrive l'insieme come 30 stili distinti in molte lingue.
Limite di input 5,000 byte I fornitori pubblicano questo limite in unità diverse: su testo non latino, un limite in byte non equivale a un limite in caratteri.
Sintesi in streaming
SSML Anteprima, solo richieste sincrone
Controllo della voce Parametri numerici
Cosa accetta
  • I controlli vocali sono in Preview: il ritmo tramite speaking_rate da 0.25 a 2.0
  • i tag di pausa [pause short], [pause long] e [pause] sono accettati solo nel campo di input markup, mai in text, e il modello può ignorare i tag collocati in modo innaturale
  • pronunce personalizzate in IPA o X-SAMPA
  • il supporto SSML è in Preview e solo sincrono, non supportato per le richieste in streaming, con i tag non elencati ignorati e say-as interpret-as=expletive o bleep non supportati
Unità di fatturazione Per carattere di input Il fornitore non indica se un carattere multibyte venga fatturato una sola volta, quindi stimare il costo di un testo CJK con la sola tariffa non risulta documentato come affidabile.
Endpoint e formati
  • Limite di contenuto di 5.000 byte totali per richiesta di sintesi. Formato di risposta predefinito LINEAR16
  • lo streaming supporta ALAW, MULAW, OGG_OPUS e PCM, il batch aggiunge MP3, quindi MP3 non è disponibile sul percorso in streaming. È l'unico tipo di voce che la tabella comparativa di Google segna come capace di streaming. In disponibilità generale sugli endpoint global, us ed eu oltre che su asia-southeast1, europe-west2 e asia-northeast1, ma fuori dallo scope della regionalizzazione e della residenza dei dati. Fatturato per carattere inclusi spazi e a capo, con tutti i tag SSML tranne <mark> conteggiati

Modello

Modalità testo → audio
  • L'ultima generazione di sintesi vocale di Google, alimentata dai suoi modelli generativi più recenti e descritta come capace di offrire realismo e risonanza emotiva
  • la tabella comparativa indica gli agent conversazionali come uso previsto e nella pagina dei prezzi la elenca sotto i modelli TTS più recenti anziché tra quelli legacy. US$0.00003 per carattere (US$30 per 1 milione di caratteri) con il primo milione di caratteri gratuito ogni mese

fonte: documentazione ufficiale Google ↗

Usa Google TTS Chirp 3 HD in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="google-tts-chirp3-hd",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Informazioni su Google TTS Chirp 3 HD

  • La tabella comparativa indica gli agent conversazionali come uso previsto, e la pagina delle voci aggiunge che queste voci arrivano in 30 stili distinti in molte lingue, adatte ad applicazioni in tempo reale e standard, con controlli audio avanzati e comunicazione in tempo reale a bassa latenza tramite lo streaming del testo.
  • Quest'ultimo punto è la linea più netta rispetto a Standard e Neural2: Chirp 3: HD è l'unico tipo di voce di quella tabella la cui colonna streaming riporta sì.
  • Le voci prendono il nome da stelle anziché da lettere, Achernar, Algenib, Aoede, Charon, Kore, Leda, Puck, Sulafat, Zephyr, Zubenelgenubi e le altre, ciascuna pubblicata con un genere e combinata con un locale in id come en-US-Chirp3-HD-Charon.
  • La copertura linguistica è un elenco BCP-47 pubblicato che va da ar-XA e bn-IN passando per cmn-CN, ja-JP e sw-KE fino a vi-VN, e il livello è in disponibilità generale sugli endpoint global, us ed eu oltre che su asia-southeast1, europe-west2 e asia-northeast1.
  • Il formato di risposta predefinito è LINEAR16; lo streaming aggiunge ALAW, MULAW, OGG_OPUS e PCM, mentre il batch aggiunge in più MP3, quindi qui MP3 non è un'opzione in streaming.
  • I suoi controlli sono specifici e tutti ancora in Preview: il ritmo tramite speaking_rate tra 0.25 e 2.0, i tag di pausa come [pause short] e [pause long] che funzionano solo nel campo di input markup e mai in text, le pronunce personalizzate in IPA o X-SAMPA e l'SSML limitato alle richieste sincrone, con i tag non elencati ignorati in silenzio.
  • Google avverte che il modello può ignorare i tag di pausa collocati in modo innaturale.
  • Il prezzo è di US$0.00003 per carattere, indicati come US$30 per 1 milione di caratteri, con il primo milione gratuito, e il livello resta fuori dallo scope della regionalizzazione e della residenza dei dati.
  • Synthorai lo serve tramite l'endpoint /v1/audio/speech compatibile OpenAI.

FAQ

L'API di Google TTS Chirp 3 HD si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Google TTS Chirp 3 HD sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.

In cosa eccelle Google TTS Chirp 3 HD?

30 stili distinti in molte lingue; voci con nomi di stelle e streaming del testo a bassa latenza; ritmo, tag di pausa e pronunce personalizzate in Preview. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Google TTS Chirp 3 HD?

Su Synthorai, Google TTS Chirp 3 HD costa $30 per milione di token in input e $0 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.

Google TTS Chirp 3 HD supporta il caching dei prompt?

Google TTS Chirp 3 HD oggi non ha uno sconto sulle letture dalla cache su Synthorai. Il caching dei prompt resta disponibile per gli altri modelli del gateway: vedi la tabella prezzi per le alternative con cache. Confronto del caching tra provider →

Come ottengo l'accesso a Google TTS Chirp 3 HD?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="google-tts-chirp3-hd" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →