Google TTS Chirp 3: HD è il livello che Google definisce l'ultima generazione della tecnologia Text-to-Speech, alimentato dalla sua ultima generazione di modelli generativi e descritto come capace di offrire realismo e risonanza emotiva.
- Input
- testo $30/M
- Output
- audio
- Contesto
- 4K
Il prezzo nel contesto
Posizione del prezzo tra 7 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Sintesi vocale
| Lingue di sintesi | ar-XA, bn-IN, bg-BG, yue-HK, hr-HR, cs-CZ, da-DK, nl-BE, nl-NL, en-AU, en-IN, en-GB, en-US, et-EE, fi-FI, fr-CA, fr-FR, de-DE, el-GR, gu-IN, he-IL, hi-IN, hu-HU, id-ID, it-IT, ja-JP, kn-IN, ko-KR, lv-LV, lt-LT, ml-IN, cmn-CN, mr-IN, nb-NO, pl-PL, pt-BR, pa-IN, ro-RO, ru-RU, sr-RS, sk-SK, sl-SI, es-ES, es-US, sw-KE, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN e vi-VN. |
|---|---|
| Voci | Le voci prendono il nome da stelle e sono pubblicate con un genere: Achernar, Achird, Algenib, Algieba, Alnilam, Aoede, Autonoe, Callirrhoe, Charon, Despina, Enceladus, Erinome, Fenrir, Gacrux, Iapetus, Kore, Laomedeia, Leda, Orus, Pulcherrima, Puck, Rasalgethi, Sadachbia, Sadaltager, Schedar, Sulafat, Umbriel, Vindemiatrix, Zephyr e Zubenelgenubi. Un prefisso di locale forma l'id, ad es. en-US-Chirp3-HD-Charon. Google descrive l'insieme come 30 stili distinti in molte lingue. |
| Limite di input | 5,000 byte I fornitori pubblicano questo limite in unità diverse: su testo non latino, un limite in byte non equivale a un limite in caratteri. |
| Sintesi in streaming | Sì |
| SSML | Anteprima, solo richieste sincrone |
| Controllo della voce | Parametri numerici |
| Cosa accetta |
|
| Unità di fatturazione | Per carattere di input Il fornitore non indica se un carattere multibyte venga fatturato una sola volta, quindi stimare il costo di un testo CJK con la sola tariffa non risulta documentato come affidabile. |
| Endpoint e formati |
|
Modello
| Modalità | testo → audio |
|---|
- L'ultima generazione di sintesi vocale di Google, alimentata dai suoi modelli generativi più recenti e descritta come capace di offrire realismo e risonanza emotiva
- la tabella comparativa indica gli agent conversazionali come uso previsto e nella pagina dei prezzi la elenca sotto i modelli TTS più recenti anziché tra quelli legacy. US$0.00003 per carattere (US$30 per 1 milione di caratteri) con il primo milione di caratteri gratuito ogni mese
Usa Google TTS Chirp 3 HD in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="google-tts-chirp3-hd",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "google-tts-chirp3-hd",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "google-tts-chirp3-hd",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "google-tts-chirp3-hd",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("google-tts-chirp3-hd")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Google TTS Chirp 3 HD
- La tabella comparativa indica gli agent conversazionali come uso previsto, e la pagina delle voci aggiunge che queste voci arrivano in 30 stili distinti in molte lingue, adatte ad applicazioni in tempo reale e standard, con controlli audio avanzati e comunicazione in tempo reale a bassa latenza tramite lo streaming del testo.
- Quest'ultimo punto è la linea più netta rispetto a Standard e Neural2: Chirp 3: HD è l'unico tipo di voce di quella tabella la cui colonna streaming riporta sì.
- Le voci prendono il nome da stelle anziché da lettere, Achernar, Algenib, Aoede, Charon, Kore, Leda, Puck, Sulafat, Zephyr, Zubenelgenubi e le altre, ciascuna pubblicata con un genere e combinata con un locale in id come en-US-Chirp3-HD-Charon.
- La copertura linguistica è un elenco BCP-47 pubblicato che va da ar-XA e bn-IN passando per cmn-CN, ja-JP e sw-KE fino a vi-VN, e il livello è in disponibilità generale sugli endpoint global, us ed eu oltre che su asia-southeast1, europe-west2 e asia-northeast1.
- Il formato di risposta predefinito è LINEAR16; lo streaming aggiunge ALAW, MULAW, OGG_OPUS e PCM, mentre il batch aggiunge in più MP3, quindi qui MP3 non è un'opzione in streaming.
- I suoi controlli sono specifici e tutti ancora in Preview: il ritmo tramite speaking_rate tra 0.25 e 2.0, i tag di pausa come [pause short] e [pause long] che funzionano solo nel campo di input markup e mai in text, le pronunce personalizzate in IPA o X-SAMPA e l'SSML limitato alle richieste sincrone, con i tag non elencati ignorati in silenzio.
- Google avverte che il modello può ignorare i tag di pausa collocati in modo innaturale.
- Il prezzo è di US$0.00003 per carattere, indicati come US$30 per 1 milione di caratteri, con il primo milione gratuito, e il livello resta fuori dallo scope della regionalizzazione e della residenza dei dati.
- Synthorai lo serve tramite l'endpoint /v1/audio/speech compatibile OpenAI.
FAQ
L'API di Google TTS Chirp 3 HD si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Google TTS Chirp 3 HD sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.
In cosa eccelle Google TTS Chirp 3 HD?
30 stili distinti in molte lingue; voci con nomi di stelle e streaming del testo a bassa latenza; ritmo, tag di pausa e pronunce personalizzate in Preview. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Google TTS Chirp 3 HD?
Su Synthorai, Google TTS Chirp 3 HD costa $30 per milione di token in input e $0 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.
Google TTS Chirp 3 HD supporta il caching dei prompt?
Google TTS Chirp 3 HD oggi non ha uno sconto sulle letture dalla cache su Synthorai. Il caching dei prompt resta disponibile per gli altri modelli del gateway: vedi la tabella prezzi per le alternative con cache. Confronto del caching tra provider →
Come ottengo l'accesso a Google TTS Chirp 3 HD?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="google-tts-chirp3-hd" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.