Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Google TTS Standard

Google TTS Standard espone il livello di voci Standard di Google Cloud Text-to-Speech, quello che la tabella comparativa di Google stessa etichetta semplicemente come efficiente sui costi.

Input
testo $4/M
Output
audio
Contesto
4K

Il prezzo nel contesto

Posizione del prezzo tra 7 modelli comparabili

Input$4/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Sintesi vocale

Lingue di sintesi La gamma di locale più ampia di qualsiasi tipo di voce Cloud TTS. Gli id delle voci Standard sono pubblicati per af-ZA, ar-XA, bg-BG, bn-IN, ca-ES, cmn-CN, cmn-TW, cs-CZ, da-DK, de-DE, el-GR, en-AU, en-GB, en-IN, en-US, es-ES, es-US, et-EE, eu-ES, fi-FI, fil-PH, fr-CA, fr-FR, gl-ES, gu-IN, he-IL, hi-IN, hu-HU, id-ID, is-IS, it-IT, ja-JP, kn-IN, ko-KR, lt-LT, lv-LV, ml-IN, mr-IN, ms-MY, nb-NO, nl-BE, nl-NL, pa-IN, pl-PL, pt-BR, pt-PT, ro-RO, ru-RU, sk-SK, sr-RS, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN, vi-VN e yue-HK.
Voci Gli id delle voci seguono uno schema locale più lettera (en-US-Standard-A, cmn-CN-Standard-A). La tabella comparativa di Google elenca Standard come efficiente sui costi, in disponibilità generale, controllabile via SSML e non capace di streaming; la documentazione attribuisce le voci a una sintesi vocale parametrica fatta passare attraverso vocoder.
Limite di input 5,000 byte I fornitori pubblicano questo limite in unità diverse: su testo non latino, un limite in byte non equivale a un limite in caratteri.
Sintesi in streaming No
SSML Supportato
Controllo della voce Parametri numerici
Cosa accetta
  • Controlli AudioConfig: speakingRate da 0.25 a 2.0 (1.0 nativo)
  • pitch da -20.0 a 20.0 semitoni
  • volumeGainDb da -96.0 a 16.0
  • profili di dispositivo effectsProfileId per riproduzione su indossabile, telefono, cuffie, altoparlante Bluetooth piccolo e medio, grande impianto home entertainment, grande impianto per auto e telefonia
  • i tag SSML includono speak, break, say-as, sub, mark, prosody, emphasis, phoneme, voice e lang
Unità di fatturazione Per carattere di input Un carattere multibyte viene fatturato una sola volta.
Endpoint e formati
  • Limite di contenuto di 5.000 byte totali per richiesta di sintesi (in alcuni locale un singolo carattere occupa più byte). Output LINEAR16 (restituito con header WAV), MP3 a 32 kbps, OGG_OPUS oppure G.711 MULAW e ALAW
  • il sampleRateHertz opzionale ricampiona e fa fallire la richiesta se la frequenza non è supportata per quella codifica. Non offerto sulla sintesi in streaming
  • Long Audio Synthesis (Preview) copre in modo asincrono fino a 1 milione di byte in input. Fatturato per carattere inclusi spazi e a capo, e contano tutti i tag SSML tranne <mark>
  • per Standard e WaveNet un carattere multibyte è addebitato una volta sola

Modello

Modalità testo → audio

Il livello di voci Standard di Google Cloud Text-to-Speech, raggruppato con WaveNet e Studio sotto i modelli TTS legacy nella pagina dei prezzi. US$0.000004 per carattere (US$4 per 1 milione di caratteri) con i primi 4 milioni di caratteri gratuiti ogni mese, la franchigia gratuita più ampia che la tabella dei prezzi pubblichi.

fonte: documentazione ufficiale Google ↗

Usa Google TTS Standard in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="google-tts-standard",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Informazioni su Google TTS Standard

  • Le sue voci sono la tecnologia più vecchia del catalogo e la documentazione lo dice apertamente: la sintesi vocale parametrica genera l'audio facendo passare gli output attraverso algoritmi di elaborazione del segnale noti come vocoder, e molte delle voci Standard usano una variante di quella tecnologia, che è la ragione onesta per cui suonano più piatte dei livelli generativi.
  • La pagina dei prezzi archivia Standard sotto i modelli TTS legacy accanto a WaveNet e Studio, a US$0.000004 per carattere, indicati come US$4 per 1 milione di caratteri, con i primi 4 milioni di caratteri gratuiti ogni mese, la franchigia gratuita più ampia che la tabella dei prezzi pubblichi.
  • Quello a cui Standard rinuncia in espressività lo recupera in ampiezza.
  • Gli id delle voci seguono uno schema locale più lettera come en-US-Standard-A o cmn-CN-Standard-A, e la tabella delle voci supportate elenca Standard sulla gamma di locale più ampia del prodotto, da af-ZA e eu-ES passando per hi-IN, ja-JP e ur-IN fino a yue-HK, ben oltre il punto in cui arrivano i livelli più recenti.
  • La controllabilità è l'SSML, con tag tra cui speak, break, prosody, emphasis, say-as, sub e phoneme, e il blocco AudioConfig aggiunge speakingRate da 0.25 a 2.0, pitch entro 20 semitoni in entrambe le direzioni, volumeGainDb da -96 a 16, una frequenza di campionamento in uscita opzionale e i profili di dispositivo effectsProfileId tarati per indossabili, telefoni, cuffie, altoparlanti Bluetooth, audio per auto e IVR.
  • L'output è LINEAR16 con header WAV, MP3 a 32 kbps, OGG_OPUS oppure G.711 MULAW e ALAW.
  • Contano due vincoli: una richiesta porta al massimo 5.000 byte di contenuto, e Standard non è offerto sulla sintesi in streaming, quindi un testo lungo significa il percorso asincrono Long Audio Synthesis oppure una segmentazione fatta da te.
  • La fatturazione conta ogni carattere, inclusi spazi, a capo e tag SSML tranne mark, anche se per Standard i caratteri multibyte contano una volta sola.
  • Synthorai lo serve tramite l'endpoint /v1/audio/speech compatibile OpenAI.

FAQ

L'API di Google TTS Standard si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare Google TTS Standard sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.

In cosa eccelle Google TTS Standard?

Il livello che Google etichetta come efficiente sui costi; la gamma di locale più ampia di qualsiasi tipo di voce Cloud TTS; voci parametriche con SSML e profili di dispositivo. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Google TTS Standard?

Su Synthorai, Google TTS Standard costa $4 per milione di token in input e $0 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.

Google TTS Standard supporta il caching dei prompt?

Google TTS Standard oggi non ha uno sconto sulle letture dalla cache su Synthorai. Il caching dei prompt resta disponibile per gli altri modelli del gateway: vedi la tabella prezzi per le alternative con cache. Confronto del caching tra provider →

Come ottengo l'accesso a Google TTS Standard?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="google-tts-standard" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →