Google TTS Standard
Prezzi di listino del provider: senza ricarico della piattaforma, pagamento a consumo. Questi sono i prezzi di listino ufficiali. I clienti autenticati possono vedere i prezzi effettivi, inclusi gli sconti workspace, su /console/pricing.
Usa Google TTS Standard in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="google-tts-standard",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "google-tts-standard",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "google-tts-standard",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "google-tts-standard",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("google-tts-standard")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Specifiche e limiti
Audio
- Lingue
- La gamma di locale più ampia di qualsiasi tipo di voce Cloud TTS. Gli id delle voci Standard sono pubblicati per af-ZA, ar-XA, bg-BG, bn-IN, ca-ES, cmn-CN, cmn-TW, cs-CZ, da-DK, de-DE, el-GR, en-AU, en-GB, en-IN, en-US, es-ES, es-US, et-EE, eu-ES, fi-FI, fil-PH, fr-CA, fr-FR, gl-ES, gu-IN, he-IL, hi-IN, hu-HU, id-ID, is-IS, it-IT, ja-JP, kn-IN, ko-KR, lt-LT, lv-LV, ml-IN, mr-IN, ms-MY, nb-NO, nl-BE, nl-NL, pa-IN, pl-PL, pt-BR, pt-PT, ro-RO, ru-RU, sk-SK, sr-RS, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN, vi-VN e yue-HK.
- Limiti audio
-
- Limite di contenuto di 5.000 byte totali per richiesta di sintesi (in alcuni locale un singolo carattere occupa più byte). Output LINEAR16 (restituito con header WAV), MP3 a 32 kbps, OGG_OPUS oppure G.711 MULAW e ALAW
- il sampleRateHertz opzionale ricampiona e fa fallire la richiesta se la frequenza non è supportata per quella codifica. Non offerto sulla sintesi in streaming
- Long Audio Synthesis (Preview) copre in modo asincrono fino a 1 milione di byte in input. Fatturato per carattere inclusi spazi e a capo, e contano tutti i tag SSML tranne <mark>
- per Standard e WaveNet un carattere multibyte è addebitato una volta sola
Tempo reale
- Voci
- Gli id delle voci seguono uno schema locale più lettera (en-US-Standard-A, cmn-CN-Standard-A). La tabella comparativa di Google elenca Standard come efficiente sui costi, in disponibilità generale, controllabile via SSML e non capace di streaming; la documentazione attribuisce le voci a una sintesi vocale parametrica fatta passare attraverso vocoder.
- Sessione
-
- Controlli AudioConfig: speakingRate da 0.25 a 2.0 (1.0 nativo)
- pitch da -20.0 a 20.0 semitoni
- volumeGainDb da -96.0 a 16.0
- profili di dispositivo effectsProfileId per riproduzione su indossabile, telefono, cuffie, altoparlante Bluetooth piccolo e medio, grande impianto home entertainment, grande impianto per auto e telefonia
- i tag SSML includono speak, break, say-as, sub, mark, prosody, emphasis, phoneme, voice e lang
Modello
- Modalità
- testo → audio
Il livello di voci Standard di Google Cloud Text-to-Speech, raggruppato con WaveNet e Studio sotto i modelli TTS legacy nella pagina dei prezzi. US$0.000004 per carattere (US$4 per 1 milione di caratteri) con i primi 4 milioni di caratteri gratuiti ogni mese, la franchigia gratuita più ampia che la tabella dei prezzi pubblichi.
Informazioni su Google TTS Standard
Google TTS Standard espone il livello di voci Standard di Google Cloud Text-to-Speech, quello che la tabella comparativa di Google stessa etichetta semplicemente come efficiente sui costi.
- Le sue voci sono la tecnologia più vecchia del catalogo e la documentazione lo dice apertamente: la sintesi vocale parametrica genera l'audio facendo passare gli output attraverso algoritmi di elaborazione del segnale noti come vocoder, e molte delle voci Standard usano una variante di quella tecnologia, che è la ragione onesta per cui suonano più piatte dei livelli generativi.
- La pagina dei prezzi archivia Standard sotto i modelli TTS legacy accanto a WaveNet e Studio, a US$0.000004 per carattere, indicati come US$4 per 1 milione di caratteri, con i primi 4 milioni di caratteri gratuiti ogni mese, la franchigia gratuita più ampia che la tabella dei prezzi pubblichi.
- Quello a cui Standard rinuncia in espressività lo recupera in ampiezza.
- Gli id delle voci seguono uno schema locale più lettera come en-US-Standard-A o cmn-CN-Standard-A, e la tabella delle voci supportate elenca Standard sulla gamma di locale più ampia del prodotto, da af-ZA e eu-ES passando per hi-IN, ja-JP e ur-IN fino a yue-HK, ben oltre il punto in cui arrivano i livelli più recenti.
- La controllabilità è l'SSML, con tag tra cui speak, break, prosody, emphasis, say-as, sub e phoneme, e il blocco AudioConfig aggiunge speakingRate da 0.25 a 2.0, pitch entro 20 semitoni in entrambe le direzioni, volumeGainDb da -96 a 16, una frequenza di campionamento in uscita opzionale e i profili di dispositivo effectsProfileId tarati per indossabili, telefoni, cuffie, altoparlanti Bluetooth, audio per auto e IVR.
- L'output è LINEAR16 con header WAV, MP3 a 32 kbps, OGG_OPUS oppure G.711 MULAW e ALAW.
- Contano due vincoli: una richiesta porta al massimo 5.000 byte di contenuto, e Standard non è offerto sulla sintesi in streaming, quindi un testo lungo significa il percorso asincrono Long Audio Synthesis oppure una segmentazione fatta da te.
- La fatturazione conta ogni carattere, inclusi spazi, a capo e tag SSML tranne mark, anche se per Standard i caratteri multibyte contano una volta sola.
- Synthorai lo serve tramite l'endpoint /v1/audio/speech compatibile OpenAI.
FAQ
L'API di Google TTS Standard si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $4/M token in input, quel credito da solo copre circa 61 richieste da ~4K token verso Google TTS Standard.
In cosa eccelle Google TTS Standard?
Il livello che Google etichetta come efficiente sui costi; la gamma di locale più ampia di qualsiasi tipo di voce Cloud TTS; voci parametriche con SSML e profili di dispositivo. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Google TTS Standard?
Su Synthorai, Google TTS Standard costa $4 per milione di token in input e $0 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.
Google TTS Standard supporta il caching dei prompt?
Google TTS Standard oggi non ha uno sconto sulle letture dalla cache su Synthorai. Il caching dei prompt resta disponibile per gli altri modelli del gateway: vedi la tabella prezzi per le alternative con cache. Confronto del caching tra provider →
Come ottengo l'accesso a Google TTS Standard?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="google-tts-standard" e hai finito: una sola chiave API copre tutti i modelli del gateway.