Google TTS Neural2
Prix catalogue du fournisseur : sans majoration de plateforme, paiement à l'usage. Ce sont les prix catalogue officiels. Les clients connectés peuvent voir les prix effectifs incluant les remises de l’espace de travail sur /console/pricing.
Utilisez Google TTS Neural2 en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="google-tts-neural2",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "google-tts-neural2",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "google-tts-neural2",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "google-tts-neural2",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("google-tts-neural2")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Spécifications et limites
Audio
- Langues
- Une liste de locales bien plus courte que celle de Standard. Des identifiants de voix Neural2 sont publiés pour da-DK, de-DE, en-AU, en-GB, en-IN, en-US, es-ES, es-US, fr-CA, fr-FR, hi-IN, it-IT, ja-JP, ko-KR, pt-BR, th-TH et vi-VN. Google précise que les voix Neural2 sont disponibles sur les endpoints globaux et mono-région.
- Limites audio
-
- Limite de contenu de 5 000 octets au total par requête de synthèse. Sortie en LINEAR16 (avec un en-tête WAV), MP3 à 32 kbps, OGG_OPUS, ou G.711 MULAW et ALAW
- le paramètre optionnel sampleRateHertz rééchantillonne et fait échouer la requête si la fréquence n'est pas prise en charge pour l'encodage. Non proposé en synthèse par streaming. Facturé au caractère, espaces et sauts de ligne compris, toutes les balises SSML sauf <mark> étant comptées
- la note sur le caractère multi-octets facturé une seule fois ne vaut que pour Standard et WaveNet
Temps réel
- Voix
- Les identifiants de voix suivent le motif locale-plus-lettre (en-US-Neural2-F, ja-JP-Neural2-B). Le tableau comparatif de Google présente Neural2 comme généraliste, en disponibilité générale, pilotable via SSML et non compatible avec le streaming, et la documentation indique que les voix reposent sur la même technologie que celle utilisée pour créer une Custom Voice, ce qui permet à chacun d'utiliser la technologie Custom Voice sans entraîner la sienne.
- Session
-
- Contrôles AudioConfig : speakingRate de 0.25 à 2.0 (1.0 en natif)
- pitch de -20.0 à 20.0 demi-tons
- volumeGainDb de -96.0 à 16.0
- profils d'appareil effectsProfileId pour objet connecté, téléphone, casque, enceinte Bluetooth petite et moyenne, grand système home cinéma, grand système automobile et restitution téléphonique
- les balises SSML comprennent speak, break, say-as, sub, mark, prosody, emphasis, phoneme, voice et lang
Modèle
- Modalités
- texte → audio
Le palier de voix Neural2 de Google Cloud Text-to-Speech, toujours regroupé sous les modèles TTS hérités (Legacy) sur la page de tarification. 0,000016 $ US par caractère (16 $ US par million de caractères) avec le premier million de caractères gratuit chaque mois, contre 4 millions pour Standard.
À propos de Google TTS Neural2
Google TTS Neural2 expose le palier de voix Neural2 de Google Cloud Text-to-Speech, et la description qu'en donne Google est d'une précision inhabituelle sur l'origine des voix : les voix Neural2 reposent sur la même technologie que celle utilisée pour créer une Custom Voice, et le palier existe pour que chacun puisse utiliser la technologie Custom Voice sans entraîner sa propre voix personnalisée.
- Le tableau comparatif le qualifie de généraliste, le marque en disponibilité générale et donne SSML comme mode de contrôle, le même profil que portent Standard et WaveNet.
- C'est par le prix que le palier se déclare, à 0,000016 $ US par caractère, soit 16 $ US par million de caractères, avec le premier million de caractères gratuit chaque mois plutôt que les 4 millions de Standard ; la page de tarification le range toujours parmi les modèles TTS hérités (Legacy).
- La contrepartie de cette qualité est la couverture.
- Là où Standard s'étend de l'afrikaans au cantonais, les identifiants de voix Neural2 n'apparaissent que pour une liste bien plus courte, da-DK, de-DE, en-AU, en-GB, en-IN, en-US, es-ES, es-US, fr-CA, fr-FR, hi-IN, it-IT, ja-JP, ko-KR, pt-BR, th-TH et vi-VN, nommés selon la forme locale-plus-lettre familière comme en-US-Neural2-F.
- Google précise que Neural2 est disponible sur les endpoints globaux et mono-région.
- Tout l'aspect opérationnel est partagé avec le reste de l'API classique : entrée SSML, speakingRate de 0.25 à 2.0, pitch en demi-tons sur une plage de 20 points dans chaque sens, volumeGainDb de -96 à 16, une fréquence d'échantillonnage de synthèse optionnelle, les profils d'appareil des objets connectés à la téléphonie, et une sortie en LINEAR16, MP3, OGG_OPUS, MULAW ou ALAW.
- Le même plafond de 5 000 octets de contenu par requête s'applique, et comme Standard, Neural2 n'est pas proposé en synthèse par streaming, ce qui est la capacité concrète que vous cédez face à Chirp 3: HD.
- La facturation compte les caractères, espaces et balises SSML autres que mark compris.
- Synthorai le sert via l'endpoint /v1/audio/speech compatible OpenAI.
FAQ
Peut-on essayer l'API Google TTS Neural2 gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $16/M de tokens en entrée, ce crédit couvre à lui seul environ 15 requêtes de ~4K tokens sur Google TTS Neural2.
Quels sont les points forts de Google TTS Neural2 ?
La technologie custom voice sans entraîner de voix personnalisée ; liste de locales bien plus courte que standard ; généraliste et pilotable en ssml, mais sans streaming. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte Google TTS Neural2 ?
Sur Synthorai, Google TTS Neural2 coûte $16 par million de tokens en entrée et $0 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme.
Google TTS Neural2 prend-il en charge la mise en cache des prompts ?
Google TTS Neural2 n'a pas de remise sur les lectures de cache sur Synthorai aujourd'hui. La mise en cache des prompts s'applique toujours aux autres modèles de la passerelle ; voir la table des prix pour les alternatives compatibles avec le cache. Comparatif de la mise en cache par fournisseur →
Comment obtenir l'accès à Google TTS Neural2 ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="google-tts-neural2", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.