Google TTS Neural2
Precios de lista del proveedor, sin margen de plataforma, pago por uso. Estos son los precios de lista oficiales. Los clientes con sesión iniciada pueden ver los precios efectivos con descuentos del espacio de trabajo en /console/pricing.
Use Google TTS Neural2 en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="google-tts-neural2",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "google-tts-neural2",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "google-tts-neural2",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "google-tts-neural2",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("google-tts-neural2")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Especificaciones y límites
Audio
- Idiomas
- Una lista de configuraciones regionales mucho más corta que la de Standard. Hay ids de voz Neural2 publicados para da-DK, de-DE, en-AU, en-GB, en-IN, en-US, es-ES, es-US, fr-CA, fr-FR, hi-IN, it-IT, ja-JP, ko-KR, pt-BR, th-TH y vi-VN. Google señala que las voces Neural2 están disponibles en los endpoints global y de región única.
- Límites de audio
-
- Límite de contenido de 5000 bytes totales por solicitud de síntesis. Salida LINEAR16 (con cabecera WAV), MP3 a 32 kbps, OGG_OPUS o G.711 MULAW y ALAW
- el sampleRateHertz opcional remuestrea y hace fallar la solicitud si la frecuencia no está admitida para esa codificación. No se ofrece mediante síntesis en streaming. Facturado por carácter, incluidos los espacios y los saltos de línea, y con todas las etiquetas SSML salvo <mark> contabilizadas
- la nota de que los caracteres multibyte cuentan una sola vez se aplica únicamente a Standard y WaveNet
Tiempo real
- Voces
- Los ids de voz siguen el patrón de configuración regional más letra (en-US-Neural2-F, ja-JP-Neural2-B). La tabla comparativa de Google presenta Neural2 como de propósito general, disponible con carácter general, controlable mediante SSML y sin capacidad de streaming, y la documentación indica que las voces se basan en la misma tecnología que se usa para crear una Custom Voice, lo que permite a cualquiera usar la tecnología de Custom Voice sin entrenar la suya propia.
- Sesión
-
- Controles de AudioConfig: speakingRate de 0.25 a 2.0 (1.0 nativo)
- pitch de -20.0 a 20.0 semitonos
- volumeGainDb de -96.0 a 16.0
- perfiles de dispositivo effectsProfileId para reproducción en wearable, teléfono, auriculares, altavoz Bluetooth pequeño y mediano, gran equipo de entretenimiento doméstico, gran sistema de audio de coche y telefonía
- las etiquetas SSML incluyen speak, break, say-as, sub, mark, prosody, emphasis, phoneme, voice y lang
Modelo
- Modalidades
- texto → audio
El nivel de voces Neural2 de Google Cloud Text-to-Speech, todavía agrupado bajo los Legacy TTS models en la página de precios. US$0.000016 por carácter (US$16 por 1 millón de caracteres) con el primer millón de caracteres gratis cada mes, frente a los 4 millones de Standard.
Acerca de Google TTS Neural2
Google TTS Neural2 expone el nivel de voces Neural2 de Google Cloud Text-to-Speech, y la descripción que Google hace de él es inusualmente concreta sobre de dónde salen esas voces: las voces Neural2 se basan en la misma tecnología que se usa para crear una Custom Voice, y el nivel existe para que cualquiera pueda usar la tecnología de Custom Voice sin entrenar una voz personalizada propia.
- La tabla comparativa lo llama de propósito general, lo marca como disponible con carácter general y da su controlabilidad como SSML, el mismo perfil que llevan Standard y WaveNet.
- El precio es donde el nivel se declara, a US$0.000016 por carácter, citado como US$16 por 1 millón de caracteres, con el primer millón de caracteres de cada mes gratis en lugar de los 4 millones de Standard; la página de precios lo sigue agrupando bajo los Legacy TTS models.
- Lo que se paga por esa calidad es alcance.
- Donde Standard abarca configuraciones regionales desde el afrikáans hasta el cantonés, los ids de voz Neural2 aparecen para una lista mucho más corta, da-DK, de-DE, en-AU, en-GB, en-IN, en-US, es-ES, es-US, fr-CA, fr-FR, hi-IN, it-IT, ja-JP, ko-KR, pt-BR, th-TH y vi-VN, nombrados con la familiar forma de configuración regional más letra, como en-US-Neural2-F.
- Google señala que Neural2 está disponible en los endpoints global y de región única.
- Todo lo operativo lo comparte con el resto de la API clásica: entrada SSML, speakingRate de 0.25 a 2.0, pitch en semitonos dentro de un rango de 20 puntos en cada sentido, volumeGainDb de -96 a 16, una frecuencia de muestreo de síntesis opcional, los perfiles de dispositivo desde los wearables hasta la telefonía, y salida en LINEAR16, MP3, OGG_OPUS, MULAW o ALAW.
- Se aplica el mismo techo de 5000 bytes de contenido por solicitud y, como Standard, Neural2 no se ofrece mediante síntesis en streaming, que es la capacidad concreta a la que se renuncia frente a Chirp 3: HD.
- La facturación cuenta los caracteres, incluidos los espacios y las etiquetas SSML distintas de mark.
- Synthorai lo sirve a través del endpoint /v1/audio/speech compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Google TTS Neural2?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $16/M por tokens de entrada, solo ese crédito cubre aproximadamente 15 solicitudes de ~4K tokens contra Google TTS Neural2.
¿En qué destaca Google TTS Neural2?
Tecnología de Custom Voice sin entrenar una voz personalizada; lista de configuraciones regionales mucho más corta que Standard; de propósito general y controlable con ssml, pero sin streaming. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Google TTS Neural2?
Google TTS Neural2 cuesta $16 por millón de tokens de entrada y $0 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma.
¿Google TTS Neural2 admite caché de prompts?
Google TTS Neural2 no tiene hoy descuento por lectura de caché en Synthorai. El caché de prompts sigue disponible para otros modelos del gateway. Consulte la tabla de precios para ver alternativas con caché. Comparativa de caché entre proveedores →
¿Cómo obtengo acceso a Google TTS Neural2?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="google-tts-neural2" y listo. Una sola clave API cubre todos los modelos del gateway.