🎁 Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Google TTS Standard

Google Síntesis de vozSSML
Entrada$4/M
Contexto4K
vs GPT-4o~20% más barato

Precios de lista del proveedor, sin margen de plataforma, pago por uso. Estos son los precios de lista oficiales. Los clientes con sesión iniciada pueden ver los precios efectivos con descuentos del espacio de trabajo en /console/pricing.

Use Google TTS Standard en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="google-tts-standard",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Especificaciones y límites

Audio

Idiomas
La mayor amplitud de configuraciones regionales de cualquier tipo de voz de Cloud TTS. Hay ids de voz Standard publicados para af-ZA, ar-XA, bg-BG, bn-IN, ca-ES, cmn-CN, cmn-TW, cs-CZ, da-DK, de-DE, el-GR, en-AU, en-GB, en-IN, en-US, es-ES, es-US, et-EE, eu-ES, fi-FI, fil-PH, fr-CA, fr-FR, gl-ES, gu-IN, he-IL, hi-IN, hu-HU, id-ID, is-IS, it-IT, ja-JP, kn-IN, ko-KR, lt-LT, lv-LV, ml-IN, mr-IN, ms-MY, nb-NO, nl-BE, nl-NL, pa-IN, pl-PL, pt-BR, pt-PT, ro-RO, ru-RU, sk-SK, sr-RS, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN, vi-VN y yue-HK.
Límites de audio
  • Límite de contenido de 5000 bytes totales por solicitud de síntesis (en algunas configuraciones regionales un solo carácter ocupa varios bytes). Salida LINEAR16 (devuelta con cabecera WAV), MP3 a 32 kbps, OGG_OPUS o G.711 MULAW y ALAW
  • el sampleRateHertz opcional remuestrea y hace fallar la solicitud si la frecuencia no está admitida para esa codificación. No se ofrece mediante síntesis en streaming
  • Long Audio Synthesis (Preview) cubre de forma asíncrona hasta 1 millón de bytes de entrada. Facturado por carácter, incluidos los espacios y los saltos de línea, y todas las etiquetas SSML salvo <mark> cuentan
  • en Standard y WaveNet un carácter multibyte se cobra una sola vez

Tiempo real

Voces
Los ids de voz siguen un patrón de configuración regional más letra (en-US-Standard-A, cmn-CN-Standard-A). La tabla comparativa de Google presenta Standard como eficiente en coste, disponible con carácter general, controlable mediante SSML y sin capacidad de streaming; la documentación atribuye las voces a una síntesis de voz paramétrica pasada por vocoders.
Sesión
  • Controles de AudioConfig: speakingRate de 0.25 a 2.0 (1.0 nativo)
  • pitch de -20.0 a 20.0 semitonos
  • volumeGainDb de -96.0 a 16.0
  • perfiles de dispositivo effectsProfileId para reproducción en wearable, teléfono, auriculares, altavoz Bluetooth pequeño y mediano, gran equipo de entretenimiento doméstico, gran sistema de audio de coche y telefonía
  • las etiquetas SSML incluyen speak, break, say-as, sub, mark, prosody, emphasis, phoneme, voice y lang

Modelo

Modalidades
texto → audio

El nivel de voces Standard de Google Cloud Text-to-Speech, agrupado con WaveNet y Studio bajo los Legacy TTS models en la página de precios. US$0.000004 por carácter (US$4 por 1 millón de caracteres) con los primeros 4 millones de caracteres gratis cada mes, la mayor asignación gratuita que publica la tabla de precios.

según documentación oficial de Google ↗

Acerca de Google TTS Standard

El nivel que Google etiqueta como eficiente en coste
La mayor amplitud de configuraciones regionales de cualquier tipo de voz de cloud tts
Voces paramétricas con ssml y perfiles de dispositivo

Google TTS Standard expone el nivel de voces Standard de Google Cloud Text-to-Speech, el que la propia tabla comparativa de Google etiqueta simplemente como eficiente en coste.

  • Sus voces son la tecnología más antigua del catálogo y la documentación lo dice sin rodeos: la síntesis de voz paramétrica genera audio pasando las salidas por algoritmos de procesamiento de señal conocidos como vocoders, y muchas de las voces Standard usan una variante de esa tecnología, que es la razón honesta de que suenen más planas que los niveles generativos.
  • La página de precios clasifica Standard dentro de los Legacy TTS models, junto a WaveNet y Studio, a US$0.000004 por carácter, citado como US$4 por 1 millón de caracteres, con los primeros 4 millones de caracteres de cada mes gratis, la mayor asignación gratuita que publica la tabla de precios.
  • Lo que Standard cede en expresividad lo compensa en alcance.
  • Los ids de voz siguen un patrón de configuración regional más letra, como en-US-Standard-A o cmn-CN-Standard-A, y la tabla de voces admitidas lista Standard con la mayor amplitud de configuraciones regionales del producto, desde af-ZA y eu-ES pasando por hi-IN, ja-JP y ur-IN hasta yue-HK, mucho más allá de donde llegan los niveles más recientes.
  • La controlabilidad es SSML, con etiquetas que incluyen speak, break, prosody, emphasis, say-as, sub y phoneme, y el bloque AudioConfig añade speakingRate de 0.25 a 2.0, pitch en 20 semitonos en cada sentido, volumeGainDb de -96 a 16, una frecuencia de muestreo de salida opcional y los perfiles de dispositivo effectsProfileId ajustados para wearables, teléfonos, auriculares, altavoces Bluetooth, audio de coche e IVR.
  • La salida es LINEAR16 con cabecera WAV, MP3 a 32 kbps, OGG_OPUS o G.711 MULAW y ALAW.
  • Dos restricciones importan: una solicitud lleva como máximo 5000 bytes de contenido, y Standard no se ofrece mediante síntesis en streaming, así que un texto largo obliga a la ruta asíncrona de Long Audio Synthesis o a una fragmentación propia.
  • La facturación cuenta cada carácter, incluidos los espacios, los saltos de línea y las etiquetas SSML salvo mark, aunque en Standard los caracteres multibyte cuentan una sola vez.
  • Synthorai lo sirve a través del endpoint /v1/audio/speech compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Google TTS Standard?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $4/M por tokens de entrada, solo ese crédito cubre aproximadamente 61 solicitudes de ~4K tokens contra Google TTS Standard.

¿En qué destaca Google TTS Standard?

El nivel que Google etiqueta como eficiente en coste; la mayor amplitud de configuraciones regionales de cualquier tipo de voz de cloud tts; voces paramétricas con ssml y perfiles de dispositivo. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Google TTS Standard?

Google TTS Standard cuesta $4 por millón de tokens de entrada y $0 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma.

¿Google TTS Standard admite caché de prompts?

Google TTS Standard no tiene hoy descuento por lectura de caché en Synthorai. El caché de prompts sigue disponible para otros modelos del gateway. Consulte la tabla de precios para ver alternativas con caché. Comparativa de caché entre proveedores →

¿Cómo obtengo acceso a Google TTS Standard?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="google-tts-standard" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Obtenga su clave API gratuita Compare su costo →