🎁 Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

Google TTS Chirp 3 HD

Google Síntesis de vozStreaming
Entrada$30/M
Contexto4K

Precios de lista del proveedor, sin margen de plataforma, pago por uso. Estos son los precios de lista oficiales. Los clientes con sesión iniciada pueden ver los precios efectivos con descuentos del espacio de trabajo en /console/pricing.

Use Google TTS Chirp 3 HD en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="google-tts-chirp3-hd",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Especificaciones y límites

Audio

Idiomas
ar-XA, bn-IN, bg-BG, yue-HK, hr-HR, cs-CZ, da-DK, nl-BE, nl-NL, en-AU, en-IN, en-GB, en-US, et-EE, fi-FI, fr-CA, fr-FR, de-DE, el-GR, gu-IN, he-IL, hi-IN, hu-HU, id-ID, it-IT, ja-JP, kn-IN, ko-KR, lv-LV, lt-LT, ml-IN, cmn-CN, mr-IN, nb-NO, pl-PL, pt-BR, pa-IN, ro-RO, ru-RU, sr-RS, sk-SK, sl-SI, es-ES, es-US, sw-KE, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN y vi-VN.
Límites de audio
  • Límite de contenido de 5000 bytes totales por solicitud de síntesis. Formato de respuesta por defecto LINEAR16
  • el streaming admite ALAW, MULAW, OGG_OPUS y PCM, y el modo por lotes añade MP3, así que MP3 no está disponible en la ruta de streaming. Es el único tipo de voz que la tabla comparativa de Google marca con capacidad de streaming. Disponible con carácter general en los endpoints global, us y eu, además de asia-southeast1, europe-west2 y asia-northeast1, pero fuera del ámbito de regionalización y residencia de datos. Facturado por carácter, incluidos los espacios y los saltos de línea, y con todas las etiquetas SSML salvo <mark> contabilizadas

Tiempo real

Voces
Las voces llevan nombres de estrellas y se publican con un género: Achernar, Achird, Algenib, Algieba, Alnilam, Aoede, Autonoe, Callirrhoe, Charon, Despina, Enceladus, Erinome, Fenrir, Gacrux, Iapetus, Kore, Laomedeia, Leda, Orus, Pulcherrima, Puck, Rasalgethi, Sadachbia, Sadaltager, Schedar, Sulafat, Umbriel, Vindemiatrix, Zephyr y Zubenelgenubi. Un prefijo de configuración regional forma el id, p. ej. en-US-Chirp3-HD-Charon. Google describe el conjunto como 30 estilos distintos en muchos idiomas.
Sesión
  • Los controles de voz están en Preview: el ritmo mediante speaking_rate de 0.25 a 2.0
  • las etiquetas de pausa [pause short], [pause long] y [pause] solo se aceptan en el campo de entrada markup, nunca en text, y el modelo puede desatender las etiquetas colocadas de forma poco natural
  • pronunciaciones personalizadas en IPA o X-SAMPA
  • el soporte de SSML está en Preview y es solo síncrono, no admitido en las solicitudes de streaming, con las etiquetas no listadas ignoradas y say-as con interpret-as=expletive o bleep no admitido

Modelo

Modalidades
texto → audio
  • La última generación de síntesis de voz de Google, impulsada por sus modelos generativos más recientes y descrita como capaz de ofrecer realismo y resonancia emocional
  • la tabla comparativa nombra los agentes conversacionales como el uso previsto y la página de precios lo incluye entre los Latest TTS models en lugar de los Legacy. US$0.00003 por carácter (US$30 por 1 millón de caracteres) con el primer millón de caracteres gratis cada mes

según documentación oficial de Google ↗

Acerca de Google TTS Chirp 3 HD

30 estilos distintos en muchos idiomas
Voces con nombres de estrellas y streaming de texto de baja latencia
Ritmo, etiquetas de pausa y pronunciaciones personalizadas en Preview

Google TTS Chirp 3: HD es el nivel que Google llama la última generación de tecnología de Text-to-Speech, impulsado por su última generación de modelos generativos y descrito como capaz de ofrecer realismo y resonancia emocional.

  • La tabla comparativa nombra los agentes conversacionales como el uso previsto, y la página de voces añade que estas voces vienen en 30 estilos distintos en muchos idiomas, aptas para aplicaciones en tiempo real y estándar, con controles de audio avanzados y comunicación en tiempo real de baja latencia mediante streaming de texto.
  • Ese último punto es la línea más nítida frente a Standard y Neural2: Chirp 3: HD es el único tipo de voz de esa tabla cuya columna de streaming dice sí.
  • Las voces llevan nombres de estrellas en lugar de letras, Achernar, Algenib, Aoede, Charon, Kore, Leda, Puck, Sulafat, Zephyr, Zubenelgenubi y las demás, cada una publicada con un género y combinada con una configuración regional para formar ids como en-US-Chirp3-HD-Charon.
  • La cobertura de idiomas es una lista BCP-47 publicada que va desde ar-XA y bn-IN pasando por cmn-CN, ja-JP y sw-KE hasta vi-VN, y el nivel está disponible con carácter general en los endpoints global, us y eu, además de asia-southeast1, europe-west2 y asia-northeast1.
  • El formato de respuesta por defecto es LINEAR16; el streaming añade ALAW, MULAW, OGG_OPUS y PCM, mientras que el modo por lotes suma MP3 encima, así que aquí MP3 no es una opción de streaming.
  • Sus controles son propios y todos siguen en Preview: el ritmo mediante speaking_rate entre 0.25 y 2.0, etiquetas de pausa como [pause short] y [pause long] que solo funcionan en el campo de entrada markup y nunca en text, pronunciaciones personalizadas en IPA o X-SAMPA, y SSML restringido a las solicitudes síncronas, con las etiquetas no listadas ignoradas en silencio.
  • Google advierte de que el modelo puede desatender las etiquetas de pausa colocadas de forma poco natural.
  • El precio es de US$0.00003 por carácter, citado como US$30 por 1 millón de caracteres, con el primer millón gratis, y el nivel queda fuera del ámbito de regionalización y residencia de datos.
  • Synthorai lo sirve a través del endpoint /v1/audio/speech compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de Google TTS Chirp 3 HD?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $30/M por tokens de entrada, solo ese crédito cubre aproximadamente 8 solicitudes de ~4K tokens contra Google TTS Chirp 3 HD.

¿En qué destaca Google TTS Chirp 3 HD?

30 estilos distintos en muchos idiomas; voces con nombres de estrellas y streaming de texto de baja latencia; ritmo, etiquetas de pausa y pronunciaciones personalizadas en Preview. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta Google TTS Chirp 3 HD?

Google TTS Chirp 3 HD cuesta $30 por millón de tokens de entrada y $0 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma.

¿Google TTS Chirp 3 HD admite caché de prompts?

Google TTS Chirp 3 HD no tiene hoy descuento por lectura de caché en Synthorai. El caché de prompts sigue disponible para otros modelos del gateway. Consulte la tabla de precios para ver alternativas con caché. Comparativa de caché entre proveedores →

¿Cómo obtengo acceso a Google TTS Chirp 3 HD?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="google-tts-chirp3-hd" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Obtenga su clave API gratuita Compare su costo →