Google TTS Chirp 3: HD es el nivel que Google llama la última generación de tecnología de Text-to-Speech, impulsado por su última generación de modelos generativos y descrito como capaz de ofrecer realismo y resonancia emocional.
- Entrada
- texto $30/M
- Salida
- audio
- Contexto
- 4K
El precio en contexto
Posición del precio entre 7 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Síntesis de voz
| Idiomas de síntesis | ar-XA, bn-IN, bg-BG, yue-HK, hr-HR, cs-CZ, da-DK, nl-BE, nl-NL, en-AU, en-IN, en-GB, en-US, et-EE, fi-FI, fr-CA, fr-FR, de-DE, el-GR, gu-IN, he-IL, hi-IN, hu-HU, id-ID, it-IT, ja-JP, kn-IN, ko-KR, lv-LV, lt-LT, ml-IN, cmn-CN, mr-IN, nb-NO, pl-PL, pt-BR, pa-IN, ro-RO, ru-RU, sr-RS, sk-SK, sl-SI, es-ES, es-US, sw-KE, sv-SE, ta-IN, te-IN, th-TH, tr-TR, uk-UA, ur-IN y vi-VN. |
|---|---|
| Voces | Las voces llevan nombres de estrellas y se publican con un género: Achernar, Achird, Algenib, Algieba, Alnilam, Aoede, Autonoe, Callirrhoe, Charon, Despina, Enceladus, Erinome, Fenrir, Gacrux, Iapetus, Kore, Laomedeia, Leda, Orus, Pulcherrima, Puck, Rasalgethi, Sadachbia, Sadaltager, Schedar, Sulafat, Umbriel, Vindemiatrix, Zephyr y Zubenelgenubi. Un prefijo de configuración regional forma el id, p. ej. en-US-Chirp3-HD-Charon. Google describe el conjunto como 30 estilos distintos en muchos idiomas. |
| Límite de entrada | 5,000 bytes Los proveedores publican este límite en unidades distintas: en texto no latino, un límite en bytes no equivale a un límite en caracteres. |
| Síntesis en streaming | Sí |
| SSML | Vista previa, solo solicitudes síncronas |
| Control de voz | Parámetros numéricos |
| Qué admite |
|
| Unidad de facturación | Por carácter de entrada El proveedor no indica si un carácter multibyte se factura una sola vez, por lo que estimar el coste de texto CJK solo con esta tarifa no está documentado como fiable. |
| Endpoints y formatos |
|
Modelo
| Modalidades | texto → audio |
|---|
- La última generación de síntesis de voz de Google, impulsada por sus modelos generativos más recientes y descrita como capaz de ofrecer realismo y resonancia emocional
- la tabla comparativa nombra los agentes conversacionales como el uso previsto y la página de precios lo incluye entre los Latest TTS models en lugar de los Legacy. US$0.00003 por carácter (US$30 por 1 millón de caracteres) con el primer millón de caracteres gratis cada mes
Use Google TTS Chirp 3 HD en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="google-tts-chirp3-hd",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "google-tts-chirp3-hd",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "google-tts-chirp3-hd",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "google-tts-chirp3-hd",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("google-tts-chirp3-hd")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de Google TTS Chirp 3 HD
- La tabla comparativa nombra los agentes conversacionales como el uso previsto, y la página de voces añade que estas voces vienen en 30 estilos distintos en muchos idiomas, aptas para aplicaciones en tiempo real y estándar, con controles de audio avanzados y comunicación en tiempo real de baja latencia mediante streaming de texto.
- Ese último punto es la línea más nítida frente a Standard y Neural2: Chirp 3: HD es el único tipo de voz de esa tabla cuya columna de streaming dice sí.
- Las voces llevan nombres de estrellas en lugar de letras, Achernar, Algenib, Aoede, Charon, Kore, Leda, Puck, Sulafat, Zephyr, Zubenelgenubi y las demás, cada una publicada con un género y combinada con una configuración regional para formar ids como en-US-Chirp3-HD-Charon.
- La cobertura de idiomas es una lista BCP-47 publicada que va desde ar-XA y bn-IN pasando por cmn-CN, ja-JP y sw-KE hasta vi-VN, y el nivel está disponible con carácter general en los endpoints global, us y eu, además de asia-southeast1, europe-west2 y asia-northeast1.
- El formato de respuesta por defecto es LINEAR16; el streaming añade ALAW, MULAW, OGG_OPUS y PCM, mientras que el modo por lotes suma MP3 encima, así que aquí MP3 no es una opción de streaming.
- Sus controles son propios y todos siguen en Preview: el ritmo mediante speaking_rate entre 0.25 y 2.0, etiquetas de pausa como [pause short] y [pause long] que solo funcionan en el campo de entrada markup y nunca en text, pronunciaciones personalizadas en IPA o X-SAMPA, y SSML restringido a las solicitudes síncronas, con las etiquetas no listadas ignoradas en silencio.
- Google advierte de que el modelo puede desatender las etiquetas de pausa colocadas de forma poco natural.
- El precio es de US$0.00003 por carácter, citado como US$30 por 1 millón de caracteres, con el primer millón gratis, y el nivel queda fuera del ámbito de regionalización y residencia de datos.
- Synthorai lo sirve a través del endpoint /v1/audio/speech compatible con OpenAI.
Preguntas frecuentes
¿Se puede probar gratis la API de Google TTS Chirp 3 HD?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar Google TTS Chirp 3 HD con su carga de trabajo real antes de añadir un método de pago.
¿En qué destaca Google TTS Chirp 3 HD?
30 estilos distintos en muchos idiomas; voces con nombres de estrellas y streaming de texto de baja latencia; ritmo, etiquetas de pausa y pronunciaciones personalizadas en Preview. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta Google TTS Chirp 3 HD?
Google TTS Chirp 3 HD cuesta $30 por millón de tokens de entrada y $0 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma.
¿Google TTS Chirp 3 HD admite caché de prompts?
Google TTS Chirp 3 HD no tiene hoy descuento por lectura de caché en Synthorai. El caché de prompts sigue disponible para otros modelos del gateway. Consulte la tabla de precios para ver alternativas con caché. Comparativa de caché entre proveedores →
¿Cómo obtengo acceso a Google TTS Chirp 3 HD?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="google-tts-chirp3-hd" y listo. Una sola clave API cubre todos los modelos del gateway.
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.