🎁 Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

TTS-1 HD

OpenAI Síntesis de vozStreaming
Entrada$30/M
Contexto4K

Precios de lista del proveedor, sin margen de plataforma, pago por uso. Estos son los precios de lista oficiales. Los clientes con sesión iniciada pueden ver los precios efectivos con descuentos del espacio de trabajo en /console/pricing.

Use TTS-1 HD en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="tts-1-hd",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Especificaciones y límites

Audio

Idiomas
En general sigue el soporte de idiomas del modelo Whisper: afrikáans, árabe, armenio, azerbaiyano, bielorruso, bosnio, búlgaro, catalán, chino, croata, checo, danés, neerlandés, inglés, estonio, finés, francés, gallego, alemán, griego, hebreo, hindi, húngaro, islandés, indonesio, italiano, japonés, canarés, kazajo, coreano, letón, lituano, macedonio, malayo, maratí, maorí, nepalí, noruego, persa, polaco, portugués, rumano, ruso, serbio, eslovaco, esloveno, español, suajili, sueco, tagalo, tamil, tailandés, turco, ucraniano, urdu, vietnamita y galés, pese a que las voces están optimizadas para el inglés
Límites de audio
  • Solo el endpoint de generación de voz (v1/audio/speech), con Chat Completions, Responses, Realtime, Batch y Fine-tuning indicados todos como no admitidos
  • el texto de entrada está limitado a 4096 caracteres
  • salida mp3 (por defecto), opus, aac, flac, wav o pcm (muestras en bruto de 24 kHz, 16 bits, con signo y little-endian)
  • reproducción en tiempo real mediante codificación de transferencia por fragmentos

Tiempo real

Voces
alloy, ash, coral, echo, fable, onyx, nova, sage y shimmer, un conjunto menor que la lista completa de 13 voces de TTS, y las voces están actualmente optimizadas para el inglés.

Modelo

Modalidades
texto → audio

Modelo de texto a voz optimizado para calidad: el mismo endpoint Speech que tts-1, ajustado para casos de uso de alta calidad en lugar de baja latencia. El parámetro instructions que dirige el acento, la emoción, la entonación y el tono en gpt-4o-mini-tts no funciona con tts-1 ni con tts-1-hd.

según documentación oficial de OpenAI ↗

Acerca de TTS-1 HD

Optimizado para la calidad más que para la latencia
El doble de la tarifa de tts-1, a $30 por millón de caracteres
Adecuado para narración y audio publicado, no para el habla interactiva

TTS-1 HD es el modelo de texto a voz de OpenAI optimizado para la calidad, la mitad de mayor fidelidad del par que forma con tts-1.

  • La página del modelo lo plantea como un conversor de texto en habla de sonido natural para casos de uso de texto a voz de alta calidad, y la guía enuncia el compromiso de forma directa: tts-1 ofrece menor latencia, pero con menor calidad que tts-1-hd.
  • Esa calidad adicional es toda la diferencia, y tiene el precio correspondiente de $30 por millón de caracteres, el doble de la tarifa de tts-1, lo que lo convierte en la opción para la narración, el audio publicado y todo aquello que un oyente vaya a escuchar más de una vez, en lugar de para el habla interactiva turno a turno.
  • Todo lo demás lo comparte con su hermano.
  • Sirve únicamente el endpoint de speech de la Audio API, tomando texto y devolviendo audio, con las mismas nueve voces (alloy, ash, coral, echo, fable, onyx, nova, sage y shimmer), los mismos formatos de salida MP3, Opus, AAC, FLAC, WAV y PCM a 24 kHz, el mismo rango de velocidad de 0.25 a 4.0 en torno a un valor por defecto de 1.0, y el mismo streaming con codificación de transferencia por fragmentos para que la reproducción pueda empezar pronto.
  • Se aplican también las mismas dos restricciones: el parámetro instructions para dirigir el tono y la entrega está documentado como no funcional en tts-1 ni en tts-1-hd, y el formato de stream sse no se admite, con lo que el streaming de audio en bruto queda como única opción.
  • La cobertura de idiomas sigue la lista de Whisper mientras las voces siguen optimizadas para el inglés, y OpenAI exige una divulgación clara de que la voz está generada por IA.
  • Synthorai sirve TTS-1 HD a través del mismo endpoint /v1/audio/speech compatible con OpenAI.

Preguntas frecuentes

¿Se puede probar gratis la API de TTS-1 HD?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $30/M por tokens de entrada, solo ese crédito cubre aproximadamente 8 solicitudes de ~4K tokens contra TTS-1 HD.

¿En qué destaca TTS-1 HD?

Optimizado para la calidad más que para la latencia; el doble de la tarifa de tts-1, a $30 por millón de caracteres; adecuado para narración y audio publicado, no para el habla interactiva. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta TTS-1 HD?

TTS-1 HD cuesta $30 por millón de tokens de entrada y $0 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma.

¿TTS-1 HD admite caché de prompts?

TTS-1 HD no tiene hoy descuento por lectura de caché en Synthorai. El caché de prompts sigue disponible para otros modelos del gateway. Consulte la tabla de precios para ver alternativas con caché. Comparativa de caché entre proveedores →

¿Cómo obtengo acceso a TTS-1 HD?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="tts-1-hd" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Obtenga su clave API gratuita Compare su costo →