Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

TTS-1

TTS-1 es el modelo de texto a voz de OpenAI optimizado para la velocidad.

Entrada
texto $15/M
Salida
audio
Contexto
4K

El precio en contexto

Posición del precio entre 7 modelos comparables

Entrada$15/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Síntesis de voz

Idiomas de síntesis En general sigue el soporte de idiomas del modelo Whisper: afrikáans, árabe, armenio, azerbaiyano, bielorruso, bosnio, búlgaro, catalán, chino, croata, checo, danés, neerlandés, inglés, estonio, finés, francés, gallego, alemán, griego, hebreo, hindi, húngaro, islandés, indonesio, italiano, japonés, canarés, kazajo, coreano, letón, lituano, macedonio, malayo, maratí, maorí, nepalí, noruego, persa, polaco, portugués, rumano, ruso, serbio, eslovaco, esloveno, español, suajili, sueco, tagalo, tamil, tailandés, turco, ucraniano, urdu, vietnamita y galés, pese a que las voces están optimizadas para el inglés
Voces alloy, ash, coral, echo, fable, onyx, nova, sage y shimmer, un conjunto menor que la lista completa de 13 voces de TTS, y las voces están actualmente optimizadas para el inglés.
Límite de entrada 4,096 caracteres Los proveedores publican este límite en unidades distintas: en texto no latino, un límite en bytes no equivale a un límite en caracteres.
Síntesis en streaming
SSML Sin documentar
Control de voz No disponible en este modelo
Unidad de facturación Por carácter de entrada
Endpoints y formatos
  • Solo el endpoint de generación de voz (v1/audio/speech), con Chat Completions, Responses, Realtime, Batch y Fine-tuning indicados todos como no admitidos
  • el texto de entrada está limitado a 4096 caracteres
  • salida mp3 (por defecto), opus, aac, flac, wav o pcm (muestras en bruto de 24 kHz, 16 bits, con signo y little-endian)
  • reproducción en tiempo real mediante codificación de transferencia por fragmentos

Modelo

Modalidades texto → audio

Modelo de texto a voz optimizado para velocidad: OpenAI documenta tts-1 como la opción de menor latencia y menor calidad frente a tts-1-hd. El parámetro instructions que dirige el acento, la emoción, la entonación y el tono en gpt-4o-mini-tts no funciona con tts-1 ni con tts-1-hd.

según documentación oficial de OpenAI ↗

Use TTS-1 en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="tts-1",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Acerca de TTS-1

  • Su página de modelo lo describe como un conversor de texto en habla de sonido natural y como ajustado para casos de uso de texto a voz en tiempo real, y la guía de texto a voz traza la línea de la familia con claridad: tts-1 ofrece menor latencia, pero con menor calidad que tts-1-hd.
  • Es un modelo de propósito único, admitido solo en el endpoint de speech de la Audio API y en ninguna otra ruta, que toma texto y devuelve audio, con un precio de $15 por millón de caracteres.
  • Dispone de nueve voces, un conjunto más pequeño que las trece que ofrece en total el endpoint de Speech: alloy, ash, coral, echo, fable, onyx, nova, sage y shimmer.
  • La salida puede ser MP3 por defecto, o bien Opus, AAC, FLAC, WAV o PCM sin procesar a 24 kHz, y OpenAI recomienda WAV o PCM para la respuesta más rápida; la velocidad del habla es ajustable de 0.25 a 4.0, con 1.0 por defecto, y el audio puede transmitirse con codificación de transferencia por fragmentos, de modo que la reproducción empieza antes de que exista el archivo completo.
  • Dos limitaciones distinguen a esta generación de la más reciente y romperán el código copiado: el parámetro instructions que dirige el acento, la emoción y la entrega no funciona en tts-1 ni en tts-1-hd, y aquí no se admite el formato de stream sse.
  • La cobertura de idiomas sigue en general la lista de Whisper de más de cincuenta idiomas, aunque las propias voces están optimizadas para el inglés, y las políticas de uso de OpenAI exigen indicar a los usuarios finales que la voz está generada por IA.
  • Synthorai sirve TTS-1 a través de su endpoint /v1/audio/speech compatible con OpenAI, así que los clientes de voz existentes funcionan sin modificaciones.

Preguntas frecuentes

¿Se puede probar gratis la API de TTS-1?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. Suficiente para probar TTS-1 con su carga de trabajo real antes de añadir un método de pago.

¿En qué destaca TTS-1?

Optimizado para la velocidad y casos de uso de texto a voz en tiempo real; menor latencia con menor calidad que tts-1-hd; sin parámetro instructions y sin formato de stream sse. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta TTS-1?

TTS-1 cuesta $15 por millón de tokens de entrada y $0 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma.

¿TTS-1 admite caché de prompts?

TTS-1 no tiene hoy descuento por lectura de caché en Synthorai. El caché de prompts sigue disponible para otros modelos del gateway. Consulte la tabla de precios para ver alternativas con caché. Comparativa de caché entre proveedores →

¿Cómo obtengo acceso a TTS-1?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="tts-1" y listo. Una sola clave API cubre todos los modelos del gateway.

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →