🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

TTS-1

OpenAI Síntese de vozStreaming
Entrada$15/M
Contexto4K

Preços de tabela do provedor: sem margem da plataforma, pagamento por uso. Estes são os preços de tabela oficiais. Clientes autenticados podem ver os preços efetivos com descontos do espaço de trabalho em /console/pricing.

Use o TTS-1 em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="tts-1",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Especificações e limites

Áudio

Idiomas
Segue de modo geral o suporte a idiomas do modelo Whisper: africâner, árabe, armênio, azerbaijano, bielorrusso, bósnio, búlgaro, catalão, chinês, croata, tcheco, dinamarquês, holandês, inglês, estoniano, finlandês, francês, galego, alemão, grego, hebraico, híndi, húngaro, islandês, indonésio, italiano, japonês, canarês, cazaque, coreano, letão, lituano, macedônio, malaio, marati, maori, nepalês, norueguês, persa, polonês, português, romeno, russo, sérvio, eslovaco, esloveno, espanhol, suaíli, sueco, tagalo, tâmil, tailandês, turco, ucraniano, urdu, vietnamita e galês, embora as vozes sejam otimizadas para inglês
Limites de áudio
  • Apenas no endpoint de geração de fala (v1/audio/speech), com Chat Completions, Responses, Realtime, Batch e Fine-tuning listados como não suportados
  • o texto de entrada é limitado a 4096 caracteres
  • saída em mp3 (padrão), opus, aac, flac, wav ou pcm (amostras brutas de 24 kHz, 16 bits, com sinal, little-endian)
  • reprodução em tempo real via chunked transfer encoding

Tempo real

Vozes
alloy, ash, coral, echo, fable, onyx, nova, sage e shimmer, um conjunto menor que a lista completa de 13 vozes de TTS, e as vozes estão atualmente otimizadas para inglês.

Modelo

Modalidades
texto → áudio

Modelo de text-to-speech otimizado para velocidade: a OpenAI documenta o tts-1 como a opção de menor latência e menor qualidade ao lado do tts-1-hd. O parâmetro instructions, que orienta sotaque, emoção, entonação e tom no gpt-4o-mini-tts, não funciona com tts-1 nem com tts-1-hd.

conforme documentação oficial da OpenAI ↗

Sobre o TTS-1

Otimizado para velocidade e casos de uso de text-to-speech em tempo real
Menor latência com qualidade inferior à do tts-1-hd
Sem parâmetro instructions e sem formato de stream sse

O TTS-1 é o modelo de text-to-speech da OpenAI otimizado para velocidade.

  • Sua página de modelo o descreve como convertendo texto em fala de sonoridade natural e como ajustado para casos de uso de text-to-speech em tempo real, e o guia de text-to-speech traça a divisão da família de forma direta: o tts-1 oferece menor latência, mas com qualidade inferior à do tts-1-hd.
  • É um modelo de propósito único, suportado apenas no endpoint de fala da Audio API e em nenhuma outra rota, recebendo texto e retornando áudio, com preço de $15 por milhão de caracteres.
  • Nove vozes estão disponíveis para ele, um conjunto menor que as treze que o endpoint de fala oferece no total: alloy, ash, coral, echo, fable, onyx, nova, sage e shimmer.
  • A saída pode ser MP3 por padrão, ou Opus, AAC, FLAC, WAV ou PCM bruto de 24 kHz, e a OpenAI recomenda WAV ou PCM para a resposta mais rápida; a velocidade da fala é ajustável de 0.25 a 4.0, com 1.0 como padrão, e o áudio pode ser transmitido com chunked transfer encoding para que a reprodução comece antes de o arquivo completo existir.
  • Dois limites distinguem esta geração da mais nova e vão quebrar código copiado: o parâmetro instructions que direciona sotaque, emoção e entrega não funciona no tts-1 nem no tts-1-hd, e o formato de stream sse não é suportado aqui.
  • A cobertura de idiomas geralmente segue a lista do Whisper de mais de cinquenta idiomas, embora as próprias vozes sejam otimizadas para inglês, e as políticas de uso da OpenAI exigem informar aos usuários finais que a voz é gerada por IA.
  • A Synthorai serve o TTS-1 pelo seu endpoint /v1/audio/speech compatível com OpenAI, então os clientes de fala existentes funcionam sem modificação.

Perguntas frequentes

A API do TTS-1 é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $15/M de tokens de entrada, só esse crédito já cobre cerca de 16 requisições de ~4K tokens ao TTS-1.

Em que o TTS-1 é melhor?

Otimizado para velocidade e casos de uso de text-to-speech em tempo real; menor latência com qualidade inferior à do tts-1-hd; sem parâmetro instructions e sem formato de stream sse. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o TTS-1?

Na Synthorai, o TTS-1 custa $15 por milhão de tokens de entrada e $0 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma.

O TTS-1 suporta cache de prompts?

O TTS-1 não tem desconto de leitura de cache na Synthorai hoje. O cache de prompts continua valendo para outros modelos do gateway; veja na tabela de preços as alternativas com cache habilitado. Comparativo de cache entre provedores →

Como obtenho acesso ao TTS-1?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="tts-1" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Obtenha sua chave de API gratuita Compare seu custo →