🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

TTS-1 HD

OpenAI Síntese de vozStreaming
Entrada$30/M
Contexto4K

Preços de tabela do provedor: sem margem da plataforma, pagamento por uso. Estes são os preços de tabela oficiais. Clientes autenticados podem ver os preços efetivos com descontos do espaço de trabalho em /console/pricing.

Use o TTS-1 HD em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="tts-1-hd",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Especificações e limites

Áudio

Idiomas
Segue de modo geral o suporte a idiomas do modelo Whisper: africâner, árabe, armênio, azerbaijano, bielorrusso, bósnio, búlgaro, catalão, chinês, croata, tcheco, dinamarquês, holandês, inglês, estoniano, finlandês, francês, galego, alemão, grego, hebraico, híndi, húngaro, islandês, indonésio, italiano, japonês, canarês, cazaque, coreano, letão, lituano, macedônio, malaio, marati, maori, nepalês, norueguês, persa, polonês, português, romeno, russo, sérvio, eslovaco, esloveno, espanhol, suaíli, sueco, tagalo, tâmil, tailandês, turco, ucraniano, urdu, vietnamita e galês, embora as vozes sejam otimizadas para inglês
Limites de áudio
  • Apenas no endpoint de geração de fala (v1/audio/speech), com Chat Completions, Responses, Realtime, Batch e Fine-tuning listados como não suportados
  • o texto de entrada é limitado a 4096 caracteres
  • saída em mp3 (padrão), opus, aac, flac, wav ou pcm (amostras brutas de 24 kHz, 16 bits, com sinal, little-endian)
  • reprodução em tempo real via chunked transfer encoding

Tempo real

Vozes
alloy, ash, coral, echo, fable, onyx, nova, sage e shimmer, um conjunto menor que a lista completa de 13 vozes de TTS, e as vozes estão atualmente otimizadas para inglês.

Modelo

Modalidades
texto → áudio

Modelo de text-to-speech otimizado para qualidade: o mesmo endpoint de fala do tts-1, ajustado para casos de uso de alta qualidade em vez de baixa latência. O parâmetro instructions, que orienta sotaque, emoção, entonação e tom no gpt-4o-mini-tts, não funciona com tts-1 nem com tts-1-hd.

conforme documentação oficial da OpenAI ↗

Sobre o TTS-1 HD

Otimizado para qualidade em vez de latência
O dobro da tarifa do tts-1, a $30 por milhão de caracteres
Serve narração e áudio publicado, não fala interativa

O TTS-1 HD é o modelo de text-to-speech da OpenAI otimizado para qualidade, a metade de maior fidelidade do par que ele forma com o tts-1.

  • A página do modelo o apresenta como convertendo texto em fala de sonoridade natural para casos de uso de text-to-speech de alta qualidade, e o guia enuncia a troca diretamente: o tts-1 oferece menor latência, mas com qualidade inferior à do tts-1-hd.
  • Essa qualidade extra é toda a diferença, e ela tem preço à altura, $30 por milhão de caracteres, o dobro da tarifa do tts-1, o que faz dele a escolha para narração, áudio publicado e qualquer coisa que um ouvinte vá escutar mais de uma vez, em vez de para fala interativa turno a turno.
  • Todo o resto é compartilhado com seu irmão.
  • Ele serve apenas o endpoint de fala da Audio API, recebendo texto e retornando áudio, com as mesmas nove vozes (alloy, ash, coral, echo, fable, onyx, nova, sage e shimmer), os mesmos formatos de saída MP3, Opus, AAC, FLAC, WAV e PCM de 24 kHz, a mesma faixa de velocidade de 0.25 a 4.0 em torno de um padrão de 1.0, e o mesmo streaming por chunked transfer para que a reprodução possa começar cedo.
  • As mesmas duas restrições também se aplicam: o parâmetro instructions para direcionar tom e entrega está documentado como não funcionando no tts-1 nem no tts-1-hd, e o formato de stream sse não é suportado, deixando o streaming de áudio bruto como a única opção.
  • A cobertura de idiomas segue a lista do Whisper enquanto as vozes permanecem otimizadas para inglês, e a OpenAI exige uma divulgação clara de que a voz é gerada por IA.
  • A Synthorai serve o TTS-1 HD pelo mesmo endpoint /v1/audio/speech compatível com OpenAI.

Perguntas frequentes

A API do TTS-1 HD é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $30/M de tokens de entrada, só esse crédito já cobre cerca de 8 requisições de ~4K tokens ao TTS-1 HD.

Em que o TTS-1 HD é melhor?

Otimizado para qualidade em vez de latência; o dobro da tarifa do tts-1, a $30 por milhão de caracteres; serve narração e áudio publicado, não fala interativa. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o TTS-1 HD?

Na Synthorai, o TTS-1 HD custa $30 por milhão de tokens de entrada e $0 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma.

O TTS-1 HD suporta cache de prompts?

O TTS-1 HD não tem desconto de leitura de cache na Synthorai hoje. O cache de prompts continua valendo para outros modelos do gateway; veja na tabela de preços as alternativas com cache habilitado. Comparativo de cache entre provedores →

Como obtenho acesso ao TTS-1 HD?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="tts-1-hd" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Obtenha sua chave de API gratuita Compare seu custo →