🎁 Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

BytePlus Seed TTS 2.0

ByteDance Síntese de vozStreamingCache de prompts
Entrada$30/M
Contexto4K

Preços de tabela do provedor: sem margem da plataforma, pagamento por uso. Estes são os preços de tabela oficiais. Clientes autenticados podem ver os preços efetivos com descontos do espaço de trabalho em /console/pricing.

Use o BytePlus Seed TTS 2.0 em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="seed-tts-2.0",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

Especificações e limites

Áudio

Idiomas
Inglês, chinês, japonês, alemão, francês, espanhol mexicano, indonésio bahasa, português brasileiro, italiano e coreano
Limites de áudio
  • Integração por HTTP com streaming unidirecional, WebSocket com streaming uni ou bidirecional e SDK online
  • taxa de amostragem 24K/16K/8K nas interfaces de streaming unidirecional e sem streaming, 48K/24K/16K/8K na interface bidirecional
  • saída PCM, OGG_OPUS ou MP3 (WAV é aceito, mas retorna múltiplos cabeçalhos em streaming)
  • SSML não é suportado

Tempo real

Vozes
As vozes do TTS 2.0 carregam speaker IDs *_uranus_bigtts e são listadas por cenário (General, Entertainment, Education, Dubbing, AudioBook, RolePlay, CustomerService) na página Voice List; emoção por voz via audio_params.emotion com emotion_scale de 1 a 5 (padrão 4), speech_rate e loudness_rate em [-50, 100] e post_process.pitch em [-12, 12].
Sessão
context_texts e section_id são exclusivos do TTS 2.0: uma instrução em linguagem simples orienta ritmo, emoção, volume e estilo (apenas o primeiro valor da lista tem efeito, e seu texto não é cobrado), e section_id vincula até 30 rodadas ou 10 minutos de síntese anterior como contexto histórico.

Modelo

Modalidades
texto → áudio
  • TTS de Query-Response que entende em conjunto o texto da pergunta e o da resposta, acrescentando prompts de texto para emoção, tom, ritmo e altura, tags de emoção por sentença e entendimento de contexto em relação ao TTS 1.0. Selecionado com o X-Api-Resource-Id seed-tts-2.0
  • enable_subtitle retorna timestamps de palavra e de fonema nas vozes do TTS 2.0 (apenas chinês e inglês)
  • cache de resposta opcional retido por 1 hora

conforme documentação oficial da ByteDance ↗

Sobre o BytePlus Seed TTS 2.0

Voltado a assistentes de IA, centrais de atendimento e dublagem de vídeo
Prompt em linguagem simples direciona emoção, tom, velocidade e altura da voz
Lê a consulta do usuário junto ao texto de resposta que fala

O Seed TTS 2.0 é a geração atual de text-to-speech da ByteDance no BytePlus, e a visão geral oficial o constrói em torno de um mecanismo de consulta e resposta: o modelo lê tanto a consulta do usuário quanto o texto de resposta que está prestes a falar, o que a BytePlus diz expandir a compreensão contextual e apurar a semelhança humana e a expressão emocional de uma conversa.

  • Ela nomeia assistentes de IA, companheiros de IA, centrais de atendimento e dublagem de vídeo como os cenários-alvo.
  • Três recursos são listados como exclusivos da 2.0 em relação à linha 1.0: um prompt de texto que direciona emoção, tom, velocidade da fala e altura da voz em linguagem simples; uma tag de emoção em nível de frase; e o entendimento de contexto, no qual você fornece o diálogo ao redor e o modelo carrega seu tom emocional para a síntese.
  • Dez idiomas são cobertos, abrangendo inglês, chinês, japonês, alemão, francês, espanhol mexicano, indonésio, português brasileiro, italiano e coreano, alcançáveis por HTTP em streaming unidirecional, WebSocket em streaming unidirecional ou bidirecional e pelo SDK online.
  • O áudio volta como PCM por padrão, ou OGG_OPUS ou MP3, a uma taxa de amostragem padrão de 24 kHz, e o WAV está documentado como não suportando streaming de forma alguma.
  • A superfície de requisição é profunda: um id de voz escolhido da lista publicada, velocidade da fala e volume cada um em uma escala de -50 a 100, uma configuração de emoção com uma intensidade de 1 a 5 que apenas algumas vozes aceitam, timestamps opcionais de palavra e fonema para chinês e inglês, e um cache de síntese de uma hora para texto repetido.
  • Duas notas práticas: o SSML não é suportado atualmente no texto de entrada, e o contexto passado para direcionamento emocional não é cobrado.
  • Fora isso, a cobrança é por caractere, contando espaços e pontuação.
  • A Synthorai o serve pelo endpoint /v1/audio/speech compatível com OpenAI ao lado do resto do seu catálogo de fala.

Perguntas frequentes

A API do BytePlus Seed TTS 2.0 é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $30/M de tokens de entrada, só esse crédito já cobre cerca de 8 requisições de ~4K tokens ao BytePlus Seed TTS 2.0.

Em que o BytePlus Seed TTS 2.0 é melhor?

Voltado a assistentes de IA, centrais de atendimento e dublagem de vídeo; prompt em linguagem simples direciona emoção, tom, velocidade e altura da voz; lê a consulta do usuário junto ao texto de resposta que fala. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o BytePlus Seed TTS 2.0?

Na Synthorai, o BytePlus Seed TTS 2.0 custa $30 por milhão de tokens de entrada e $0 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma.

O BytePlus Seed TTS 2.0 suporta cache de prompts?

O BytePlus Seed TTS 2.0 não tem desconto de leitura de cache na Synthorai hoje. O cache de prompts continua valendo para outros modelos do gateway; veja na tabela de preços as alternativas com cache habilitado. Comparativo de cache entre provedores →

Como obtenho acesso ao BytePlus Seed TTS 2.0?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="seed-tts-2.0" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Modelos relacionados

Obtenha sua chave de API gratuita Compare seu custo →