BytePlus Seed TTS 2.0
Preços de tabela do provedor: sem margem da plataforma, pagamento por uso. Estes são os preços de tabela oficiais. Clientes autenticados podem ver os preços efetivos com descontos do espaço de trabalho em /console/pricing.
Use o BytePlus Seed TTS 2.0 em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="seed-tts-2.0",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "seed-tts-2.0",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "seed-tts-2.0",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "seed-tts-2.0",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("seed-tts-2.0")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Especificações e limites
Áudio
- Idiomas
- Inglês, chinês, japonês, alemão, francês, espanhol mexicano, indonésio bahasa, português brasileiro, italiano e coreano
- Limites de áudio
-
- Integração por HTTP com streaming unidirecional, WebSocket com streaming uni ou bidirecional e SDK online
- taxa de amostragem 24K/16K/8K nas interfaces de streaming unidirecional e sem streaming, 48K/24K/16K/8K na interface bidirecional
- saída PCM, OGG_OPUS ou MP3 (WAV é aceito, mas retorna múltiplos cabeçalhos em streaming)
- SSML não é suportado
Tempo real
- Vozes
- As vozes do TTS 2.0 carregam speaker IDs *_uranus_bigtts e são listadas por cenário (General, Entertainment, Education, Dubbing, AudioBook, RolePlay, CustomerService) na página Voice List; emoção por voz via audio_params.emotion com emotion_scale de 1 a 5 (padrão 4), speech_rate e loudness_rate em [-50, 100] e post_process.pitch em [-12, 12].
- Sessão
- context_texts e section_id são exclusivos do TTS 2.0: uma instrução em linguagem simples orienta ritmo, emoção, volume e estilo (apenas o primeiro valor da lista tem efeito, e seu texto não é cobrado), e section_id vincula até 30 rodadas ou 10 minutos de síntese anterior como contexto histórico.
Modelo
- Modalidades
- texto → áudio
- TTS de Query-Response que entende em conjunto o texto da pergunta e o da resposta, acrescentando prompts de texto para emoção, tom, ritmo e altura, tags de emoção por sentença e entendimento de contexto em relação ao TTS 1.0. Selecionado com o X-Api-Resource-Id seed-tts-2.0
- enable_subtitle retorna timestamps de palavra e de fonema nas vozes do TTS 2.0 (apenas chinês e inglês)
- cache de resposta opcional retido por 1 hora
conforme documentação oficial da ByteDance ↗
Sobre o BytePlus Seed TTS 2.0
O Seed TTS 2.0 é a geração atual de text-to-speech da ByteDance no BytePlus, e a visão geral oficial o constrói em torno de um mecanismo de consulta e resposta: o modelo lê tanto a consulta do usuário quanto o texto de resposta que está prestes a falar, o que a BytePlus diz expandir a compreensão contextual e apurar a semelhança humana e a expressão emocional de uma conversa.
- Ela nomeia assistentes de IA, companheiros de IA, centrais de atendimento e dublagem de vídeo como os cenários-alvo.
- Três recursos são listados como exclusivos da 2.0 em relação à linha 1.0: um prompt de texto que direciona emoção, tom, velocidade da fala e altura da voz em linguagem simples; uma tag de emoção em nível de frase; e o entendimento de contexto, no qual você fornece o diálogo ao redor e o modelo carrega seu tom emocional para a síntese.
- Dez idiomas são cobertos, abrangendo inglês, chinês, japonês, alemão, francês, espanhol mexicano, indonésio, português brasileiro, italiano e coreano, alcançáveis por HTTP em streaming unidirecional, WebSocket em streaming unidirecional ou bidirecional e pelo SDK online.
- O áudio volta como PCM por padrão, ou OGG_OPUS ou MP3, a uma taxa de amostragem padrão de 24 kHz, e o WAV está documentado como não suportando streaming de forma alguma.
- A superfície de requisição é profunda: um id de voz escolhido da lista publicada, velocidade da fala e volume cada um em uma escala de -50 a 100, uma configuração de emoção com uma intensidade de 1 a 5 que apenas algumas vozes aceitam, timestamps opcionais de palavra e fonema para chinês e inglês, e um cache de síntese de uma hora para texto repetido.
- Duas notas práticas: o SSML não é suportado atualmente no texto de entrada, e o contexto passado para direcionamento emocional não é cobrado.
- Fora isso, a cobrança é por caractere, contando espaços e pontuação.
- A Synthorai o serve pelo endpoint /v1/audio/speech compatível com OpenAI ao lado do resto do seu catálogo de fala.
Perguntas frequentes
A API do BytePlus Seed TTS 2.0 é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $30/M de tokens de entrada, só esse crédito já cobre cerca de 8 requisições de ~4K tokens ao BytePlus Seed TTS 2.0.
Em que o BytePlus Seed TTS 2.0 é melhor?
Voltado a assistentes de IA, centrais de atendimento e dublagem de vídeo; prompt em linguagem simples direciona emoção, tom, velocidade e altura da voz; lê a consulta do usuário junto ao texto de resposta que fala. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o BytePlus Seed TTS 2.0?
Na Synthorai, o BytePlus Seed TTS 2.0 custa $30 por milhão de tokens de entrada e $0 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma.
O BytePlus Seed TTS 2.0 suporta cache de prompts?
O BytePlus Seed TTS 2.0 não tem desconto de leitura de cache na Synthorai hoje. O cache de prompts continua valendo para outros modelos do gateway; veja na tabela de preços as alternativas com cache habilitado. Comparativo de cache entre provedores →
Como obtenho acesso ao BytePlus Seed TTS 2.0?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="seed-tts-2.0" e pronto. Uma única chave de API cobre todos os modelos do gateway.