BytePlus Seed TTS 2.0
Precios de lista del proveedor, sin margen de plataforma, pago por uso. Estos son los precios de lista oficiales. Los clientes con sesión iniciada pueden ver los precios efectivos con descuentos del espacio de trabajo en /console/pricing.
Use BytePlus Seed TTS 2.0 en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="seed-tts-2.0",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "seed-tts-2.0",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "seed-tts-2.0",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "seed-tts-2.0",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("seed-tts-2.0")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Especificaciones y límites
Audio
- Idiomas
- Inglés, chino, japonés, alemán, francés, español de México, bahasa indonesio, portugués de Brasil, italiano y coreano
- Límites de audio
-
- Integración mediante HTTP de streaming unidireccional, WebSocket de streaming uni o bidireccional y SDK en línea
- frecuencia de muestreo 24K/16K/8K en las interfaces de streaming unidireccional y sin streaming, y 48K/24K/16K/8K en la interfaz bidireccional
- salida PCM, OGG_OPUS o MP3 (se acepta WAV, pero devuelve varias cabeceras al transmitir)
- SSML no está admitido
Tiempo real
- Voces
- Las voces de TTS 2.0 llevan identificadores de hablante *_uranus_bigtts y se listan por escenario (General, Entertainment, Education, Dubbing, AudioBook, RolePlay, CustomerService) en la página Voice List; emoción por voz mediante audio_params.emotion con emotion_scale de 1 a 5 (4 por defecto), speech_rate y loudness_rate en [-50, 100], y post_process.pitch en [-12, 12].
- Sesión
- context_texts y section_id son exclusivos de TTS 2.0: una instrucción en lenguaje llano dirige la velocidad, la emoción, el volumen y el estilo (solo surte efecto el primer valor de la lista, y su texto no se factura), y section_id enlaza hasta 30 rondas o 10 minutos de síntesis anterior como contexto histórico.
Modelo
- Modalidades
- texto → audio
- TTS de consulta y respuesta que entiende conjuntamente la consulta y el texto de la respuesta, y que añade sobre TTS 1.0 prompts de texto para emoción, tono, velocidad y altura, etiquetas de emoción por frase y comprensión del contexto. Se selecciona con el X-Api-Resource-Id seed-tts-2.0
- enable_subtitle devuelve marcas de tiempo de palabra y de fonema en las voces de TTS 2.0 (solo en chino e inglés)
- caché de respuesta opcional conservada durante 1 hora
Acerca de BytePlus Seed TTS 2.0
Seed TTS 2.0 es la generación actual de texto a voz de ByteDance en BytePlus, y la descripción general oficial la construye en torno a un mecanismo de consulta y respuesta: el modelo lee tanto la consulta del usuario como el texto de respuesta que va a pronunciar, lo que según BytePlus amplía la comprensión contextual y afina la naturalidad humana y la expresión emocional de una conversación.
- Señala como escenarios objetivo los asistentes de IA, los acompañantes de IA, los centros de llamadas y el doblaje de vídeo.
- Se enumeran tres funciones como exclusivas de 2.0 frente a la línea 1.0: un prompt de texto que dirige la emoción, el tono, la velocidad del habla y la altura tonal en lenguaje llano; una etiqueta de emoción a nivel de frase; y la comprensión del contexto, en la que se aporta el diálogo circundante y el modelo traslada su tono emocional a la síntesis.
- Cubre diez idiomas, que abarcan inglés, chino, japonés, alemán, francés, español de México, indonesio, portugués de Brasil, italiano y coreano, accesibles mediante HTTP en streaming unidireccional, WebSocket en streaming unidireccional o bidireccional y el SDK en línea.
- El audio se devuelve como PCM por defecto, o bien OGG_OPUS o MP3, con una frecuencia de muestreo por defecto de 24 kHz, y WAV está documentado como no compatible con el streaming en absoluto.
- La superficie de la solicitud es amplia: un identificador de voz elegido de la lista publicada, velocidad del habla y volumen, cada uno en una escala de -50 a 100, un ajuste de emoción con una intensidad de 1 a 5 que solo algunas voces aceptan, marcas de tiempo opcionales de palabra y de fonema para el chino y el inglés, y una caché de síntesis de una hora para texto repetido.
- Dos notas prácticas: actualmente no se admite SSML en el texto de entrada, y el contexto que se pasa para dirigir la emoción no se factura.
- Por lo demás, la facturación es por carácter, contando espacios y signos de puntuación.
- Synthorai lo sirve a través del endpoint /v1/audio/speech compatible con OpenAI junto al resto de su catálogo de voz.
Preguntas frecuentes
¿Se puede probar gratis la API de BytePlus Seed TTS 2.0?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $30/M por tokens de entrada, solo ese crédito cubre aproximadamente 8 solicitudes de ~4K tokens contra BytePlus Seed TTS 2.0.
¿En qué destaca BytePlus Seed TTS 2.0?
Orientado a asistentes de IA, centros de llamadas y doblaje de vídeo; un prompt en lenguaje llano dirige emoción, tono, velocidad del habla y altura tonal; lee la consulta del usuario junto al texto de respuesta que pronuncia. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta BytePlus Seed TTS 2.0?
BytePlus Seed TTS 2.0 cuesta $30 por millón de tokens de entrada y $0 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma.
¿BytePlus Seed TTS 2.0 admite caché de prompts?
BytePlus Seed TTS 2.0 no tiene hoy descuento por lectura de caché en Synthorai. El caché de prompts sigue disponible para otros modelos del gateway. Consulte la tabla de precios para ver alternativas con caché. Comparativa de caché entre proveedores →
¿Cómo obtengo acceso a BytePlus Seed TTS 2.0?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="seed-tts-2.0" y listo. Una sola clave API cubre todos los modelos del gateway.