Seed TTS 2.0 è l'attuale generazione text-to-speech di ByteDance su BytePlus, e la panoramica ufficiale la costruisce attorno a un meccanismo di query e risposta: il modello legge sia la query dell'utente sia il testo della risposta che sta per pronunciare, il che secondo BytePlus amplia la comprensione contestuale e affina la naturalezza umana e l'espressione emotiva di una conversazione.
- Input
- testo $30/M
- Output
- audio
- Contesto
- 4K
Il prezzo nel contesto
Posizione del prezzo tra 7 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Sintesi vocale
| Lingue di sintesi | Inglese, cinese, giapponese, tedesco, francese, spagnolo messicano, bahasa indonesiano, portoghese brasiliano, italiano e coreano |
|---|---|
| Voci | Le voci TTS 2.0 hanno speaker ID *_uranus_bigtts e sono elencate per scenario (General, Entertainment, Education, Dubbing, AudioBook, RolePlay, CustomerService) nella pagina Voice List; emozione per singola voce tramite audio_params.emotion con emotion_scale da 1 a 5 (predefinito 4), speech_rate e loudness_rate in [-50, 100] e post_process.pitch in [-12, 12]. |
| Sintesi in streaming | Sì |
| SSML | Non supportato |
| Controllo della voce | Parametri numerici e istruzione |
| Cosa accetta | context_texts e section_id sono esclusivi di TTS 2.0: un'istruzione in linguaggio naturale governa velocità, emozione, volume e stile (ha effetto solo il primo valore dell'elenco, e il suo testo non viene fatturato), e section_id collega fino a 30 round o 10 minuti di sintesi precedente come contesto storico. |
| Unità di fatturazione | Per carattere di input |
| Endpoint e formati |
|
Modello
| Modalità | testo → audio |
|---|
- TTS Query-Response che comprende insieme la query e il testo della risposta, aggiungendo rispetto a TTS 1.0 prompt testuali per emozione, tono, velocità e intonazione, tag di emozione a livello di frase e comprensione del contesto. Si seleziona con l'X-Api-Resource-Id seed-tts-2.0
- enable_subtitle restituisce timestamp di parola e di fonema sulle voci TTS 2.0 (solo cinese e inglese)
- cache della risposta opzionale conservata per 1 ora
Usa BytePlus Seed TTS 2.0 in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="seed-tts-2.0",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "seed-tts-2.0",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "seed-tts-2.0",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "seed-tts-2.0",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("seed-tts-2.0")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su BytePlus Seed TTS 2.0
- Indica come scenari target assistenti IA, compagni IA, call center e doppiaggio video.
- Tre funzionalità sono elencate come esclusive della 2.0 rispetto alla linea 1.0: un prompt testuale che guida emozione, tono, velocità del parlato e altezza tonale in linguaggio naturale; un tag di emozione a livello di frase; e la comprensione del contesto, in cui fornisci il dialogo circostante e il modello porta il suo tono emotivo nella sintesi.
- Sono coperte dieci lingue, tra inglese, cinese, giapponese, tedesco, francese, spagnolo messicano, indonesiano, portoghese brasiliano, italiano e coreano, raggiungibili tramite HTTP in streaming unidirezionale, WebSocket in streaming unidirezionale o bidirezionale e l'SDK online.
- L'audio torna come PCM di default, oppure OGG_OPUS o MP3, a una frequenza di campionamento predefinita di 24 kHz, e il WAV è documentato come non supportante affatto lo streaming.
- La superficie di richiesta è ampia: un voice id scelto dall'elenco pubblicato, velocità del parlato e volume ciascuno su una scala da -50 a 100, un'impostazione di emozione con un'intensità da 1 a 5 che solo alcune voci accettano, timestamp opzionali di parola e fonema per cinese e inglese, e una cache di sintesi della durata di un'ora per i testi ripetuti.
- Due note pratiche: SSML non è attualmente supportato nel testo di input, e il contesto passato per la guida emotiva non è fatturato.
- Per il resto la fatturazione è per carattere, contando spazi e punteggiatura.
- Synthorai lo serve tramite l'endpoint /v1/audio/speech compatibile OpenAI insieme al resto del suo catalogo vocale.
FAQ
L'API di BytePlus Seed TTS 2.0 si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. Abbastanza per provare BytePlus Seed TTS 2.0 sul tuo carico di lavoro reale prima di aggiungere un metodo di pagamento.
In cosa eccelle BytePlus Seed TTS 2.0?
Rivolto ad assistenti IA, call center e doppiaggio video; un prompt in linguaggio naturale guida emozione, tono, velocità e altezza tonale; lettura della query dell'utente insieme al testo della risposta pronunciata. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa BytePlus Seed TTS 2.0?
Su Synthorai, BytePlus Seed TTS 2.0 costa $30 per milione di token in input e $0 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma.
BytePlus Seed TTS 2.0 supporta il caching dei prompt?
BytePlus Seed TTS 2.0 oggi non ha uno sconto sulle letture dalla cache su Synthorai. Il caching dei prompt resta disponibile per gli altri modelli del gateway: vedi la tabella prezzi per le alternative con cache. Confronto del caching tra provider →
Come ottengo l'accesso a BytePlus Seed TTS 2.0?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="seed-tts-2.0" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.