Seed TTS 2.0 ist ByteDances aktuelle Text-to-Speech-Generation auf BytePlus, und die offizielle Übersicht baut sie um einen Query-Response-Mechanismus herum: Das Modell liest sowohl die Anfrage der nutzenden Person als auch den Antworttext, den es gleich sprechen wird, was laut BytePlus das kontextuelle Verständnis erweitert und die Menschenähnlichkeit sowie den emotionalen Ausdruck eines Gesprächs schärft.
- Eingabe
- Text $30/M
- Ausgabe
- Audio
- Kontext
- 4K
Preis im Vergleich
Preisposition unter 7 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Sprachsynthese
| Synthesesprachen | Englisch, Chinesisch, Japanisch, Deutsch, Französisch, mexikanisches Spanisch, indonesisches Bahasa, brasilianisches Portugiesisch, Italienisch und Koreanisch |
|---|---|
| Stimmen | TTS-2.0-Stimmen tragen Speaker-IDs der Form *_uranus_bigtts und sind auf der Voice-List-Seite nach Szenario gelistet (General, Entertainment, Education, Dubbing, AudioBook, RolePlay, CustomerService); Emotion je Stimme über audio_params.emotion mit emotion_scale 1 bis 5 (Standard 4), speech_rate und loudness_rate in [-50, 100] sowie post_process.pitch in [-12, 12]. |
| Streaming-Synthese | Ja |
| SSML | Nicht unterstützt |
| Stimmsteuerung | Numerische Parameter und Anweisung |
| Was akzeptiert wird | context_texts und section_id gibt es nur bei TTS 2.0: Eine Anweisung in natürlicher Sprache steuert Tempo, Emotion, Lautstärke und Stil (nur der erste Wert der Liste wird wirksam, und sein Text wird nicht abgerechnet), und section_id verknüpft bis zu 30 Runden oder 10 Minuten früherer Synthese als historischen Kontext. |
| Abrechnungseinheit | Pro Eingabezeichen |
| Endpunkte und Formate |
|
Modell
| Modalitäten | Text → Audio |
|---|
- Query-Response-TTS, das Anfrage und Antworttext gemeinsam versteht und gegenüber TTS 1.0 Text-Prompts für Emotion, Tonfall, Tempo und Tonhöhe, Emotions-Tags auf Satzebene sowie Kontextverständnis ergänzt. Auswahl über die X-Api-Resource-Id seed-tts-2.0
- enable_subtitle liefert bei TTS-2.0-Stimmen Zeitstempel auf Wort- und Phonemebene (nur Chinesisch und Englisch)
- optionaler Antwort-Cache mit 1 Stunde Aufbewahrung
BytePlus Seed TTS 2.0 in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="seed-tts-2.0",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "seed-tts-2.0",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "seed-tts-2.0",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "seed-tts-2.0",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("seed-tts-2.0")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über BytePlus Seed TTS 2.0
- Als Zielszenarien nennt sie KI-Assistenten, KI-Begleiter, Callcenter und Videosynchronisation.
- Drei Funktionen sind als exklusiv für 2.0 gegenüber der 1.0-Linie aufgeführt: ein Textprompt, der Emotion, Tonfall, Sprechgeschwindigkeit und Tonhöhe in einfacher Sprache steuert; ein Emotions-Tag auf Satzebene; und Kontextverständnis, bei dem Sie den umgebenden Dialog liefern und das Modell dessen emotionalen Ton in die Synthese überträgt.
- Zehn Sprachen werden abgedeckt: Englisch, Chinesisch, Japanisch, Deutsch, Französisch, mexikanisches Spanisch, Indonesisch, brasilianisches Portugiesisch, Italienisch und Koreanisch, erreichbar über unidirektionales Streaming-HTTP, unidirektionalen oder bidirektionalen Streaming-WebSocket und das Online-SDK.
- Audio kommt standardmäßig als PCM zurück, alternativ als OGG_OPUS oder MP3, mit einer Standard-Samplingrate von 24 kHz, und für WAV ist dokumentiert, dass es Streaming überhaupt nicht unterstützt.
- Die Request-Oberfläche ist tief: eine Voice-ID aus der veröffentlichten Liste, Sprechgeschwindigkeit und Lautstärke jeweils auf einer Skala von -50 bis 100, eine Emotionseinstellung mit einer Intensität von 1 bis 5, die nur manche Stimmen akzeptieren, optionale Wort- und Phonem-Zeitstempel für Chinesisch und Englisch sowie ein einstündiger Synthese-Cache für wiederholten Text.
- Zwei praktische Hinweise: SSML wird im Eingabetext derzeit nicht unterstützt, und der zur emotionalen Steuerung übergebene Kontext wird nicht abgerechnet.
- Ansonsten erfolgt die Abrechnung pro Zeichen, einschließlich Leerzeichen und Satzzeichen.
- Synthorai stellt es über den OpenAI-kompatiblen /v1/audio/speech Endpoint neben dem Rest seines Sprachkatalogs bereit.
FAQ
Lässt sich die BytePlus Seed TTS 2.0 API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Das reicht, um BytePlus Seed TTS 2.0 mit Ihrem realen Workload auszuprobieren, bevor Sie eine Zahlungsmethode hinterlegen.
Worin ist BytePlus Seed TTS 2.0 am besten?
Auf KI-Assistenten, Callcenter und Videosynchronisation ausgerichtet; Prompt in einfacher Sprache steuert Emotion, Tonfall, Sprechgeschwindigkeit und Tonhöhe; liest die Anfrage der nutzenden Person neben dem gesprochenen Antworttext. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet BytePlus Seed TTS 2.0?
BytePlus Seed TTS 2.0 kostet auf Synthorai $30 pro Million Input-Tokens und $0 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag.
Unterstützt BytePlus Seed TTS 2.0 Prompt-Caching?
BytePlus Seed TTS 2.0 hat auf Synthorai derzeit keinen Cache-Lese-Rabatt. Prompt-Caching gilt weiterhin für andere Modelle auf dem Gateway; cache-fähige Alternativen finden Sie in der Preistabelle. Caching-Vergleich der Anbieter →
Wie erhalte ich Zugang zu BytePlus Seed TTS 2.0?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="seed-tts-2.0", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.