🎁 新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

BytePlus Seed TTS 2.0

ByteDance 語音合成串流輸出提示詞快取
輸入$30/M
上下文4K

廠商牌價,無平台加價,按用量計費。 以下為官方 list 價。已登入的使用者可在 /console/pricing 查看含工作空間折扣的實際價格。

30 秒用上 BytePlus Seed TTS 2.0

OpenAI 相容:換掉 base_url,SDK 不用改。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="seed-tts-2.0",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

規格與限制

音訊

語言
英語、中文、日語、德語、法語、墨西哥西班牙語、印尼語、巴西葡萄牙語、義大利語與韓語
音訊限制
  • 可透過單向串流 HTTP、單向或雙向串流 WebSocket 以及線上 SDK 接入
  • 單向串流與非串流介面的取樣率為 24K/16K/8K,雙向介面為 48K/24K/16K/8K
  • 輸出 PCM、OGG_OPUS 或 MP3(接受 WAV,但串流時會回傳多個檔頭)
  • 不支援 SSML

即時語音

語音
TTS 2.0 音色帶有 *_uranus_bigtts 形式的 speaker ID,並在 Voice List 頁面按場景分類列出(General、Entertainment、Education、Dubbing、AudioBook、RolePlay、CustomerService);每個音色可透過 audio_params.emotion 設定情緒,emotion_scale 為 1 至 5(預設 4),speech_rate 與 loudness_rate 範圍為 [-50, 100],post_process.pitch 範圍為 [-12, 12]。
工作階段能力
context_texts 與 section_id 僅 TTS 2.0 支援:一段自然語言指令即可控制語速、情緒、音量與風格(清單中只有第一個值生效,且其文字不計費),section_id 則可把最多 30 輪或 10 分鐘的先前合成串接為歷史上下文。

模型

模態
文字 → 音訊
  • Query-Response 式 TTS,會把問題與回應文字一併理解,相比 TTS 1.0 增加了控制情緒、語氣、語速與音高的文字提示詞、句級情緒標籤與上下文理解。
  • 透過 X-Api-Resource-Id 指定 seed-tts-2.0 選用
  • 在 TTS 2.0 音色上,enable_subtitle 會回傳詞級與音素級時間戳(僅中文與英語)
  • 可選的回應快取保留 1 小時。

依據 ByteDance 官方文件 ↗

關於 BytePlus Seed TTS 2.0

面向 AI 助理、客服中心與影片配音
以平實語言的 prompt 引導情緒、語氣、語速與音高
讀取使用者的 query 與它唸出的回覆文字

Seed TTS 2.0 是字節跳動在 BytePlus 上的當前一代文字轉語音模型,官方概述圍繞一套 query-response 機制構建它:模型會同時讀取使用者的 query 和它即將唸出的回覆文字,BytePlus 稱這擴展了上下文理解,並提升了對話的擬人度與情緒表現力。

  • 官方點名 AI 助理、AI 陪伴、客服中心和影片配音為目標場景。
  • 有三項功能被列為 2.0 相對 1.0 產品線獨有:用平實語言引導情緒、語氣、語速和音高的文字 prompt;句子級的情緒標籤;以及上下文理解,你提供周邊對話,模型會把其情緒色彩帶入合成。
  • 覆蓋十種語言,涵蓋英語、中文、日語、德語、法語、墨西哥西班牙語、印尼語、巴西葡萄牙語、義大利語和韓語,可透過單向串流 HTTP、單向或雙向串流 WebSocket 以及線上 SDK 存取。
  • 音訊預設以 PCM 回傳,也可以是 OGG_OPUS 或 MP3,預設取樣率為 24 kHz,而文件記載 WAV 完全不支援串流。
  • 請求介面很深:從公布的列表中選擇的音色 id、各自在 -50 到 100 區間的語速和音量、僅部分音色接受的情緒設定(強度 1 到 5)、面向中文和英語的可選字級與音素級時間戳,以及針對重複文字的一小時合成快取。
  • 有兩點實務提示:輸入文字目前不支援 SSML;為情緒引導傳入的上下文不計費。
  • 除此之外按字元計費,空格和標點都計入。
  • Synthorai 透過 OpenAI 相容的 /v1/audio/speech 端點,與其語音目錄的其餘成員一同提供它。

常見問題

BytePlus Seed TTS 2.0 API 可以免費試用嗎?

可以,新帳號可獲得 10 次試用呼叫和最高 $1 的免費額度,無需信用卡。以輸入 $30/M 計算,光是這筆額度就足以對 BytePlus Seed TTS 2.0 發出約 8 次 ~4K token 的請求。

BytePlus Seed TTS 2.0 最擅長什麼?

面向 AI 助理、客服中心與影片配音、以平實語言的 prompt 引導情緒、語氣、語速與音高、讀取使用者的 query 與它唸出的回覆文字。完整能力請見「關於」一節,內容取自廠商官方發布說明。

BytePlus Seed TTS 2.0 的價格是多少?

在 Synthorai 上,BytePlus Seed TTS 2.0 輸入 $30/百萬 token、輸出 $0/百萬 token,即廠商牌價,無平台加價。

BytePlus Seed TTS 2.0 支援提示詞快取(prompt caching)嗎?

BytePlus Seed TTS 2.0 目前在 Synthorai 上沒有快取讀取折扣。閘道上的其他模型仍支援提示詞快取,可在價格表中查看支援快取的替代模型。 各廠商快取比較 →

如何開通 BytePlus Seed TTS 2.0?

把現有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 設為 "seed-tts-2.0" 即可。一組 API key 通用閘道上的所有模型。

相關模型

免費取得 API key 算算你的成本 →