新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

BytePlus Seed TTS 2.0

Seed TTS 2.0 是字節跳動在 BytePlus 上的當前一代文字轉語音模型,官方概述圍繞一套 query-response 機制構建它:模型會同時讀取使用者的 query 和它即將唸出的回覆文字,BytePlus 稱這擴展了上下文理解,並提升了對話的擬人度與情緒表現力。

輸入
文字 $30/M
輸出
音訊
上下文
4K

價格在同類中的位置

價格在 7 個同類模型中的位置

輸入$30/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30

這條線顯示該模型的價格,在 Synthorai 上同類模型裡處於什麼位置。兩端標出了最便宜和最貴的那個。這裡是基礎價,批次、區域與快取寫入的折扣見價格頁。

規格與限制

語音合成

合成語言 英語、中文、日語、德語、法語、墨西哥西班牙語、印尼語、巴西葡萄牙語、義大利語與韓語
語音 TTS 2.0 音色帶有 *_uranus_bigtts 形式的 speaker ID,並在 Voice List 頁面按場景分類列出(General、Entertainment、Education、Dubbing、AudioBook、RolePlay、CustomerService);每個音色可透過 audio_params.emotion 設定情緒,emotion_scale 為 1 至 5(預設 4),speech_rate 與 loudness_rate 範圍為 [-50, 100],post_process.pitch 範圍為 [-12, 12]。
串流合成 支援
SSML 不支援
聲音控制 數值參數與自然語言指令
可接受的控制項 context_texts 與 section_id 僅 TTS 2.0 支援:一段自然語言指令即可控制語速、情緒、音量與風格(清單中只有第一個值生效,且其文字不計費),section_id 則可把最多 30 輪或 10 分鐘的先前合成串接為歷史上下文。
計費單位 按輸入字元計費
端點與格式
  • 可透過單向串流 HTTP、單向或雙向串流 WebSocket 以及線上 SDK 接入
  • 單向串流與非串流介面的取樣率為 24K/16K/8K,雙向介面為 48K/24K/16K/8K
  • 輸出 PCM、OGG_OPUS 或 MP3(接受 WAV,但串流時會回傳多個檔頭)
  • 不支援 SSML

模型

模態 文字 → 音訊
  • Query-Response 式 TTS,會把問題與回應文字一併理解,相比 TTS 1.0 增加了控制情緒、語氣、語速與音高的文字提示詞、句級情緒標籤與上下文理解。
  • 透過 X-Api-Resource-Id 指定 seed-tts-2.0 選用
  • 在 TTS 2.0 音色上,enable_subtitle 會回傳詞級與音素級時間戳(僅中文與英語)
  • 可選的回應快取保留 1 小時。

依據 ByteDance 官方文件 ↗

30 秒用上 BytePlus Seed TTS 2.0

OpenAI 相容:換掉 base_url,SDK 不用改。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="seed-tts-2.0",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

關於 BytePlus Seed TTS 2.0

  • 官方點名 AI 助理、AI 陪伴、客服中心和影片配音為目標場景。
  • 有三項功能被列為 2.0 相對 1.0 產品線獨有:用平實語言引導情緒、語氣、語速和音高的文字 prompt;句子級的情緒標籤;以及上下文理解,你提供周邊對話,模型會把其情緒色彩帶入合成。
  • 覆蓋十種語言,涵蓋英語、中文、日語、德語、法語、墨西哥西班牙語、印尼語、巴西葡萄牙語、義大利語和韓語,可透過單向串流 HTTP、單向或雙向串流 WebSocket 以及線上 SDK 存取。
  • 音訊預設以 PCM 回傳,也可以是 OGG_OPUS 或 MP3,預設取樣率為 24 kHz,而文件記載 WAV 完全不支援串流。
  • 請求介面很深:從公布的列表中選擇的音色 id、各自在 -50 到 100 區間的語速和音量、僅部分音色接受的情緒設定(強度 1 到 5)、面向中文和英語的可選字級與音素級時間戳,以及針對重複文字的一小時合成快取。
  • 有兩點實務提示:輸入文字目前不支援 SSML;為情緒引導傳入的上下文不計費。
  • 除此之外按字元計費,空格和標點都計入。
  • Synthorai 透過 OpenAI 相容的 /v1/audio/speech 端點,與其語音目錄的其餘成員一同提供它。

常見問題

BytePlus Seed TTS 2.0 API 可以免費試用嗎?

可以,新帳號可獲得 10 次試用呼叫和最高 $1 的免費額度,無需信用卡。足以在新增付款方式之前,用真實工作負載試試 BytePlus Seed TTS 2.0。

BytePlus Seed TTS 2.0 最擅長什麼?

面向 AI 助理、客服中心與影片配音、以平實語言的 prompt 引導情緒、語氣、語速與音高、讀取使用者的 query 與它唸出的回覆文字。完整能力請見「關於」一節,內容取自廠商官方發布說明。

BytePlus Seed TTS 2.0 的價格是多少?

在 Synthorai 上,BytePlus Seed TTS 2.0 輸入 $30/百萬 token、輸出 $0/百萬 token,即廠商牌價,無平台加價。

BytePlus Seed TTS 2.0 支援提示詞快取(prompt caching)嗎?

BytePlus Seed TTS 2.0 目前在 Synthorai 上沒有快取讀取折扣。閘道上的其他模型仍支援提示詞快取,可在價格表中查看支援快取的替代模型。 各廠商快取比較 →

如何開通 BytePlus Seed TTS 2.0?

把現有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 設為 "seed-tts-2.0" 即可。一組 API key 通用閘道上的所有模型。

相關模型

對比

本頁每個值都轉錄自廠商自己的文件(連結見上),並帶有核對日期。價格在全目錄範圍內比較;各廠商定義不同的規格值,只說明差異而不作圖表對比。此處沒有任何由我們測量的資料,也不做評分。

取得 API 金鑰 算算你的成本 →