🎁 新人 免费注册,送 10 次调用,最高 $1,免绑卡。

BytePlus Seed TTS 2.0

ByteDance 语音合成流式输出提示词缓存
输入$30/M
上下文4K

厂商牌价,无平台加价,按量付费。 以下为官方 list 价。登录客户可在 /console/pricing 查看含工作空间折扣的实际价格。

30 秒用上 BytePlus Seed TTS 2.0

OpenAI 兼容:换掉 base_url,SDK 不用改。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="seed-tts-2.0",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

规格与限制

音频

语言
英语、中文、日语、德语、法语、墨西哥西班牙语、印尼语、巴西葡萄牙语、意大利语和韩语
音频限制
  • 可通过单向流式 HTTP、单向或双向流式 WebSocket 以及在线 SDK 接入
  • 单向流式和非流式接口的采样率为 24K/16K/8K,双向接口为 48K/24K/16K/8K
  • 输出 PCM、OGG_OPUS 或 MP3(WAV 也被接受,但流式时会返回多个文件头)
  • 不支持 SSML

实时语音

语音
TTS 2.0 音色使用 *_uranus_bigtts 形式的 speaker ID,并在 Voice List 页面按场景(General、Entertainment、Education、Dubbing、AudioBook、RolePlay、CustomerService)列出;每个音色的情绪通过 audio_params.emotion 控制,emotion_scale 取 1 到 5(默认 4),speech_rate 和 loudness_rate 取值区间为 [-50, 100],post_process.pitch 为 [-12, 12]。
会话能力
context_texts 和 section_id 仅 TTS 2.0 支持:一条自然语言指令即可调控语速、情绪、音量和风格(列表中只有第一个值生效,且其文本不计费),section_id 则可把此前最多 30 轮或 10 分钟的合成串联为历史上下文。

模型

模态
文本 → 音频
  • Query-Response 式 TTS,会同时理解 query 与回复文本,相比 TTS 1.0 增加了控制情绪、语气、语速和音高的文本提示、句级情绪标签以及上下文理解
  • 通过 X-Api-Resource-Id seed-tts-2.0 选用
  • 在 TTS 2.0 音色上,enable_subtitle 会返回词级和音素级时间戳(仅中文和英文)
  • 可选的响应缓存保留 1 小时

依据 ByteDance 官方文档 ↗

关于 BytePlus Seed TTS 2.0

瞄准 AI 助手、呼叫中心与视频配音
自然语言 prompt 引导情绪、语气、语速与音高
同时读取用户 query 和要念出的回复文本

Seed TTS 2.0 是字节跳动在 BytePlus 上的当代文本转语音模型,官方概览围绕一套 query-response 机制来介绍它:模型会同时读取用户的 query 和它即将念出的回复文本,字节跳动称这扩展了上下文理解,也让对话的拟人度和情绪表达更加鲜明。

  • 它把 AI 助手、AI 陪伴、呼叫中心和视频配音列为目标场景。
  • 有三项特性被列为 2.0 相对 1.0 线的独有能力:用自然语言引导情绪、语气、语速和音高的文本 prompt;句级情绪标签;以及上下文理解,由你提供周边对话,模型把其中的情绪基调带入合成。
  • 它覆盖十种语言,涵盖英语、中文、日语、德语、法语、墨西哥西班牙语、印尼语、巴西葡萄牙语、意大利语和韩语,可通过单向流式 HTTP、单向或双向流式 WebSocket 以及在线 SDK 访问。
  • 音频默认以 PCM 返回,也可选 OGG_OPUS 或 MP3,默认采样率 24 kHz,而 WAV 在文档中被写明完全不支持流式。
  • 请求面很深:从公布列表中选取的 voice id、各自在 -50 到 100 区间的语速和音量、只有部分音色接受的情绪设置及其 1 到 5 的强度、面向中文和英文的可选词级与音素级时间戳,以及针对重复文本的一小时合成缓存。
  • 两点实务提示:输入文本目前不支持 SSML;用于情绪引导的上下文不计费。
  • 除此之外按字符计费,空格和标点计入。
  • Synthorai 通过 OpenAI 兼容的 /v1/audio/speech 端点提供它,与其语音目录的其余部分并列。

常见问题

BytePlus Seed TTS 2.0 API 可以免费试用吗?

可以。新账号可获得 10 次试用调用和最高 $1 的免费额度,无需绑卡。按输入 $30/M 计算,仅这笔额度就足够对 BytePlus Seed TTS 2.0 发起约 8 次 ~4K token 的请求。

BytePlus Seed TTS 2.0 最擅长什么?

瞄准 AI 助手、呼叫中心与视频配音、自然语言 prompt 引导情绪、语气、语速与音高、同时读取用户 query 和要念出的回复文本。完整能力请见「关于」部分,内容取自厂商官方发布说明。

BytePlus Seed TTS 2.0 的价格是多少?

在 Synthorai 上,BytePlus Seed TTS 2.0 输入 $30/百万 token、输出 $0/百万 token,即厂商牌价,无平台加价。

BytePlus Seed TTS 2.0 支持提示词缓存(prompt caching)吗?

BytePlus Seed TTS 2.0 目前在 Synthorai 上没有缓存读取折扣。网关上的其他模型仍支持提示词缓存,可在价格表中查看支持缓存的替代模型。 各厂商缓存对比 →

如何开通 BytePlus Seed TTS 2.0?

把现有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 设为 "seed-tts-2.0" 即可。一把 API key 通用网关上的全部模型。

相关模型

免费获取 API key 算算你的成本 →