新人 免费注册,送 10 次调用,最高 $1,免绑卡。

TTS-1 HD

TTS-1 HD 是 OpenAI 为质量优化的文本转语音模型,是它与 tts-1 组成的一对中保真度更高的一半。

输入
文本 $30/M
输出
音频
上下文
4K

价格在同类中的位置

价格在 7 个同类模型中的位置

输入$30/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30

这条线显示该模型的价格,在 Synthorai 上同类模型里处于什么位置。两端标出了最便宜和最贵的那个。这里是基础价,批量、区域和缓存写入的折扣见价格页。

规格与限制

语音合成

合成语言 大体沿用 Whisper 模型的语言支持:南非荷兰语、阿拉伯语、亚美尼亚语、阿塞拜疆语、白俄罗斯语、波斯尼亚语、保加利亚语、加泰罗尼亚语、中文、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、芬兰语、法语、加利西亚语、德语、希腊语、希伯来语、印地语、匈牙利语、冰岛语、印尼语、意大利语、日语、卡纳达语、哈萨克语、韩语、拉脱维亚语、立陶宛语、马其顿语、马来语、马拉地语、毛利语、尼泊尔语、挪威语、波斯语、波兰语、葡萄牙语、罗马尼亚语、俄语、塞尔维亚语、斯洛伐克语、斯洛文尼亚语、西班牙语、斯瓦希里语、瑞典语、他加禄语、泰米尔语、泰语、土耳其语、乌克兰语、乌尔都语、越南语和威尔士语,尽管音色是针对英语优化的
语音 alloy、ash、coral、echo、fable、onyx、nova、sage 和 shimmer,比完整的 13 个 TTS 音色列表要少,且这些音色目前是针对英语优化的。
输入上限 4,096 字符 各厂商公布该上限所用的单位不同:对非拉丁文本而言,字节上限不等于字符上限。
流式合成 支持
SSML 文档未说明
声音控制 该模型不支持
计费单位 按输入字符计费
端点与格式
  • 仅支持语音生成端点(v1/audio/speech),Chat Completions、Responses、Realtime、Batch 和微调均列为不支持
  • 输入文本上限 4096 个字符
  • 输出 mp3(默认)、opus、aac、flac、wav 或 pcm(原始 24 kHz 16-bit 有符号小端采样)
  • 通过分块传输编码实现实时播放

模型

模态 文本 → 音频
  • 为质量优化的文本转语音模型:与 tts-1 使用相同的 Speech 端点,面向高质量而非低延迟场景调优。
  • 在 gpt-4o-mini-tts 上用于调控口音、情绪、语调和语气的 instructions 参数,对 tts-1 和 tts-1-hd 无效。

依据 OpenAI 官方文档 ↗

30 秒用上 TTS-1 HD

OpenAI 兼容:换掉 base_url,SDK 不用改。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="tts-1-hd",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

关于 TTS-1 HD

  • 模型页把它描述为把文本转换为听起来自然的口语文本,面向高质量文本转语音场景,而指南直接点出取舍:tts-1 提供更低的延迟,但质量低于 tts-1-hd。
  • 多出来的那部分质量就是全部差别,价格也相应定为每百万字符 $30,是 tts-1 费率的两倍,这使它适合旁白、已发布的音频,以及任何听众会反复听到的内容,而不是逐轮交互的语音。
  • 其余一切与同门共享。
  • 它仅服务 Audio API 的 speech 端点,接受文本输入并返回音频,拥有同样的九种音色(alloy、ash、coral、echo、fable、onyx、nova、sage 和 shimmer)、同样的 MP3、Opus、AAC、FLAC、WAV 和 24 kHz PCM 输出格式、同样的 0.25 到 4.0 语速范围(默认 1.0),以及同样的分块传输流式返回,因此播放可以提前开始。
  • 同样的两项限制也适用:用于引导语气和表达方式的 instructions 参数在文档中被记为在 tts-1 和 tts-1-hd 上不起作用,sse 流式格式不受支持,只剩原始音频流这一个选项。
  • 语言覆盖沿用 Whisper 的列表,而音色仍是针对英语优化的,OpenAI 要求明确告知该语音由 AI 生成。
  • Synthorai 通过同一个 OpenAI 兼容的 /v1/audio/speech 端点提供 TTS-1 HD。

常见问题

TTS-1 HD API 可以免费试用吗?

可以。新账号可获得 10 次试用调用和最高 $1 的免费额度,无需绑卡。足够在添加付款方式之前,用真实工作负载试一试 TTS-1 HD。

TTS-1 HD 最擅长什么?

为质量而非延迟优化、每百万字符 $30,是 tts-1 费率的两倍、适合旁白与发布用音频,而非交互式语音。完整能力请见「关于」部分,内容取自厂商官方发布说明。

TTS-1 HD 的价格是多少?

在 Synthorai 上,TTS-1 HD 输入 $30/百万 token、输出 $0/百万 token,即厂商牌价,无平台加价。

TTS-1 HD 支持提示词缓存(prompt caching)吗?

TTS-1 HD 目前在 Synthorai 上没有缓存读取折扣。网关上的其他模型仍支持提示词缓存,可在价格表中查看支持缓存的替代模型。 各厂商缓存对比 →

如何开通 TTS-1 HD?

把现有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 设为 "tts-1-hd" 即可。一把 API key 通用网关上的全部模型。

相关模型

对比

本页每个值都转录自厂商自己的文档(链接见上),并带有核对日期。价格在全目录范围内比较;各厂商定义不同的规格值,只说明差异而不作图表对比。此处没有任何由我们测量的数据,也不做评分。

获取 API 密钥 算算你的成本 →