新人 免费注册,送 10 次调用,最高 $1,免绑卡。

Qwen3 TTS Instruct Flash

Qwen3-TTS-Instruct-Flash 是阿里巴巴 Qwen3-TTS 系列在 Model Studio 上支持指令控制的档位,按新加坡区定价,当前等同于 qwen3-tts-instruct-flash-2026-01-26 快照。

输入
文本 $11.5/M
输出
音频
上下文
4K

价格在同类中的位置

价格在 7 个同类模型中的位置

输入$11.5/M
$4 · Google TTS Standard Google TTS Chirp 3 HD · $30

这条线显示该模型的价格,在 Synthorai 上同类模型里处于什么位置。两端标出了最便宜和最贵的那个。这里是基础价,批量、区域和缓存写入的折扣见价格页。

规格与限制

语音合成

合成语言 中文(普通话)、英语、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语和俄语。对于混合语种或无法确定的输入,language_type 默认为 Auto,阿里文档说明该模式不保证准确率;而指明单一语言则被记载为可显著提升合成质量。与 Qwen3-TTS-Flash 系列不同,Instruct 系列没有列出任何中文方言音色(北京话、上海话、四川话、南京话、陕西话、闽南语、天津话、粤语)。
语音 系统音色均附有一句话人设,其中包括 Cherry(阳光、积极、友善而自然的年轻女性)、Serena、Ethan、Chelsie、Momo、Vivian、Moon、Maia、Kai、Nofish(一位发不出卷舌音的设计师)、Bella、Eldric Sage、Mia、Mochi、Bellona、Vincent、Bunny、Neil、Elias、Arthur、Nini、Seren、Pip 和 Stella;Qwen-TTS 音色列表为每个音色标明了可接受它的具体模型 id。
输入上限 600 字符 各厂商公布该上限所用的单位不同:对非拉丁文本而言,字节上限不等于字符上限。
流式合成 支持
SSML 文档未说明
声音控制 自然语言指令
可接受的控制项
  • instructions 用自然语言调控语速、情绪和风格,最多 1,600 token,且文档只覆盖中文和英文
  • optimize_instructions(默认 false)会把指令改写成更适合合成的形式,instructions 为空时不起作用
  • 声音复刻和音色设计在该模型 id 上均列为不支持
计费单位 按输入字符计费
端点与格式
  • HTTP 非实时语音合成 API
  • 带 -realtime 后缀的是它的 WebSocket 同胞
  • 输入文本上限 600 字符,允许多语种混合输入
  • 非流式返回一个有效期 24 小时的音频文件 URL
  • 流式分块返回 Base64 编码的 PCM,URL 只在最后一个数据包中给出,官方示例按 24 kHz 单声道 16 位音频播放
  • 按输入文本字符计费,以 usage.characters 上报(在 Qwen3-TTS 系列上 input_tokens 和 output_tokens 始终为 0)
  • 输出音频免费

模型

模态 文本 → 音频
  • 阿里巴巴 Qwen3-TTS 系列在 Model Studio 上支持指令控制的档位,当前等同于 qwen3-tts-instruct-flash-2026-01-26 快照。
  • 定位于能容忍延迟的工作,例如有声书制作、在线教育配音和内容创作。
  • 按新加坡区定价,国际部署范围内每 10,000 输入字符 $0.115,开通 Model Studio 后另有 110,000 字符的免费额度,有效期 90 天。

依据 Alibaba 官方文档 ↗

30 秒用上 Qwen3 TTS Instruct Flash

OpenAI 兼容:换掉 base_url,SDK 不用改。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3-tts-instruct-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

关于 Qwen3 TTS Instruct Flash

  • Model Studio 对这一系列的划分依据是传输方式而非能力:带 realtime 后缀的 id 走 WebSocket,而不带该后缀的这一个,则是阿里所称非实时语音合成背后的 HTTP 模型,专为能容忍延迟的场景设计,例如有声书制作、在线教育配音和内容创作。
  • 选它而不选普通 qwen3-tts-flash 的理由正是指令控制。
  • 你用日常语言描述想要的表达方式,逐次请求地控制语速、情绪和风格,文档给出的示例是以较慢的语速轻柔地说,或采用兴奋的播报风格;instructions 字段最多接受 1,600 token,且文档只覆盖中文和英文,而默认关闭的 optimize_instructions 会让服务把你的措辞改写成更适合合成的指令。
  • 音色是这一系列的具名人设,其中 Cherry 是阳光、积极、友善而自然的年轻女性,Nofish 则是一位发不出卷舌音的设计师;音色列表还写明每个音色可被哪些模型 id 使用。
  • 共覆盖十种语言:中文(普通话)、英语、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语和俄语;与 qwen3-tts-flash 不同,Instruct 线不含任何中文方言音色。
  • 有两处限制会影响接入:输入文本上限为 600 字符;language_type 默认为 Auto,阿里表示该模式不保证准确率,建议单一语种文本改用明确的语言设置。
  • 非流式返回一个有效期 24 小时的音频文件 URL,流式则分块返回 Base64 编码的 PCM,URL 只在最后一个数据包中给出,官方示例按 24 kHz 单声道 16 位音频播放该数据流。
  • 计费按输入文本字符数计算,国际部署范围内为每 10,000 字符 $0.115,输出音频免费。
  • Synthorai 通过 OpenAI 兼容的 /v1/audio/speech 端点提供该模型。

常见问题

Qwen3 TTS Instruct Flash API 可以免费试用吗?

可以。新账号可获得 10 次试用调用和最高 $1 的免费额度,无需绑卡。足够在添加付款方式之前,用真实工作负载试一试 Qwen3 TTS Instruct Flash。

Qwen3 TTS Instruct Flash 最擅长什么?

用日常语言的指令控制语速、情绪与风格、面向有声书与配音的 http 模型,而非实时、十种语言,输入上限 600 字符。完整能力请见「关于」部分,内容取自厂商官方发布说明。

Qwen3 TTS Instruct Flash 的价格是多少?

在 Synthorai 上,Qwen3 TTS Instruct Flash 输入 $11.5/百万 token、输出 $0/百万 token,即厂商牌价,无平台加价。

Qwen3 TTS Instruct Flash 支持提示词缓存(prompt caching)吗?

Qwen3 TTS Instruct Flash 目前在 Synthorai 上没有缓存读取折扣。网关上的其他模型仍支持提示词缓存,可在价格表中查看支持缓存的替代模型。 各厂商缓存对比 →

如何开通 Qwen3 TTS Instruct Flash?

把现有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 设为 "qwen3-tts-instruct-flash" 即可。一把 API key 通用网关上的全部模型。

相关模型

对比

本页每个值都转录自厂商自己的文档(链接见上),并带有核对日期。价格在全目录范围内比较;各厂商定义不同的规格值,只说明差异而不作图表对比。此处没有任何由我们测量的数据,也不做评分。

获取 API 密钥 算算你的成本 →