🎁 新人 免费注册,送 10 次调用,最高 $1,免绑卡。

Qwen3 TTS Instruct Flash

Alibaba 语音合成流式输出
输入$11.5/M
上下文4K

厂商牌价,无平台加价,按量付费。 以下为官方 list 价。登录客户可在 /console/pricing 查看含工作空间折扣的实际价格。

30 秒用上 Qwen3 TTS Instruct Flash

OpenAI 兼容:换掉 base_url,SDK 不用改。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3-tts-instruct-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

规格与限制

音频

语言
中文(普通话)、英语、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语和俄语。对于混合语种或无法确定的输入,language_type 默认为 Auto,阿里文档说明该模式不保证准确率;而指明单一语言则被记载为可显著提升合成质量。与 Qwen3-TTS-Flash 系列不同,Instruct 系列没有列出任何中文方言音色(北京话、上海话、四川话、南京话、陕西话、闽南语、天津话、粤语)。
音频限制
  • HTTP 非实时语音合成 API
  • 带 -realtime 后缀的是它的 WebSocket 同胞
  • 输入文本上限 600 字符,允许多语种混合输入
  • 非流式返回一个有效期 24 小时的音频文件 URL
  • 流式分块返回 Base64 编码的 PCM,URL 只在最后一个数据包中给出,官方示例按 24 kHz 单声道 16 位音频播放
  • 按输入文本字符计费,以 usage.characters 上报(在 Qwen3-TTS 系列上 input_tokens 和 output_tokens 始终为 0)
  • 输出音频免费

实时语音

语音
系统音色均附有一句话人设,其中包括 Cherry(阳光、积极、友善而自然的年轻女性)、Serena、Ethan、Chelsie、Momo、Vivian、Moon、Maia、Kai、Nofish(一位发不出卷舌音的设计师)、Bella、Eldric Sage、Mia、Mochi、Bellona、Vincent、Bunny、Neil、Elias、Arthur、Nini、Seren、Pip 和 Stella;Qwen-TTS 音色列表为每个音色标明了可接受它的具体模型 id。
会话能力
  • instructions 用自然语言调控语速、情绪和风格,最多 1,600 token,且文档只覆盖中文和英文
  • optimize_instructions(默认 false)会把指令改写成更适合合成的形式,instructions 为空时不起作用
  • 声音复刻和音色设计在该模型 id 上均列为不支持

模型

模态
文本 → 音频
  • 阿里巴巴 Qwen3-TTS 系列在 Model Studio 上支持指令控制的档位,当前等同于 qwen3-tts-instruct-flash-2026-01-26 快照。
  • 定位于能容忍延迟的工作,例如有声书制作、在线教育配音和内容创作。
  • 按新加坡区定价,国际部署范围内每 10,000 输入字符 $0.115,开通 Model Studio 后另有 110,000 字符的免费额度,有效期 90 天。

依据 Alibaba 官方文档 ↗

关于 Qwen3 TTS Instruct Flash

用日常语言的指令控制语速、情绪与风格
面向有声书与配音的 http 模型,而非实时
十种语言,输入上限 600 字符

Qwen3-TTS-Instruct-Flash 是阿里巴巴 Qwen3-TTS 系列在 Model Studio 上支持指令控制的档位,按新加坡区定价,当前等同于 qwen3-tts-instruct-flash-2026-01-26 快照。

  • Model Studio 对这一系列的划分依据是传输方式而非能力:带 realtime 后缀的 id 走 WebSocket,而不带该后缀的这一个,则是阿里所称非实时语音合成背后的 HTTP 模型,专为能容忍延迟的场景设计,例如有声书制作、在线教育配音和内容创作。
  • 选它而不选普通 qwen3-tts-flash 的理由正是指令控制。
  • 你用日常语言描述想要的表达方式,逐次请求地控制语速、情绪和风格,文档给出的示例是以较慢的语速轻柔地说,或采用兴奋的播报风格;instructions 字段最多接受 1,600 token,且文档只覆盖中文和英文,而默认关闭的 optimize_instructions 会让服务把你的措辞改写成更适合合成的指令。
  • 音色是这一系列的具名人设,其中 Cherry 是阳光、积极、友善而自然的年轻女性,Nofish 则是一位发不出卷舌音的设计师;音色列表还写明每个音色可被哪些模型 id 使用。
  • 共覆盖十种语言:中文(普通话)、英语、德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语和俄语;与 qwen3-tts-flash 不同,Instruct 线不含任何中文方言音色。
  • 有两处限制会影响接入:输入文本上限为 600 字符;language_type 默认为 Auto,阿里表示该模式不保证准确率,建议单一语种文本改用明确的语言设置。
  • 非流式返回一个有效期 24 小时的音频文件 URL,流式则分块返回 Base64 编码的 PCM,URL 只在最后一个数据包中给出,官方示例按 24 kHz 单声道 16 位音频播放该数据流。
  • 计费按输入文本字符数计算,国际部署范围内为每 10,000 字符 $0.115,输出音频免费。
  • Synthorai 通过 OpenAI 兼容的 /v1/audio/speech 端点提供该模型。

常见问题

Qwen3 TTS Instruct Flash API 可以免费试用吗?

可以。新账号可获得 10 次试用调用和最高 $1 的免费额度,无需绑卡。按输入 $11.5/M 计算,仅这笔额度就足够对 Qwen3 TTS Instruct Flash 发起约 21 次 ~4K token 的请求。

Qwen3 TTS Instruct Flash 最擅长什么?

用日常语言的指令控制语速、情绪与风格、面向有声书与配音的 http 模型,而非实时、十种语言,输入上限 600 字符。完整能力请见「关于」部分,内容取自厂商官方发布说明。

Qwen3 TTS Instruct Flash 的价格是多少?

在 Synthorai 上,Qwen3 TTS Instruct Flash 输入 $11.5/百万 token、输出 $0/百万 token,即厂商牌价,无平台加价。

Qwen3 TTS Instruct Flash 支持提示词缓存(prompt caching)吗?

Qwen3 TTS Instruct Flash 目前在 Synthorai 上没有缓存读取折扣。网关上的其他模型仍支持提示词缓存,可在价格表中查看支持缓存的替代模型。 各厂商缓存对比 →

如何开通 Qwen3 TTS Instruct Flash?

把现有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 设为 "qwen3-tts-instruct-flash" 即可。一把 API key 通用网关上的全部模型。

相关模型

免费获取 API key 算算你的成本 →