🎁 新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

Qwen3 TTS Instruct Flash

Alibaba 語音合成串流輸出
輸入$11.5/M
上下文4K

廠商牌價,無平台加價,按用量計費。 以下為官方 list 價。已登入的使用者可在 /console/pricing 查看含工作空間折扣的實際價格。

30 秒用上 Qwen3 TTS Instruct Flash

OpenAI 相容:換掉 base_url,SDK 不用改。POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="qwen3-tts-instruct-flash",
    messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)

規格與限制

音訊

語言
中文(普通話)、英語、德語、義大利語、葡萄牙語、西班牙語、日語、韓語、法語與俄語。對混合語言或無法判定的輸入,language_type 預設為 Auto,阿里巴巴的文件記載這並不保證準確率;而指定單一語言則被記載為能顯著提升合成品質。與 Qwen3-TTS-Flash 系列不同,Instruct 系列未列出任何中文方言音色(北京話、上海話、四川話、南京話、陝西話、閩南語、天津話、粵語)。
音訊限制
  • HTTP 非即時語音合成 API
  • -realtime 後綴標示的是它的 WebSocket 同門。
  • 輸入文字上限 600 個字元,允許多語言混合輸入。
  • 非串流回傳有效期 24 小時的音訊檔案 URL
  • 串流以分塊回傳 Base64 編碼的 PCM,URL 只出現在最後一個資料包中,官方範例把它以 24 kHz 單聲道 16-bit 音訊播放。
  • 按輸入文字字元計費,回報於 usage.characters(在 Qwen3-TTS-Flash 上 input_tokens 與 output_tokens 恆為 0)
  • 輸出音訊免費。

即時語音

語音
系統音色隨附一行人設說明,其中包括 Cherry(陽光、正向、友善而自然的年輕女性)、Serena、Ethan、Chelsie、Momo、Vivian、Moon、Maia、Kai、Nofish(發不出捲舌音的設計師)、Bella、Eldric Sage、Mia、Mochi、Bellona、Vincent、Bunny、Neil、Elias、Arthur、Nini、Seren、Pip 與 Stella;Qwen-TTS 音色清單為每一個音色標出確切接受它的模型 id。
工作階段能力
  • instructions 以自然語言調控語速、情緒與風格,上限 1,600 個 token,且文件只記載中文與英語
  • optimize_instructions(預設 false)會把指令改寫成更適合合成的指示,instructions 為空時不起作用
  • 音色複製與音色設計在這個模型 id 上都被列為不支援

模型

模態
文字 → 音訊
  • 阿里巴巴 Qwen3-TTS 家族在 Model Studio 上支援指令控制的等級,目前等同於 qwen3-tts-instruct-flash-2026-01-26 快照。
  • 定位於有聲書製作、線上教育配音與內容創作這類可容忍延遲的工作。
  • 於新加坡區定價,在國際部署範圍下為每 10,000 輸入字元 $0.115,另有 110,000 字元的免費額度,自開通 Model Studio 起 90 天內有效。

依據 Alibaba 官方文件 ↗

關於 Qwen3 TTS Instruct Flash

以日常語言下指令控制語速、情緒與風格
面向有聲書與配音的 http 模型,不是即時
十種語言,輸入上限 600 字元

Qwen3-TTS-Instruct-Flash 是阿里巴巴 Qwen3-TTS 家族在 Model Studio 上支援指令控制的等級,於新加坡區定價,目前等同於 qwen3-tts-instruct-flash-2026-01-26 快照。

  • Model Studio 是按傳輸方式而非按能力來劃分這個家族的:帶 realtime 後綴的 id 說的是 WebSocket,而不帶後綴的這一個,則是阿里巴巴所稱的非即時語音合成背後的 HTTP 模型,為有聲書製作、線上教育配音與內容創作這類可容忍延遲的場景而設計。
  • 指令控制正是選它而不選單純的 qwen3-tts-flash 的理由。
  • 你用日常語言描述想要的表達方式,逐次請求地控制語速、情緒與風格,文件記載的範例是以較慢的語速溫柔地說,或使用興奮的播報風格;instructions 欄位最多接受 1,600 個 token,且文件只記載中文與英語,而預設關閉的 optimize_instructions 會讓服務把你的措辭改寫成更適合合成的指示。
  • 音色是這個家族具名的人設,其中 Cherry 是陽光、正向、友善而自然的年輕女性,Nofish 則是一位發不出捲舌音的設計師,音色清單並註明每一個音色由哪些模型 id 接受。
  • 涵蓋十種語言:中文(普通話)、英語、德語、義大利語、葡萄牙語、西班牙語、日語、韓語、法語與俄語,而且與 qwen3-tts-flash 不同,Instruct 產品線不帶任何中文方言音色。
  • 有兩項限制會左右整合:輸入文字上限為 600 個字元;language_type 預設為 Auto,阿里巴巴表示這並不保證準確率,並建議單一語言的文字改為明確指定語言。
  • 非串流會回傳一個有效期 24 小時的音訊檔案 URL,串流則以分塊回傳 Base64 編碼的 PCM,URL 只出現在最後一個資料包中,而官方範例把那段串流以 24 kHz 單聲道 16-bit 音訊播放。
  • 計費計算輸入文字的字元數,在國際部署範圍下為每 10,000 字元 $0.115,輸出音訊免費。
  • Synthorai 透過 OpenAI 相容的 /v1/audio/speech 端點提供它。

常見問題

Qwen3 TTS Instruct Flash API 可以免費試用嗎?

可以,新帳號可獲得 10 次試用呼叫和最高 $1 的免費額度,無需信用卡。以輸入 $11.5/M 計算,光是這筆額度就足以對 Qwen3 TTS Instruct Flash 發出約 21 次 ~4K token 的請求。

Qwen3 TTS Instruct Flash 最擅長什麼?

以日常語言下指令控制語速、情緒與風格、面向有聲書與配音的 http 模型,不是即時、十種語言,輸入上限 600 字元。完整能力請見「關於」一節,內容取自廠商官方發布說明。

Qwen3 TTS Instruct Flash 的價格是多少?

在 Synthorai 上,Qwen3 TTS Instruct Flash 輸入 $11.5/百萬 token、輸出 $0/百萬 token,即廠商牌價,無平台加價。

Qwen3 TTS Instruct Flash 支援提示詞快取(prompt caching)嗎?

Qwen3 TTS Instruct Flash 目前在 Synthorai 上沒有快取讀取折扣。閘道上的其他模型仍支援提示詞快取,可在價格表中查看支援快取的替代模型。 各廠商快取比較 →

如何開通 Qwen3 TTS Instruct Flash?

把現有 OpenAI SDK 的 base_url 指向 "https://synthorai.io/v1",model 設為 "qwen3-tts-instruct-flash" 即可。一組 API key 通用閘道上的所有模型。

相關模型

免費取得 API key 算算你的成本 →