Qwen3-TTS-Instruct-Flash は Model Studio 上の Alibaba の Qwen3-TTS ファミリーにおける指示制御ティアで、シンガポールリージョンで価格が設定され、現在は qwen3-tts-instruct-flash-2026-01-26 スナップショットと等価です。
- 入力
- テキスト $11.5/M
- 出力
- 音声
- コンテキスト
- 4K
価格の位置づけ
同種 7 モデル中の料金の位置
このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。
スペックと制限
音声合成
| 合成対応言語 | 中国語(標準語)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語。language_type は混在言語または未確定の入力に対して既定で Auto となりますが、Alibaba はこれを精度を保証しないものとして文書化しています。単一の言語を指定すると合成品質が大幅に向上すると記載されています。Qwen3-TTS-Flash シリーズとは異なり、Instruct シリーズは中国語の方言ボイス(北京、上海、四川、南京、陝西、閩南、天津、広東)を掲載していません。 |
|---|---|
| ボイス | 1 行のペルソナ付きで公開されているシステムボイス。Cherry(明るく前向きで親しみやすい自然な若い女性)、Serena、Ethan、Chelsie、Momo、Vivian、Moon、Maia、Kai、Nofish(そり舌音を発音できないデザイナー)、Bella、Eldric Sage、Mia、Mochi、Bellona、Vincent、Bunny、Neil、Elias、Arthur、Nini、Seren、Pip、Stella などがあります。Qwen-TTS のボイスリストは、各ボイスをそれを受け付ける正確なモデル id と対応づけています。 |
| 入力上限 | 600 文字 この上限を公開する単位はベンダーごとに異なります。非ラテン文字では、バイト上限は文字数上限と一致しません。 |
| ストリーミング合成 | 対応 |
| SSML | ドキュメントに記載なし |
| 音声コントロール | 自然言語による指示 |
| 指定できる項目 |
|
| 課金単位 | 入力文字数あたり |
| エンドポイントと形式 |
|
モデル
| モダリティ | テキスト → 音声 |
|---|
- Model Studio 上の Alibaba の Qwen3-TTS ファミリーにおける指示制御ティアで、現在は qwen3-tts-instruct-flash-2026-01-26 スナップショットと等価。
- オーディオブック制作、オンライン教育のナレーション、コンテンツ制作といったレイテンシに寛容な作業向けに位置づけられています。
- 価格はシンガポールリージョンで設定され、国際デプロイスコープでは入力 10,000 文字あたり $0.115、Model Studio の有効化後 90 日間有効な 110,000 文字の無料枠が付きます。
30 秒で Qwen3 TTS Instruct Flash を使う
OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3-tts-instruct-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3-tts-instruct-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-tts-instruct-flash",
"messages": [{"role": "user", "content": "Hello"}]
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3-tts-instruct-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3-tts-instruct-flash")
.addUserMessage("Summarize this diff")
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Qwen3 TTS Instruct Flash について
- Model Studio はこのファミリーを能力ではなくトランスポートで分けています。
- realtime サフィックスを持つ id は WebSocket で通信し、それを持たないこちらは Alibaba が非リアルタイム音声合成と呼ぶものの背後にある HTTP モデルで、オーディオブック制作、オンライン教育のナレーション、コンテンツ制作といったレイテンシに寛容なシナリオ向けに設計されています。
- 素の qwen3-tts-flash ではなくこちらに手を伸ばす理由は指示制御です。
- 望む話し方を普通の言葉で記述してリクエストごとに速度、感情、スタイルを制御でき、文書化されている例は、ゆっくりとした調子で穏やかに話すこと、そして興奮した放送スタイルを使うことです。
- instructions フィールドは最大 1,600 トークンを受け取り、中国語と英語についてのみ文書化されており、既定でオフの optimize_instructions は、記述した文言を合成により適した指示文へサービス側に書き換えさせます。
- ボイスはこのファミリーの名前付きペルソナで、その中には明るく前向きで親しみやすい自然な若い女性としての Cherry や、そり舌音を発音できないデザイナーとしての Nofish が含まれ、ボイスリストにはそれぞれをどのモデル id が受け付けるかが記載されています。
- 対応言語は中国語(標準語)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語の 10 種類で、qwen3-tts-flash とは異なり Instruct 系列は中国語の方言ボイスを一切持ちません。
- 統合を左右する制限が 2 つあります。
- 入力テキストは 600 文字が上限であること、そして language_type の既定が Auto であることです。
- Alibaba は Auto では精度を保証しないとしており、単一言語のテキストでは明示的な言語に置き換えることを推奨しています。
- 非ストリーミングでは 24 時間有効な音声ファイルの URL が返り、ストリーミングでは Base64 エンコードされた PCM がチャンクで返って URL は最終パケットにのみ含まれ、公式サンプルはそのストリームを 24 kHz モノラル 16-bit オーディオとして再生します。
- 課金は入力テキストの文字数を数え、国際デプロイスコープでは 10,000 文字あたり $0.115、出力音声は無料です。
- Synthorai は OpenAI 互換の /v1/audio/speech エンドポイント経由でこれを提供します。
よくある質問
Qwen3 TTS Instruct Flash API は無料で試せますか?
はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで Qwen3 TTS Instruct Flash を試すには十分な量です。
Qwen3 TTS Instruct Flash は何が得意ですか?
平易な言葉の指示で速度、感情、スタイルを制御、リアルタイムではなくオーディオブックとナレーション向けの HTTP モデル、10 言語、入力は 600 文字が上限。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。
Qwen3 TTS Instruct Flash の料金はいくらですか?
Synthorai 上の Qwen3 TTS Instruct Flash は入力 100 万トークンあたり $11.5、出力 100 万トークンあたり $0 です。ベンダー定価のままで、プラットフォーム手数料はありません。
Qwen3 TTS Instruct Flash はプロンプトキャッシュに対応していますか?
Qwen3 TTS Instruct Flash には現在 Synthorai 上でキャッシュ読み取り割引がありません。ゲートウェイ上の他のモデルではプロンプトキャッシュが引き続き利用できます。キャッシュ対応の代替モデルは料金表をご覧ください。 プロバイダー別キャッシュ比較 →
Qwen3 TTS Instruct Flash を利用するには?
お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="qwen3-tts-instruct-flash" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。
関連モデル
比較
このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。