Qwen3-VL Flash は Qwen3-VL 視覚言語シリーズの高速でコスト効率の高いティアで、256K トークンのコンテキストを備えます。
- 入力
- テキスト 画像 動画 $0.05/M
- 出力
- テキスト $0.4/M
- キャッシュ読み取り
- $0.022/M
- コンテキスト
- 256K
- GPT-4o 比
- 約 99%+ 割安
価格の位置づけ
同種 60 モデル中の料金の位置
このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。
スペックと制限
トークン
| コンテキストウィンドウ(ベンダー仕様) | 262,144 |
|---|---|
| 最大出力(ベンダー仕様) | 32,768 |
プロンプトキャッシュ
| キャッシュ方式 | 自動 + 明示 |
|---|---|
| 最小プレフィックス | 1,024 |
| 保持時間 | 明示的モード: 5 分、ヒット時にリセット |
| 書き込みコスト | 1.25x |
思考
| ベンダー側パラメータ | enable_thinking + thinking_budget |
|---|---|
| 指定可能な値 | enable_thinking true · false; thinking_budget in tokens |
| デフォルト | オフ。qwen3-vl-plus および qwen3-vl-flash シリーズでは enable_thinking のデフォルトは false です リクエストで未指定の場合に適用 |
| 無効化の可否 | 対応 |
| 思考の挙動 | トレースは reasoning_content で返ります。バジェットを超えると推論は打ち切られ、モデルはすぐに回答します。preserve_thinking の対象モデルリストには含まれていません。 |
| パラメータ | reasoning_effort |
| 値 | minimal · low · medium · high ゲートウェイ側のパラメータ面——上のベンダーマッピングが適用されます |
モデル
| モダリティ | テキスト + 画像 + 動画 → テキスト |
|---|
- 小型の Qwen3-VL 視覚理解モデル。
- ハイブリッド思考(デフォルトはオフ)。
- 動画入力は最大 1 時間 / 2GB。
- 構造化出力は非思考モードのみ。
30 秒で Qwen3 VL Flash を使う
OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="qwen3-vl-flash",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "qwen3-vl-flash",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-vl-flash",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "qwen3-vl-flash",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("qwen3-vl-flash")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Qwen3 VL Flash について
- 公式の Model Studio ドキュメントによれば、単一および複数画像の入力、動画フレーム分析、画像キャプション生成、視覚的質問応答、2D および 3D の物体位置特定、HTML または Markdown へのドキュメント解析に加え、レシート・証明書・帳票の OCR を扱います。
- ハイブリッド思考モデルであり、回答前に段階的に推論することも、直接応答することもできます。
- 思考は既定で無効で、enable_thinking で切り替え、thinking_budget で上限を設け、トレースは別の reasoning_content フィールドで返ります。
- Alibaba はこれをシリーズの小型モデルと呼び、想定された用途を挙げています。
- セキュリティ監視、店舗や現場の巡回点検、そして撮影した問題の解答です。
- これは、いつ選ぶべきかという問いに対して「安価な Plus」よりも鋭い答えになっています。
- このティアとしては許容量が潤沢で、最大 32,768 出力トークンに加えて大きな別枠の推論許容量があり、動画は最大 1 時間・2 GB まで受け付け、画像ごとの制限は固定の枚数ではなくトークン上限で管理されます。
- 動画は自分で制御するフレーム抽出によってサンプリングされ、フレーム毎秒の設定とフレーム数の上限があり、ファイルの代わりに抽出済みのフレームリストを渡すこともできます。
- ツール呼び出し、バッチ推論、コンテキストキャッシュに対応し、構造化出力は非思考モードで文書化されています。
- ホスト型モデルのウェイトは公開されていませんが、より広い Qwen3-VL ファミリーはオープンです。
- Synthorai は OpenAI 互換エンドポイント経由でマルチモーダルチャット向けに提供します。
よくある質問
Qwen3 VL Flash API は無料で試せますか?
はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。入力 $0.05/M で計算すると、このクレジットだけで Qwen3 VL Flash に対して約 2,500 回の ~8K トークンのリクエストを送れます。
Qwen3 VL Flash は何が得意ですか?
2D および 3D の物体位置特定、HTML または Markdown へのドキュメント解析、ハイブリッド思考、デフォルトで無効。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。
Qwen3 VL Flash の料金はいくらですか?
Synthorai 上の Qwen3 VL Flash は入力 100 万トークンあたり $0.05、出力 100 万トークンあたり $0.4 です。ベンダー定価のままで、プラットフォーム手数料はありません。キャッシュ済み入力トークンは $0.022/M で課金されます。
Qwen3 VL Flash はプロンプトキャッシュに対応していますか?
はい。自動キャッシュがデフォルトで有効なうえ、確実な割引を得られる明示モードもあります。キャッシュ済み入力トークンは $0.022/M(未キャッシュは $0.05/M)で課金されます。なお、キャッシュには 1,024 トークン以上の安定したプレフィックスが必要です(TTL 明示的モード: 5 分、ヒット時にリセット)。 プロンプトキャッシュガイド →
Qwen3 VL Flash を利用するには?
お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="qwen3-vl-flash" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。
関連モデル
比較
このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。