新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

Qwen3-ASR Flash

2025-09-08 リリース

transcription

Qwen3-ASR Flash は Qwen3 ラインの音声認識モデルで、最大 10 MB・5 分の音声ファイルを文字起こしし、リアルタイムの進捗フィードバックのために中間結果をストリーミングします。

入力
音声
出力
テキスト
価格
$0.0021/min

価格の位置づけ

同種 11 モデル中の料金の位置

1 分あたり$0.0021/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。

スペックと制限

音声

言語 26 言語で、すべての Qwen-ASR モデルで共通のリスト:中国語(標準中国語、四川語、閩南語、呉語、広東語)、英語、日本語、ドイツ語、韓国語、ロシア語、フランス語、ポルトガル語、アラビア語、イタリア語、スペイン語、ヒンディー語、インドネシア語、タイ語、トルコ語、ウクライナ語、ベトナム語、チェコ語、デンマーク語、フィリピン語、フィンランド語、アイスランド語、マレー語、ノルウェー語、ポーランド語、スウェーデン語
音声の制限
  • 同期認識は 10MB 以下 / 5 分以下で、ストリーミングまたは非ストリーミングの出力。
  • 26 言語にわたる自動言語判定。
  • コンテキストテキストの注入。
  • 歌唱認識。
  • 話者ダイアライゼーションは非対応。
  • OpenAI 互換のレスポンスにタイムスタンプのフィールドは含まれません(必要な場合は qwen3-asr-flash-filetrans を使用してください)。
話者分離 非対応
ストリーミング文字起こし 対応
タイムスタンプ 非対応

モデル

モダリティ 音声 → テキスト
  • Qwen3-Omni をベースに構築。
  • 提供される flash API モデルはプロプライエタリです(オープンな Qwen3-ASR 0.6B/1.7B は別のモデルです)。

出典:Alibaba 公式ドキュメント ↗

30 秒で Qwen3-ASR Flash を使う

OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="qwen3-asr-flash",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Qwen3-ASR Flash について

  • 公式ドキュメントは、5 つの中国語変種(標準中国語、四川語、閩南語、呉語、広東語)を含むおよそ 30 言語の認識と、Fun-ASR の兄弟モデルにはない能力である、文字起こしと同時の感情検出を強調しています。
  • Qwen3-ASR シリーズは、音楽や歌唱が混ざった音声の堅牢な認識でも知られています。
  • 感情ラベル付けは常時オンで、7 つの状態(驚き、中立、喜び、悲しみ、嫌悪、怒り、恐れ)のいずれかを返します。
  • 言語を未設定のままにすると、言語が混在する音声も含めて言語検出は自動になります。
  • 専門用語に対する精度の誘導は Fun-ASR ファミリーとは異なる方式です。
  • ホットワードリストをアップロードするのではなく、リクエストとともにコンテキストテキストを注入するため、呼び出しごとに変わる語彙に適しています。
  • 単語レベルのタイムスタンプは文書化された一部の言語で有効にでき、逆テキスト正規化は利用できますが既定ではオフです。
  • 音声は幅広いコンテナとコーデックの形式で受け付けられ、モデルは OpenAI 互換の経路と Alibaba 独自の同期インターフェースの両方から到達できます。
  • 話者ダイアライゼーションは提供されず、5 分の上限は厳格です。
  • Alibaba はより長い録音を別のファイル文字起こしモデルに振り向けています。
  • Synthorai は OpenAI 互換の文字起こしエンドポイント経由で提供します。

よくある質問

Qwen3-ASR Flash API は無料で試せますか?

はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで Qwen3-ASR Flash を試すには十分な量です。

Qwen3-ASR Flash は何が得意ですか?

文字起こしと同時に感情を検出、約 30 言語、5 つの中国語変種、音楽が混ざった音声に堅牢。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。

Qwen3-ASR Flash の料金はいくらですか?

Synthorai 上の Qwen3-ASR Flash は文字起こしする音声 1 分あたり $0.0021 です。従量課金でプラットフォーム手数料なし、サブスクリプションも不要です。

Qwen3-ASR Flash はどの言語に対応していますか?

Qwen3-ASR Flash は 26 言語で、すべての Qwen-ASR モデルで共通のリスト:中国語(標準中国語、四川語、閩南語、呉語、広東語)、英語、日本語、ドイツ語、韓国語、ロシア語、フランス語、ポルトガル語、アラビア語、イタリア語、スペイン語、ヒンディー語、インドネシア語、タイ語、トルコ語、ウクライナ語、ベトナム語、チェコ語、デンマーク語、フィリピン語、フィンランド語、アイスランド語、マレー語、ノルウェー語、ポーランド語、スウェーデン語 に対応しています。Synthorai では POST /v1/audio/transcriptions で呼び出せます。OpenAI 文字起こし API と同じ形式です。

Qwen3-ASR Flash を利用するには?

お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="qwen3-asr-flash" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。

関連モデル

比較

このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。

API キーを取得 コストを比較する →