新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

Qwen3-ASR Flash Realtime

2025-10-27 リリース

transcription

Qwen3-ASR Flash Realtime は Qwen3-ASR Flash のストリーミング版です。

入力
音声
出力
テキスト
価格
$0.002/min

価格の位置づけ

同種 11 モデル中の料金の位置

1 分あたり$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。

スペックと制限

音声

言語 26 言語で、すべての Qwen-ASR モデルで共通のリスト:中国語(標準中国語、四川語、閩南語、呉語、広東語)、英語、日本語、ドイツ語、韓国語、ロシア語、フランス語、ポルトガル語、アラビア語、イタリア語、スペイン語、ヒンディー語、インドネシア語、タイ語、トルコ語、ウクライナ語、ベトナム語、チェコ語、デンマーク語、フィリピン語、フィンランド語、アイスランド語、マレー語、ノルウェー語、ポーランド語、スウェーデン語
音声の制限
  • WebSocket によるリアルタイムストリーミング(pcm/opus、8/16 kHz)で、時間制限なし。
  • VAD または手動でのターン制御。
  • 常時オンの 7 クラス感情認識。
  • 自動言語検出。
話者分離 非対応
ストリーミング文字起こし 対応
タイムスタンプ 非対応

モデル

モダリティ 音声 → テキスト

このリアルタイムバリアントではタイムスタンプ、ホットワード、話者ダイアライゼーションは利用できません。

出典:Alibaba 公式ドキュメント ↗

30 秒で Qwen3-ASR Flash Realtime を使う

OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="qwen3-asr-flash-realtime",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Qwen3-ASR Flash Realtime について

  • 音声は WebSocket 接続経由で送信され、文字起こしが継続的に返り、長時間セッションのためにストリーム時間は無制限です。
  • バッチ版の主要な能力を維持しており、文字起こしと同時の感情検出、そして 5 つの中国語変種から英語、日本語、韓国語、多くのヨーロッパおよび東南アジアの言語に至るおよそ 30 言語の認識を含みます。
  • ライブ字幕や音声対話型のアプリケーションに適しています。
  • ファイルベースの兄弟モデルとの違いが 2 つあり、その上での作り方を左右します。
  • 第一に、ターンの区切りが他のストリーミングモデルにはない形で設定可能です。
  • 音声区間検出モードは調整可能な無音しきい値を用いて発話を自動的に分割し、一方の手動モードは音声バッファを自分でコミットすることで文の境界をクライアント側に委ねます。
  • ただし手動で駆動する区間は蓄積音声で約 1 分以内に収める必要があると文書化されています。
  • 第二に、この版は現在タイムスタンプを返さないとドキュメントは明記しているため、単語や文の時間情報が必要ならオフラインのモデルを選ぶことになります。
  • 感情認識は同じ 7 つの状態で常時オンのまま、言語検出も自動のままで、ホットワードリストも話者ダイアライゼーションも非対応です。
  • Synthorai を通じて、このモデルは標準の OpenAI 互換 API 経由で到達できます。

よくある質問

Qwen3-ASR Flash Realtime API は無料で試せますか?

はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで Qwen3-ASR Flash Realtime を試すには十分な量です。

Qwen3-ASR Flash Realtime は何が得意ですか?

WebSocket 経由で無制限のストリーム長、ストリーミング中も感情検出を維持、ライブ字幕と音声対話に適合。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。

Qwen3-ASR Flash Realtime の料金はいくらですか?

Synthorai 上の Qwen3-ASR Flash Realtime は文字起こしする音声 1 分あたり $0.002 です。従量課金でプラットフォーム手数料なし、サブスクリプションも不要です。

Qwen3-ASR Flash Realtime はどの言語に対応していますか?

Qwen3-ASR Flash Realtime は 26 言語で、すべての Qwen-ASR モデルで共通のリスト:中国語(標準中国語、四川語、閩南語、呉語、広東語)、英語、日本語、ドイツ語、韓国語、ロシア語、フランス語、ポルトガル語、アラビア語、イタリア語、スペイン語、ヒンディー語、インドネシア語、タイ語、トルコ語、ウクライナ語、ベトナム語、チェコ語、デンマーク語、フィリピン語、フィンランド語、アイスランド語、マレー語、ノルウェー語、ポーランド語、スウェーデン語 に対応しています。Synthorai では POST /v1/audio/transcriptions で呼び出せます。OpenAI 文字起こし API と同じ形式です。

Qwen3-ASR Flash Realtime を利用するには?

お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="qwen3-asr-flash-realtime" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。

関連モデル

比較

このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。

API キーを取得 コストを比較する →