新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

Paraformer Realtime v2

transcription

Paraformer-Realtime-v2 は Alibaba Cloud の前世代のリアルタイム音声認識モデルで、双方向接続経由で音声を入力し文字起こしを出力します。

入力
音声
出力
テキスト
価格
$0.002/min

価格の位置づけ

同種 11 モデル中の料金の位置

1 分あたり$0.002/min
$0.002 · Fun-ASR Realtime Chirp 2 · $0.016

このバーは、Synthorai 上の同種モデルの中でこのモデルの価格がどこに位置するかを示します。両端には最も安いモデルと最も高いモデルの名前が入ります。表示は基本料金で、バッチ・リージョン・キャッシュ書き込みの割引は料金ページにあります。

スペックと制限

音声

言語 7 言語:中国語(標準中国語に加え広東語、呉語、閩南語と 15 の地方訛り)、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語
音声の制限
  • WebSocket によるリアルタイムストリーミングで、時間制限なし。
  • ホットワードと language_hints。
  • 単語/文のタイムスタンプ。
  • 中国語方言/EN/JA/KO/DE/FR/RU。
ストリーミング文字起こし 対応
タイムスタンプ 対応

モデル

モダリティ 音声 → テキスト

ホットワードのカスタマイズと多言語カバレッジを備えた、ストリーミング重視の Paraformer 世代です。

出典:Alibaba 公式ドキュメント ↗

30 秒で Paraformer Realtime v2 を使う

OpenAI 互換。base_url を差し替えるだけで、SDK はそのまま。POST /v1/audio/transcriptions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="paraformer-realtime-v2",
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

Paraformer Realtime v2 について

  • 標準中国語に加え、異例なほど幅広い地方方言(広東語、呉語、閩南語、四川語など)、そして英語・日本語・韓国語・ドイツ語・フランス語・ロシア語を認識し、検出を誘導する language_hints パラメータに対応します。
  • これは v2 でのみ追加されたもので、前バージョンが 16 kHz を要求したのに対し任意のサンプリングレートを受け付ける点も同様です。
  • Alibaba のドキュメントは現在、新規プロジェクトには Fun-ASR または Qwen-ASR を推奨しており、このモデルは既存の統合向けと位置づけています。
  • それでも使い続けられる理由は、成熟したパラメータ面にあります。
  • 専門語彙のためのホットワードテーブル、既定でオンの逆テキスト正規化、既定でオンでセマンティック句読点も選べる句読点予測、発話を区切る設定可能な最大無音時間、そしてフィラー語を取り除く任意の不流暢さフィルタ(Fun-ASR のリアルタイムモデルには文書化されていない制御)です。
  • 文および単語レベルのタイムスタンプがミリ秒単位で返り、接続は PCM、WAV、MP3、Opus、Speex、AAC、AMR を受け付けます。
  • 話者ダイアライゼーションはリアルタイム経路では提供されず、感情認識もありません。
  • 新規の作業の出発点としてではなく、すでにこれに合わせて調整されたパイプラインのための安定したエンドポイントとして扱ってください。
  • Synthorai は引き続き OpenAI 互換エンドポイント経由で提供します。

よくある質問

Paraformer Realtime v2 API は無料で試せますか?

はい。新規アカウントには 10 回のトライアル呼び出しと最大 $1 の無料クレジットが付与され、カード登録は不要です。支払い方法を追加する前に、実際のワークロードで Paraformer Realtime v2 を試すには十分な量です。

Paraformer Realtime v2 は何が得意ですか?

音声を入力し文字起こしを出力、異例なほど幅広い中国語地方方言のカバレッジ、検出を誘導する language_hints パラメータ。全体像はベンダー公式のリリースノートに基づく「このモデルについて」セクションをご覧ください。

Paraformer Realtime v2 の料金はいくらですか?

Synthorai 上の Paraformer Realtime v2 は文字起こしする音声 1 分あたり $0.002 です。従量課金でプラットフォーム手数料なし、サブスクリプションも不要です。

Paraformer Realtime v2 はどの言語に対応していますか?

Paraformer Realtime v2 は 7 言語:中国語(標準中国語に加え広東語、呉語、閩南語と 15 の地方訛り)、英語、日本語、韓国語、ドイツ語、フランス語、ロシア語 に対応しています。Synthorai では POST /v1/audio/transcriptions で呼び出せます。OpenAI 文字起こし API と同じ形式です。

Paraformer Realtime v2 を利用するには?

お使いの OpenAI SDK の base_url を "https://synthorai.io/v1" に向け、model="paraformer-realtime-v2" を設定すれば完了です。API キー 1 本でゲートウェイ上のすべてのモデルを利用できます。

関連モデル

比較

このページの値はすべてベンダー自身のドキュメント(上部にリンク)から転記し、確認した日付を付しています。価格はカタログ全体で比較しますが、ベンダーごとに定義が異なる仕様値は差異を明記するにとどめ、図表で比較はしません。当社が測定した数値はなく、スコアも付けていません。

API キーを取得 コストを比較する →