🎁 新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

Chirp 3 vs Fun-ASR Flash

vs

いつ、どちらを使うべきか — ベンチマーク表ではなく、厳選された評価

どちらも音声 1 分あたりで課金され、fun-asr-flash は 7.6 分の 1 の $0.0021 対 $0.016 です。ただし対象は狭く、同期認識のみ、1 ファイル 5 分または 2GB まで、30 以上の言語、話者分離なし。chirp-3 は GA 29 とプレビュー 82 のロケールを covering し、バッチは 1 時間まで、リアルタイムのストリームも扱い、14 言語で分離を行います。短いクリップを大量に処理するなら fun-asr-flash、分離や長いファイル、広いロケールが必要なら chirp-3 を選んでください。

料金

Chirp 3 Fun-ASR Flash Δ
音声1分あたり $0.016 $0.0021 7.6×

ビルド時のライブカタログの料金です。各モデルのページには現在の料金カードが記載されています。

位置付け — この課金単位におけるすべての11個の音声テキスト変換モデル全体の音声1分あたりの料金 (対数スケール)

Chirp 3 · $0.016 Fun-ASR Flash · $0.0021
$0.002 · Fun-ASR Realtime $0.016 · Chirp 2

機能

Chirp 3 Fun-ASR Flash
話者ダイアライゼーション あり なし
ストリーミング あり あり
タイムスタンプ あり

仕様

Chirp 3 Fun-ASR Flash
入力モダリティ 音声 音声
出力モダリティ テキスト テキスト
リリース 2025-10-13 2026-06
制限

Auto-detected audio decoding

sync Recognize <1 min, BatchRecognize 1 min–1 hr (<=20 min with word timestamps), StreamingRecognize for real-time

speaker diarization in BatchRecognize and Recognize (14 languages)

utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported

language-agnostic transcription

29 GA + 82 preview locales

Synchronous fast recognition, <=5 min / <=2GB per audio

context injection for domain terms

30+ languages

no diarization

言語

29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize

diarization covers 14 of them

Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak

仕様は各ベンダーのドキュメントから転記されています。ベンダーが公開していない行は推測せず、省略しています。 すべての出典: Chirp 3 · Fun-ASR Flash

1行で切り替え

以下のすべてのタブには両方のIDが含まれています — 変更箇所はハイライトされた2行のみです。エンドポイント、キー、リクエスト形式はすべて同じです。

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="chirp-3",
    # model="fun-asr-flash",  # この行をアンコメントし、上の行をコメントアウトします
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

APIキーを取得する →

FAQ

Chirp 3 と Fun-ASR Flash ではどちらが安いですか?

音声1分あたり においては Fun-ASR Flash の方が安価です($0.0021 対 $0.016、7.6× の差)。他の行では逆になる可能性があります — 上の表には完全な情報が記載されており、実際のコストは組み合わせに依存します。

2つの統合を行わずに Chirp 3 と Fun-ASR Flash のA/Bテストを実施できますか?

はい。両方とも1つのAPIキーで同じOpenAI互換エンドポイントを通じて提供されます — モデル文字列を1行変更するだけで切り替えられるため、トラフィックの一部をそれぞれにルーティングし、請求額を直接比較できます。

Chirp 3 と Fun-ASR Flash は話者ダイアライゼーションをサポートしていますか?

上の機能表では、各ベンダーのドキュメントから直接引用してモデルごとに回答しています — ダイアライゼーション、ストリーミング、タイムスタンプは、モデルによってこれら3つすべてが異なるため、個別にリストされています。

関連する比較

当社の測定調査より