🎁 新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

Fun-ASR Flash vs GPT-4o Transcribe Diarize

vs

いつ、どちらを使うべきか — ベンチマーク表ではなく、厳選された評価

どちらも文字起こし専用モデルですが、課金単位が異なります — fun-asr-flashがオーディオ1分あたり$0.0021を請求するのに対し、gpt-4o-transcribe-diarizeはオーディオ入力100万トークンあたり$6.25を請求するため、これらを単一の基準で正確に換算することはできません。5分または2GB未満の単純な同期ジョブで、30以上の言語に対応し、ダイアライゼーションは不要だがドメイン用語のコンテキスト注入が必要な場合は、fun-asr-flashを選択してください。diarized_jsonによる話者ラベルとセグメントのタイムスタンプを備えた組み込みの話者ダイアライゼーションが必要な場合は、25MBのファイル上限、16000トークンのコンテキスト、および30sを超えるオーディオに必須となるchunking_strategyを許容した上で、gpt-4o-transcribe-diarizeを選択してください。

料金

Fun-ASR Flash GPT-4o Transcribe Diarize Δ
音声1分あたり $0.0021
音声入力 / 1Mトークン $6.25
テキスト出力 / 1Mトークン $2.5

これら2つのモデルは課金単位が異なるため、Δは表示されていません — 単位を変換するには、当社が測定していない仮定が必要になります。各カードは上記にてそれぞれの単位で記載されています。

機能

Fun-ASR Flash GPT-4o Transcribe Diarize
話者ダイアライゼーション なし あり
ストリーミング あり あり
タイムスタンプ あり

仕様

Fun-ASR Flash GPT-4o Transcribe Diarize
入力モダリティ 音声 テキスト 音声
出力モダリティ テキスト テキスト
リリース 2026-06 2025-10
知識のカットオフ 2024-06
制限

Synchronous fast recognition, <=5 min / <=2GB per audio

context injection for domain terms

30+ languages

no diarization

mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB

built-in speaker diarization with diarized_json output (speaker labels + segment timestamps)

chunking_strategy required for audio >30s

no prompt support

言語 Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak

57 languages listed for the transcriptions endpoint (one shared list for all transcription models)

ISO 639-1 / 639-3 codes accepted for GPT-4o-based models

最大出力 2K

仕様は各ベンダーのドキュメントから転記されています。ベンダーが公開していない行は推測せず、省略しています。 すべての出典: Fun-ASR Flash · GPT-4o Transcribe Diarize

1行で切り替え

以下のすべてのタブには両方のIDが含まれています — 変更箇所はハイライトされた2行のみです。エンドポイント、キー、リクエスト形式はすべて同じです。

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-flash",
    # model="gpt-4o-transcribe-diarize",  # この行をアンコメントし、上の行をコメントアウトします
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

APIキーを取得する →

FAQ

Fun-ASR Flash と GPT-4o Transcribe Diarize ではどちらが安いですか?

課金単位が異なるため、単一の正確な数値はありません:Fun-ASR Flash と GPT-4o Transcribe Diarize は上の表においてそれぞれの単位で記載されています。ご自身のワークロードで比較してください — 実用的なトレードオフは、このページ上部の判定に記載されています。

2つの統合を行わずに Fun-ASR Flash と GPT-4o Transcribe Diarize のA/Bテストを実施できますか?

はい。両方とも1つのAPIキーで同じOpenAI互換エンドポイントを通じて提供されます — モデル文字列を1行変更するだけで切り替えられるため、トラフィックの一部をそれぞれにルーティングし、請求額を直接比較できます。

Fun-ASR Flash と GPT-4o Transcribe Diarize は話者ダイアライゼーションをサポートしていますか?

上の機能表では、各ベンダーのドキュメントから直接引用してモデルごとに回答しています — ダイアライゼーション、ストリーミング、タイムスタンプは、モデルによってこれら3つすべてが異なるため、個別にリストされています。

関連する比較

当社の測定調査より