Fun-ASR Flash vs GPT-4o Transcribe Diarize
いつ、どちらを使うべきか — ベンチマーク表ではなく、厳選された評価
どちらも文字起こし専用モデルですが、課金単位が異なります — fun-asr-flashがオーディオ1分あたり$0.0021を請求するのに対し、gpt-4o-transcribe-diarizeはオーディオ入力100万トークンあたり$6.25を請求するため、これらを単一の基準で正確に換算することはできません。5分または2GB未満の単純な同期ジョブで、30以上の言語に対応し、ダイアライゼーションは不要だがドメイン用語のコンテキスト注入が必要な場合は、fun-asr-flashを選択してください。diarized_jsonによる話者ラベルとセグメントのタイムスタンプを備えた組み込みの話者ダイアライゼーションが必要な場合は、25MBのファイル上限、16000トークンのコンテキスト、および30sを超えるオーディオに必須となるchunking_strategyを許容した上で、gpt-4o-transcribe-diarizeを選択してください。
料金
| Fun-ASR Flash | GPT-4o Transcribe Diarize | Δ | |
|---|---|---|---|
| 音声1分あたり | $0.0021 | — | — |
| 音声入力 / 1Mトークン | — | $6.25 | — |
| テキスト出力 / 1Mトークン | — | $2.5 | — |
これら2つのモデルは課金単位が異なるため、Δは表示されていません — 単位を変換するには、当社が測定していない仮定が必要になります。各カードは上記にてそれぞれの単位で記載されています。
機能
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| 話者ダイアライゼーション | なし | あり |
| ストリーミング | あり | あり |
| タイムスタンプ | — | あり |
仕様
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| 入力モダリティ | 音声 | テキスト 音声 |
| 出力モダリティ | テキスト | テキスト |
| リリース | 2026-06 | 2025-10 |
| 知識のカットオフ | — | 2024-06 |
| 制限 | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support |
| 言語 | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| 最大出力 | — | 2K |
仕様は各ベンダーのドキュメントから転記されています。ベンダーが公開していない行は推測せず、省略しています。 すべての出典: Fun-ASR Flash · GPT-4o Transcribe Diarize
1行で切り替え
以下のすべてのタブには両方のIDが含まれています — 変更箇所はハイライトされた2行のみです。エンドポイント、キー、リクエスト形式はすべて同じです。
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
# model="gpt-4o-transcribe-diarize", # この行をアンコメントし、上の行をコメントアウトします
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
// model: "gpt-4o-transcribe-diarize", // この行をアンコメントし、上の行をコメントアウトします
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
# -F model="gpt-4o-transcribe-diarize" \ # この行をアンコメントし、上の行をコメントアウトします
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
// Model: "gpt-4o-transcribe-diarize", // この行をアンコメントし、上の行をコメントアウトします
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
// .model("gpt-4o-transcribe-diarize") // この行をアンコメントし、上の行をコメントアウトします
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());FAQ
Fun-ASR Flash と GPT-4o Transcribe Diarize ではどちらが安いですか?
課金単位が異なるため、単一の正確な数値はありません:Fun-ASR Flash と GPT-4o Transcribe Diarize は上の表においてそれぞれの単位で記載されています。ご自身のワークロードで比較してください — 実用的なトレードオフは、このページ上部の判定に記載されています。
2つの統合を行わずに Fun-ASR Flash と GPT-4o Transcribe Diarize のA/Bテストを実施できますか?
はい。両方とも1つのAPIキーで同じOpenAI互換エンドポイントを通じて提供されます — モデル文字列を1行変更するだけで切り替えられるため、トラフィックの一部をそれぞれにルーティングし、請求額を直接比較できます。
Fun-ASR Flash と GPT-4o Transcribe Diarize は話者ダイアライゼーションをサポートしていますか?
上の機能表では、各ベンダーのドキュメントから直接引用してモデルごとに回答しています — ダイアライゼーション、ストリーミング、タイムスタンプは、モデルによってこれら3つすべてが異なるため、個別にリストされています。