Fun-ASR Flash vs GPT-4o Transcribe Diarize
什麼情況選哪一個
兩者皆為純轉錄模型,但計費單位不同 —— fun-asr-flash 每音訊分鐘收費 $0.0021,而 gpt-4o-transcribe-diarize 每百萬音訊輸入 token 收費 $6.25,因此兩者之間無法以單一標準公允換算。針對 5 分鐘或 2GB 以下單純的同步任務,請選擇 fun-asr-flash,其支援 30+ 種語言,具備領域術語上下文注入,但不提供語者分段功能。當您需要內建語者分段功能,包含 diarized_json 語者標籤與段落時間戳記,且能接受其 25MB 檔案上限、16000-token 上下文,以及針對超過 30s 音訊所需的 chunking_strategy 時,請選擇 gpt-4o-transcribe-diarize。
定價
| Fun-ASR Flash | GPT-4o Transcribe Diarize | Δ | |
|---|---|---|---|
| 每分鐘音訊 | $0.0021 | - | - |
| 音訊輸入 / 1M tokens | - | $6.25 | - |
| 文字輸出 / 1M tokens | - | $2.5 | - |
這兩個模型的計費單位不同,所以不顯示 Δ:要在兩者之間換算,就得套用一個我們沒有實測過的假設。上方的價目各自以原本的單位列出。
功能
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| 語者分離 | 否 | 是 |
| 串流 | 是 | 是 |
| 時間戳記 | - | 是 |
規格
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| 輸入模態 | 音訊 | 文字 音訊 |
| 輸出模態 | 文字 | 文字 |
| 發布日期 | 2026-06 | 2025-10 |
| 知識截止日期 | - | 2024-06 |
| 限制 | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support |
| 語言 | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| 最大輸出 | - | 2K |
規格摘錄自各供應商的文件;供應商沒有公布的項目就直接略過,不自行推測。 完整來源: Fun-ASR Flash · GPT-4o Transcribe Diarize
改一行程式碼就能在兩者之間切換
下面每個頁籤都列了這兩個模型 ID,要改的只有醒目標示的那兩行。端點、金鑰和請求格式都不變。
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
# model="gpt-4o-transcribe-diarize", # 取消這一行的註解,並把上一行註解掉
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
// model: "gpt-4o-transcribe-diarize", // 取消這一行的註解,並把上一行註解掉
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
# -F model="gpt-4o-transcribe-diarize" \ # 取消這一行的註解,並把上一行註解掉
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
// Model: "gpt-4o-transcribe-diarize", // 取消這一行的註解,並把上一行註解掉
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
// .model("gpt-4o-transcribe-diarize") // 取消這一行的註解,並把上一行註解掉
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());常見問題
Fun-ASR Flash 和 GPT-4o Transcribe Diarize 哪個比較便宜?
兩者的計費單位不同,沒辦法用一個數字公允地比較:上表中 Fun-ASR Flash 和 GPT-4o Transcribe Diarize 各自以原本的單位列出。請拿你自己的工作負載來比,實務上怎麼取捨,本頁最上方的結論有說明。
可以只串接一次,就對 Fun-ASR Flash 和 GPT-4o Transcribe Diarize 做 A/B 測試嗎?
可以。兩個模型都走同一個 OpenAI 相容端點,用的也是同一把 API 金鑰,切換時只要改一行裡的模型名稱字串。你可以把一部分流量分別導到兩邊,再直接比較帳單。
Fun-ASR Flash 和 GPT-4o Transcribe Diarize 支援語者分離嗎?
上方的功能表依各供應商的官方文件,逐一列出每個模型的支援情況。語者分離、串流和時間戳記分開列,是因為這三項各模型的支援程度都不一樣。