Fun-ASR Flash vs GPT-4o Transcribe Diarize
什么时候选哪个
两者都是纯转录模型,但计费单位不同 —— fun-asr-flash 每音频分钟收费 $0.0021,而 gpt-4o-transcribe-diarize 每百万音频输入 token 收费 $6.25,因此它们之间没有任何一种单一换算是绝对准确的。选择 fun-asr-flash 用于 5 分钟或 2GB 以内的直接同步任务,支持 30+ 种语言,具备领域术语上下文注入但无说话人分离功能。当你需要内置的说话人分离功能,包含 diarized_json 说话人标签和段落时间戳时,请选择 gpt-4o-transcribe-diarize,需接受其 25MB 的文件上限、16000-token 上下文限制,以及对超过 30s 的音频强制要求的 chunking_strategy。
价格
| Fun-ASR Flash | GPT-4o Transcribe Diarize | Δ | |
|---|---|---|---|
| 每分钟音频 | $0.0021 | - | - |
| 音频输入 / 1M token | - | $6.25 | - |
| 文本输出 / 1M token | - | $2.5 | - |
这两个模型的计费单位不同,所以不显示 Δ:要在两种单位之间换算,就得引入一个我们没有实测过的假设。上方各自的价格按各自的单位列出。
能力
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| 说话人分离 | 否 | 是 |
| 流式输出 | 是 | 是 |
| 时间戳 | - | 是 |
规格
| Fun-ASR Flash | GPT-4o Transcribe Diarize | |
|---|---|---|
| 输入模态 | 音频 | 文本 音频 |
| 输出模态 | 文本 | 文本 |
| 发布日期 | 2026-06 | 2025-10 |
| 知识截止日期 | - | 2024-06 |
| 限制 | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization | mp3/mp4/mpeg/mpga/m4a/wav/webm, up to 25MB built-in speaker diarization with diarized_json output (speaker labels + segment timestamps) chunking_strategy required for audio >30s no prompt support |
| 语言 | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak | 57 languages listed for the transcriptions endpoint (one shared list for all transcription models) ISO 639-1 / 639-3 codes accepted for GPT-4o-based models |
| 最大输出 | - | 2K |
规格照录自各供应商的文档;供应商没有公布的项目,对应的行直接省略,不做推断。 完整来源: Fun-ASR Flash · GPT-4o Transcribe Diarize
改一行代码就能在两个模型之间切换
下方每个标签页里都有两个模型 ID,高亮的那两行是唯一要改的地方。端点不变,API key 不变,请求结构也不变。
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="fun-asr-flash",
# model="gpt-4o-transcribe-diarize", # 取消注释此行,注释上一行
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "fun-asr-flash",
// model: "gpt-4o-transcribe-diarize", // 取消注释此行,注释上一行
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="fun-asr-flash" \
# -F model="gpt-4o-transcribe-diarize" \ # 取消注释此行,注释上一行
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "fun-asr-flash",
// Model: "gpt-4o-transcribe-diarize", // 取消注释此行,注释上一行
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("fun-asr-flash")
// .model("gpt-4o-transcribe-diarize") // 取消注释此行,注释上一行
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());常见问题
Fun-ASR Flash 和 GPT-4o Transcribe Diarize 哪个更便宜?
两个模型的计费单位不同,给不出一个公允的统一数字:上方表格里,Fun-ASR Flash 和 GPT-4o Transcribe Diarize 各按自己的单位列出。建议拿你自己的负载来比,实际该怎么取舍,见本页顶部的结论。
不用分别集成两次,就能对 Fun-ASR Flash 和 GPT-4o Transcribe Diarize 做 A/B 测试吗?
可以。两个模型走同一个 OpenAI 兼容端点,用同一个 API key,切换时只要改一行里的模型名,所以可以给两个模型各分一部分流量,直接对比账单。
Fun-ASR Flash 和 GPT-4o Transcribe Diarize 支持说话人分离吗?
上方的能力表格按各供应商的官方文档,逐个模型回答了这个问题。说话人分离、流式输出和时间戳三项分开列出,因为不同模型在这三项上的支持情况都不一样。