Chirp 3 vs Fun-ASR Flash
什么时候选哪个
两者都按音频分钟计费,fun-asr-flash 便宜 7.6 倍,$0.0021 对 $0.016——但它是更窄的工具:仅同步识别,单个文件最长 5 分钟或 2GB,30 多种语言,不做说话人分离。chirp-3 覆盖 29 个 GA 加 82 个预览语言区,批处理最长一小时并支持实时流,还能在 14 种语言上做分离。大批量短音频选 fun-asr-flash;需要分离、长文件或更宽的语言区列表时选 chirp-3。
价格
| Chirp 3 | Fun-ASR Flash | Δ | |
|---|---|---|---|
| 每分钟音频 | $0.016 | $0.0021 | 7.6× |
价格取自构建时的实时目录,最新价格见各模型页面。
两个模型所处的位置:全部 12 个按同一单位计费的语音转文字模型的每分钟音频价格分布(对数刻度)
能力
| Chirp 3 | Fun-ASR Flash | |
|---|---|---|
| 说话人分离 | 是 | 否 |
| 流式输出 | 是 | 是 |
| 时间戳 | 是 | - |
规格
| Chirp 3 | Fun-ASR Flash | |
|---|---|---|
| 输入模态 | 音频 | 音频 |
| 输出模态 | 文本 | 文本 |
| 发布日期 | 2025-10-13 | 2026-06 |
| 限制 | Auto-detected audio decoding sync Recognize <1 min, BatchRecognize 1 min - 1 hr (<=20 min with word timestamps), StreamingRecognize for real-time speaker diarization in BatchRecognize and Recognize (14 languages) utterance-level timestamps (StreamingRecognize only), word-level timestamps listed as unsupported language-agnostic transcription 29 GA + 82 preview locales | Synchronous fast recognition, <=5 min / <=2GB per audio context injection for domain terms 30+ languages no diarization |
| 语言 | 29 GA + 82 Preview locales (111 total) across StreamingRecognize, Recognize and BatchRecognize diarization covers 14 of them | Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak |
规格照录自各供应商的文档;供应商没有公布的项目,对应的行直接省略,不做推断。 完整来源: Chirp 3 · Fun-ASR Flash
改一行代码就能在两个模型之间切换
下方每个标签页里都有两个模型 ID,高亮的那两行是唯一要改的地方。端点不变,API key 不变,请求结构也不变。
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.audio.transcriptions.create(
model="chirp-3",
# model="fun-asr-flash", # 取消注释此行,注释上一行
file=open("meeting.mp3", "rb"),
language="en",
)
print(resp.text)import OpenAI from "openai";
import fs from "node:fs";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.audio.transcriptions.create({
model: "chirp-3",
// model: "fun-asr-flash", // 取消注释此行,注释上一行
file: fs.createReadStream("meeting.mp3"),
});
console.log(resp.text);curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer sk-syn-..." \
-F model="chirp-3" \
# -F model="fun-asr-flash" \ # 取消注释此行,注释上一行
-F file=@meeting.mp3package main
import (
"context"
"fmt"
"os"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
f, _ := os.Open("meeting.mp3")
resp, _ := client.Audio.Transcriptions.New(context.TODO(), openai.AudioTranscriptionNewParams{
Model: "chirp-3",
// Model: "fun-asr-flash", // 取消注释此行,注释上一行
File: f,
})
fmt.Println(resp.Text)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.audio.transcriptions.*;
import java.nio.file.Paths;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
Transcription resp = client.audio().transcriptions().create(
TranscriptionCreateParams.builder()
.model("chirp-3")
// .model("fun-asr-flash") // 取消注释此行,注释上一行
.file(Paths.get("meeting.mp3"))
.build()).asTranscription();
System.out.println(resp.text());常见问题
Chirp 3 和 Fun-ASR Flash 哪个更便宜?
按「每分钟音频」算,Fun-ASR Flash 更便宜($0.0021 对 $0.016,相差 7.6×)。其他计费项的结论可能相反,完整价格见上方表格,实际成本取决于你的用量构成。
不用分别集成两次,就能对 Chirp 3 和 Fun-ASR Flash 做 A/B 测试吗?
可以。两个模型走同一个 OpenAI 兼容端点,用同一个 API key,切换时只要改一行里的模型名,所以可以给两个模型各分一部分流量,直接对比账单。
Chirp 3 和 Fun-ASR Flash 支持说话人分离吗?
上方的能力表格按各供应商的官方文档,逐个模型回答了这个问题。说话人分离、流式输出和时间戳三项分开列出,因为不同模型在这三项上的支持情况都不一样。