新人 免费注册,送 10 次调用,最高 $1,无需绑卡。

Fun-ASR Flash vs Seed ASR

vs

什么时候选哪个

每分钟费率的差距只在舍入误差范围内($0.0021 对 $0.002),于是选择完全取决于能力:seed-asr-bigmodel 在音频文件 API 上做说话人分离(文档标注 10 人以内效果最佳),返回句级和词级时间戳,单个文件最长 5 小时;fun-asr-flash 只支持同步,上限 5 分钟、2GB,没有分离,但有面向领域术语的上下文注入。要短音频快速返回选 fun-asr-flash,长录音或多说话人选 seed-asr-bigmodel。

价格

Fun-ASR Flash Seed ASR Δ
每分钟音频 $0.0021 $0.002 1×

价格取自构建时的实时目录,最新价格见各模型页面。

两个模型所处的位置:全部 12 个按同一单位计费的语音转文字模型的每分钟音频价格分布(对数刻度)

Fun-ASR Flash · $0.0021 Seed ASR · $0.002

能力

Fun-ASR Flash Seed ASR
说话人分离 否 是
流式输出 是 是
时间戳 - 是

规格

Fun-ASR Flash Seed ASR
输入模态 音频 音频
输出模态 文本 文本
发布日期 2026-06 2025-12-05
限制

Synchronous fast recognition, <=5 min / <=2GB per audio

context injection for domain terms

30+ languages

no diarization

Async audio-file mode: <512MB, <5 hours, OPUS/WAV/MP3/SPX/OGG/AMR/AAC/M4A (raw PCM also accepted), results returned within 3 hours and retained 7 days

speaker diarization via enable_speaker_info (audio-file API only, best with <=10 speakers, no diarization on the streaming API)

sentence + word segmentation with start_time/end_time via show_utterances

language identification via enable_lid

hotwords/context up to 800 tokens and 20 rounds

per-call billing

语言 Multilingual with dialects, the same 30-language list as the Fun-ASR main versions: Chinese (Mandarin, Cantonese, Wu, Hokkien, Hakka, Gan, Xiang, Jin plus regional accents), English, Japanese, Korean, Vietnamese, Thai, Indonesian, Malay, Filipino, Hindi, Arabic, French, German, Spanish, Portuguese, Russian, Italian, Dutch, Swedish, Danish, Finnish, Norwegian, Greek, Polish, Czech, Hungarian, Romanian, Bulgarian, Croatian, Slovak

With `language` empty the model covers Mandarin, English, Cantonese, Shanghainese, Minnan, Sichuan and Shaanxi dialects

39 language keys can be pinned explicitly (en-US, zh-CN, yue-CN, ja-JP, ko-KR, id-ID, es-MX, pt-BR, de-DE, fr-FR, fil-PH, ms-MY, th-TH, ar-SA, it-IT, bn-BD, el-GR, nl-NL, ru-RU, tr-TR, vi-VN, pl-PL, ro-RO, uk-UA, az-AZ, bg-BG, cs-CZ, da-DK, fi-FI, hi-IN, hu-HU, kk-KZ, km-KH, my-MM, no-NO, pa-PK, sv-SE, sw-KE, ur-PK), plus optional auto-detection (enable_auto_lang)

规格照录自各供应商的文档;供应商没有公布的项目,对应的行直接省略,不做推断。 完整来源: Fun-ASR Flash · Seed ASR

改一行代码就能在两个模型之间切换

下方每个标签页里都有两个模型 ID,高亮的那两行是唯一要改的地方。端点不变,API key 不变,请求结构也不变。

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.audio.transcriptions.create(
    model="fun-asr-flash",
    # model="seed-asr-bigmodel",  # 取消注释此行,注释上一行
    file=open("meeting.mp3", "rb"),
    language="en",
)
print(resp.text)

获取 API key →

常见问题

Fun-ASR Flash 和 Seed ASR 哪个更便宜?

按「每分钟音频」算,Seed ASR 更便宜($0.002 对 $0.0021,相差 1.0×)。其他计费项的结论可能相反,完整价格见上方表格,实际成本取决于你的用量构成。

不用分别集成两次,就能对 Fun-ASR Flash 和 Seed ASR 做 A/B 测试吗?

可以。两个模型走同一个 OpenAI 兼容端点,用同一个 API key,切换时只要改一行里的模型名,所以可以给两个模型各分一部分流量,直接对比账单。

Fun-ASR Flash 和 Seed ASR 支持说话人分离吗?

上方的能力表格按各供应商的官方文档,逐个模型回答了这个问题。说话人分离、流式输出和时间戳三项分开列出,因为不同模型在这三项上的支持情况都不一样。

相关对比

我们的实测研究