转录 API 成本实测:7 个模型处理同一组音频
Synthorai 现在支持音频转录,一个兼容 OpenAI 的 endpoint 后面接入了 7 个专用语音转文字模型。
这个 endpoint 屏蔽了大量适配工作,因为这些模型原生接口的差异很大。whisper-1 接收 multipart 文件上传,返回 {text}。gpt-4o-transcribe 使用相同的上传方式,但会额外返回 token 用量。ByteDance 的 seed-asr 使用 BytePlus AUC 协议,Alibaba 的 qwen3-asr-flash 有自己的协议,Google 的 chirp 模型则是通过 OAuth 调用的 Cloud Speech-to-Text 识别器。
endpoint 不同,认证方式不同,响应结构也不同,每个模型都要单独集成。通过网关,只需调用一次兼容 OpenAI 的接口:把 gpt-4o-mini-transcribe 换成 seed-asr-bigmodel 或 chirp-3,其余代码无需改动。
TL;DR
- 7 个专用模型的转录成本相差 8 倍:seed-asr-bigmodel 每音频分钟 $0.0020,chirp 模型为 $0.0164(测量日期为 2026-06-25)。
- seed-asr 无法自动检测语言:不设置
language时,非英语或中文音频会返回 HTTP 200,但文本为空或变成罗马字母转录,同时仍会计费。 - qwen3-asr-flash 每分钟 $0.0021,是测试中可自动检测所有语言的最便宜模型。
- 只有 gpt-4o 转录模型支持逐 token streaming;按分钟计费的模型只支持 batch。
- 所有模型在清晰的英语、西班牙语和法语语音上都取得了约 0% 的错误率:准确率不是选型时的区分维度。
调用的是兼容 OpenAI 的转录 endpoint。如果已经在使用 Whisper,可以直接替换:
curl https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-F file=@meeting.mp3 \
-F model=gpt-4o-mini-transcribe
from openai import OpenAI
client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")
with open("meeting.mp3", "rb") as f:
result = client.audio.transcriptions.create(model="gpt-4o-mini-transcribe", file=f)
print(result.text)
转录文本通过 text 返回,实际计费金额位于响应头 x-total-cost-usd 中。
我们用同一套简单测试跑了全部 7 个模型。下面所有数据都取决于这套测试的设计。
这项测试能说明什么,不能说明什么
我们为全球使用人数最多的 5 种语言分别编写了不含专有名词的日常短文,内容涉及清晨、天气和逛市场等,再用标准文本转语音生成音频,然后交给全部 7 个模型转录。每段音频约 12 到 15 秒,包含大约 40 个按正常语速朗读的词,没有较长静音。编码格式为 16 kHz 单声道 16-bit PCM WAV(256 kbps,每分钟约 2 MB)。原文作为 ground truth,时长精确测量。
这是一组刻意降低难度的样本:音频清晰、内容来自脚本、只有一个说话人,也没有口音、噪声或专业术语。它适合测试不受音频难度影响的指标,包括成本、延迟、模型是否支持某种语言,以及能否 streaming。这些结果比较稳定。
这不是质量 benchmark。真实录音中的口音、背景噪声、领域词汇、多人同时说话和长达一小时的音频,都会拉开模型差距,而清晰语音无法体现这些情况。这里的准确率只能用于检查下限,不能用于模型排名。成本、语言覆盖和 streaming 结果才是可以依赖的基线。
专用 ASR,而非多模态模型
这里测试的 7 个模型都是专用语音转文字系统:OpenAI 的 whisper-1、gpt-4o-transcribe 和 gpt-4o-mini-transcribe;ByteDance 的 seed-asr-bigmodel;Alibaba 的 qwen3-asr-flash;以及 Google 的 chirp-2 和 chirp-3。
网关也可以把转录 endpoint 指向 Gemini 这类通用多模态模型。这类模型在理解音频的同时也能生成转录文本。我们没有纳入这些模型,也不建议将其用于转录。Google 对自家产品线给出的建议相同:Gemini 音频指南将 Gemini 定位为描述、总结音频或回答音频相关问题的工具;如果需要转录本身,则建议使用其他服务:“对于支持实时转录的专用语音转文字模型,应使用 Google Cloud Speech-to-Text API”(即 Chirp 模型)。多模态模型可以输出转录文本,但其目标是理解音频,而不是逐字记录原话。调用方式也是聊天式的 generateContent,而不是转录 API。需要逐字语音转文字时,专用模型才是合适的工具,同时提供两类模型的厂商也持相同观点。
发送音频有 3 种方式:
- 上传文件,batch 返回:上传完整录音,在一次响应中获取完整转录文本。所有模型都支持。
- 上传文件,streaming 返回文本:同样上传完整录音,但生成的转录文本会通过 SSE 持续返回。部分模型支持,其他模型只支持 batch。
- 输入音频流,输出文本流:实时识别麦克风或通话音频。该功能仍在开发中,尚未开放,因此下面只讨论前两种模式。
转录如何计费
计费方式分为两类。按音频分钟计费(whisper-1、seed-asr、qwen3-asr-flash 和 Chirp 模型):按录音的实际时长收费,与音频内容无关。按 token 计费(gpt-4o 模型):音频以固定速率 token 化,费用由输入 token 和转录文本的输出 token 共同构成,因此静音多的音频比语音密集的音频便宜。
按 token 计费有一个容易踩的坑:标出的输入价格针对文本,音频价格更高(gpt-4o-mini-transcribe 标价为输入 $1.25/M,但音频实际按 $3/M 计费)。用文本价格估算会低估成本。网关会在 x-total-cost-usd 响应头中返回实际费用,应直接读取该值,不要根据价格页面猜测。
成本
成本是这项测试最容易准确测量、同时差异最大的指标。以下是根据计费响应头计算的每分钟成本(网关后面所有模型的当前价格均可在实时更新的模型页面查看):
| 模型 | 成本 / 分钟 | 延迟 | Streaming |
|---|---|---|---|
seed-asr-bigmodel | $0.0020 | ≈10 秒 | 不支持 |
qwen3-asr-flash | $0.0021 | ≈3 秒 | 不支持 |
gpt-4o-mini-transcribe | $0.0031 | ≈3 秒 | 逐 token |
whisper-1 | $0.0060 | ≈4 秒 | 不支持 |
gpt-4o-transcribe | $0.0062 | ≈2 秒 | 逐 token |
chirp-2 | $0.0164 | ≈3 秒 | 不支持 |
chirp-3 | $0.0164 | ≈4 秒 | 不支持 |
成本相差约 8 倍,从 seed-asr 的每分钟 $0.0020 到 Chirp 模型的 $0.0164。最便宜的 seed-asr 必须明确指定音频语言,后文会详细说明。因此,如果预先知道语言,它最划算。对于语言混杂或未知的音频,最便宜的免配置方案是每分钟 $0.0021 的 qwen3-asr-flash。Chirp 模型明显最贵。如果一定要用 Chirp,应选择 chirp-3:它与 chirp-2 价格和速度相同,但普通话转录效果好得多,准确率表中可以看到这一点。
这些数据在实际文件上的变化方式取决于计费类型。按分钟计费的模型(whisper-1、seed-asr、qwen3-asr-flash 和 Chirp)只看时长,所以费率可直接套用:无论格式和内容是什么,10 分钟音频的成本都是每分钟价格的 10 倍。
按 token 计费的模型(gpt-4o 两行)的输入成本随时长变化,而不是随文件大小变化,因为提供方会先对音频重采样,再进行 token 化。一份体积较大的 320 kbps MP3 和我们使用的精简 16 kHz WAV,如果内容相同,token 成本也大致相同。因此,压缩文件能节省存储,但不会减少转录费用。真正影响按 token 计费金额的是实际语音量。我们的音频语速正常、没有空白段,如果音频中的语音更密集或更稀疏,输出 token 费用会略有升降。无论哪种情况,x-total-cost-usd 响应头都是实际费用的准确信息源。
准确率和语言覆盖
对于英语、西班牙语和法语,所有支持相应语言的模型错误率都约为 0%。这是最低要求,所有模型都达标。即使在这组简单测试中,普通话和印地语也开始暴露差异。不过,这些数据只能提示哪些语言值得重点测试,不能直接作为结论:
| 模型 | 普通话(CER) | 印地语(WER) | 覆盖范围 |
|---|---|---|---|
seed-asr-bigmodel | 0% | 9% | 全部 5 种语言(必须显式设置 language) |
qwen3-asr-flash | 0% | 15% | 全部 5 种语言 |
gpt-4o-mini-transcribe | 0% | 4% | 全部 5 种语言 |
whisper-1 | 0% | 22% | 全部 5 种语言 |
gpt-4o-transcribe | 0% | 13% | 全部 5 种语言 |
chirp-2 | 16% | 15% | 全部 5 种语言 |
chirp-3 | 2% | 15% | 全部 5 种语言 |
这里真正需要关注的不是语言覆盖,而是语言检测。传入 language 参数后,seed-asr 可以转录全部 5 种语言。在后续测试中,它也能处理日语、德语、意大利语和韩语。但它无法自行检测语言:不设置 language 时,英语和中文以外的音频会返回空字符串或罗马字母乱码,HTTP 状态码仍为 200,也不会报错。其他 6 个模型都能自动检测语言。这种静默失败才是关键发现:明确报错只会带来麻烦,静默失败则会造成生产事故。
印地语结果的差距,以及普通话上的失误(chirp-2 为 16%,chirp-3 已修复),说明在信任这些模型之前,应该用更难的语言样本进行测试,并不代表某个模型一定优于另一个。合成语音和评分方式会放大绝对数值,而且不同测试轮次的结果也会变化。合理的结论是:对于主流语言的清晰语音,准确率无法有效区分这些模型,因此这项测试也不能据此推荐某个模型。
Streaming 输出
模型能否 streaming 转录文本属于功能差异,不代表质量高低,而这项能力将这些模型分成了两类。按分钟计费的模型(whisper-1、seed-asr、qwen3-asr-flash 和两个 Chirp 模型)只支持 batch;请求 streaming 时,网关会返回 400。gpt-4o 模型支持逐 token streaming:gpt-4o-transcribe 大约 1 秒就会返回第一批词,随后继续补全剩余内容,适合需要实时感的 UI。streaming 和 batch 的成本相同。要启用 streaming,添加 stream=true:
curl -N https://synthorai.io/v1/audio/transcriptions \
-H "Authorization: Bearer $SYNTHORAI_API_KEY" \
-F file=@meeting.mp3 -F model=gpt-4o-transcribe -F stream=true
# data: {"type":"transcript.text.delta","delta":"When"}
# data: {"type":"transcript.text.delta","delta":" you"} ...
缓存
这些模型实际上都没有缓存。按分钟计费的模型只看音频时长,因此重复请求没有折扣:我们把同一段音频发送给 whisper-1 5 次,每次费用都完全相同,均为 $0.015478。按 token 计费的 gpt-4o 模型没有列出缓存价格,重复请求的费用也只有正常的运行间波动。因此,应按每分钟费率规划成本;重复发送同一文件不会更便宜。
先筛选什么,哪些必须自己测试
这项测试无法判断哪个模型在你的录音上最准确,但可以在自行评测前帮你确定筛选条件:
- 语言。 确认模型支持所需的每种语言,并检查它能否自行检测语言。
seed-asr能处理我们测试的所有语言,但必须显式传入language参数;不传时,非英语或中文音频会静默失败。其他 6 个模型都能自动检测语言,对于混合语言或语言未知的音频,这是更安全的默认选择。 - Streaming。 如果需要实时转录,只有
gpt-4o模型支持逐 token streaming;按分钟计费的模型只支持 batch。 - 成本。 成本相差约 8 倍。支持全部测试语言且最便宜的模型是每分钟 $0.0021 的
qwen3-asr-flash;Chirp 模型最贵,而在便宜模型之外选择 Chirp 时,只有chirp-3值得考虑。没有缓存可以降低费用,因此实际支付的就是每分钟费率。 - 模型类型。 使用专用语音转文字模型,不要使用通用多模态模型。逐字转录应该使用专用工具,同时提供这两类模型的厂商也明确给出了相同建议。
经过这些条件筛选后,剩下的问题就是每个模型对实际音频中的口音、噪声和词汇究竟有多准确。这个问题只能自行测试。任何清晰语音 benchmark 都无法替代在真实录音上运行候选模型。
结论
对于主流语言中清晰、按脚本朗读的语音,7 个模型的准确率几乎相同。这正是本次测试最有价值的结论:准确率不是选型时的区分维度。真正能够确定且差异明显的是基础条件:成本相差约 8 倍,有一个模型只能自动处理两种语言,按分钟计费的模型无法 streaming。先根据这些条件缩小范围,而不是直接宣布哪个模型胜出,再用自己的音频测试剩下的两三个候选模型。通用多模态模型也不应作为首选。转录应使用专用语音转文字模型,同时开发这两类产品的厂商也给出了同样的建议。
来源
- OpenAI:语音转文字指南
- OpenAI:API 定价
- Google:Gemini API 音频理解(专用转录请使用 Cloud Speech-to-Text)
- Google Cloud:Chirp 3 转录模型
- BytePlus:Seed-ASR(ByteDance)概览
成本和延迟数据于 2026-06-25 在 Synthorai 上测得,涵盖 7 个专用转录模型和 5 种语言(英语、普通话、印地语、西班牙语、法语),数据来自 x-total-cost-usd 响应头和 SSE 计时。seed-asr 的语言数据于 2026-07-04 重新测量,当时已设置 language 参数。音频由文本转语音生成,并刻意降低了难度,因此准确率数据只能用于检查下限,不能作为质量 benchmark;带有口音和噪声的真实语音会以不同方式拉开模型差距。延迟会因运行轮次而变化。文中标价为该平台截至当日的费率。依赖这些数据前,请核实当前价格。