🎁 新人 免费注册,送 10 次调用,最高 $1,免绑卡。
语音转文字 API:14 个模型,每分钟 $0.002 至 $0.016

语音转文字 API:14 个模型,每分钟 $0.002 至 $0.016

目录
  1. 2026 年语音转文字 API 多少钱?
  2. 按 token 计费如何换算成每分钟成本?
  3. 什么是中国 ASR 档位?为什么多数对比没有覆盖?
  4. 应该为工作负载选择哪个模型?
  5. 常见问题

按标价计算,语音转文字 API 每分钟成本在 $0.002 到 $0.016 之间。同一类任务,价格相差 8 倍,而且多数对比并未覆盖最便宜的档位。我们的一个网关接入了 14 个转录模型,既包括按 token 计费的 OpenAI gpt-4o 系列,也包括国际评测经常忽略的中国 ASR 模型(ByteDance、Alibaba)。本文梳理整个品类:不同计费方式意味着什么、每个模型折算到每分钟多少钱,以及如何按使用场景而不是按品牌选型。

TL;DR

  • 14 个模型的每分钟标价从 $0.002(seed-asr、paraformer、fun-asr-realtime)到 $0.016(Google 的 Chirp)不等,相差 8 倍。
  • OpenAI 的 gpt-4o 转录模型按 token 而不是按分钟计费;按我们的实测音频换算,mini 约为 $0.0031/min,完整版本约为 $0.0062/min。
  • 最便宜的是中国 ASR:ByteDance 的 seed-asr,以及 Alibaba 的 paraformer、fun-asr 和 qwen3 系列,标价均为 $0.002-$0.0021/min,并提供 streaming 版本。
  • 对于清晰语音,准确率并不是区分模型的关键;在我们的七模型测试中,所有支持相应语言的模型在英语、西班牙语和法语上的错误率都约为 0%。

2026 年语音转文字 API 多少钱?

要准确回答这个问题,必须看表格,因为计费方式与费率同样重要。按分钟计费的模型只看音频时长,不考虑内容;按 token 计费的模型会先对音频重采样,再按输入和输出 token 收费。后者可以换算为每分钟成本,但会随语音密度小幅变化:

模型提供商计费方式标价支持 streaming
seed-asr-bigmodelByteDance按分钟$0.002/min
paraformer-realtime-v2Alibaba按分钟$0.002/min
qwen3-asr-flash-realtimeAlibaba按分钟$0.002/min
fun-asr-realtimeAlibaba按分钟$0.002/min
fun-asrAlibaba按分钟$0.0021/min
fun-asr-flashAlibaba按分钟$0.0021/min
fun-asr-mtlAlibaba按分钟$0.0021/min
qwen3-asr-flashAlibaba按分钟$0.0021/min
gpt-4o-mini-transcribeOpenAI按 token实测约 ≈$0.0031/min逐 token
whisper-1OpenAI按分钟$0.006/min
gpt-4o-transcribeOpenAI按 token实测约 ≈$0.0062/min逐 token
gpt-4o-transcribe-diarizeOpenAI按 tokentoken 费率逐 token
chirp-2Google按分钟$0.016/min
chirp-3Google按分钟$0.016/min

每个模型页面都会显示实时标价。gpt-4o 两个模型的 ≈$/min 数字来自我们通过网关对多语言测试音频的实际账单,详见七模型转录测试。上表中的 batch 模型都可以使用同一个 API key,通过兼容 OpenAI 的 /v1/audio/transcriptions 端点调用;我们也确认 diarize 模型支持该端点。名称带 -realtime 的版本属于 streaming 模型,使用独立接口,具体说明见各模型页面。

按 token 计费如何换算成每分钟成本?

按 token 计费的转录成本取决于语音内容,而不是文件大小,实际价格通常位于中间档位。gpt-4o 转录模型会在 token 化前对音频重采样,因此,相同内容使用高码率的 320 kbps MP3 或精简的 16 kHz WAV,成本基本相同。压缩文件只能节省存储,无法降低转录费用。对于正常语速的音频,我们测得 gpt-4o-mini-transcribe 约为 $0.0031/min,gpt-4o-transcribe 约为 $0.0062/min;语音更密集或静音更多时,成本会略有升降。如果预算需要严格限定每小时音频的最高成本,应选择按分钟计费的模型;按 token 计费只能给出预估。

什么是中国 ASR 档位?为什么多数对比没有覆盖?

表格中价格最低、streaming 模型最多的一组来自中国 ASR,但大多数英文评测从未测试过这些模型。ByteDance 的 seed-asr-bigmodel 价格最低,为 $0.002/min。Alibaba 提供三个系列:以 streaming 为主的 paraformer;包含 batch、flash、多语言 mtl 和 realtime 版本的 fun-asr;以及提供 flash 和 flash-realtime 版本的 qwen3-asr。这些模型的价格均为 $0.002-$0.0021/min,相当于 whisper-1 的三分之一、Chirp 的八分之一。

我们的实测也发现了两点限制。第一,seed-asr 需要提前指定音频语言。如果已知语言,它最划算;如果语言未知,qwen3-asr-flash 以 $0.0021 的价格成为测试中能自动识别所有语言的最便宜模型。第二,便宜不等于慢:qwen3-asr-flash 处理测试片段约需 3 秒,与 OpenAI 模型相当。对于以普通话为主的工作负载,这一档位不仅更便宜,也更适合本地语言场景。

应该为工作负载选择哪个模型?

先按计费方式和 streaming 需求筛选。对于清晰语音,准确率不足以区分这些模型。可按场景选择:

场景选择原因
Batch 转录,语言已知seed-asr-bigmodel最低 $0.002/min;需要指定语言
Batch,语言混合或未知qwen3-asr-flash支持自动检测的最便宜模型,延迟约 3 秒
实时字幕/听写paraformer-realtime-v2qwen3-asr-flash-realtime以最低档 $0.002 提供 streaming
通过 OpenAI 接口逐步输出文本gpt-4o-mini-transcribe逐 token 输出,约 ≈$0.0031/min
需要说话人标签gpt-4o-transcribe-diarize这组模型中唯一支持说话人分离的模型
直接替换 whisperwhisper-1兼容性基准,价格为 $0.006/min

如果任务是双向语音对话而非转录,就属于另一类产品,成本结构也不同。语音到语音的费用可参考我们的 GPT Realtime 定价测试

常见问题

Whisper API 多少钱?

whisper-1 的标价为每分钟音频 $0.006,只按时长计费;无论格式或码率如何,一小时音频都是 $0.36。重复提交没有折扣:我们将同一段音频发送了五次,每次费用都相同。目前表中已有一半模型比它便宜:中国 ASR 的价格为 $0.002-$0.0021/min,只有 whisper 的三分之一;gpt-4o-mini-transcribe 的实测成本约为其一半。

更贵的语音转文字模型更准确吗?

对于清晰语音,不是。在我们的七模型测试中,所有支持相应语言的模型在英语、西班牙语和法语上的错误率都约为 0%。真正需要考虑的是成本、streaming、语言覆盖范围,以及说话人分离等功能。遇到口音、噪声或语言切换等复杂音频时,应使用自己的样本测试。转录测试 展示了模型最先在哪些语言上出现问题;在我们的测试中,是普通话和印地语。

哪些语音转文字 API 支持 streaming?

目前有两种形式。gpt-4o 转录模型通过 OpenAI API 接口逐 token 输出文本。Alibaba 的 realtime 系列(paraformer-realtime-v2、qwen3-asr-flash-realtime、fun-asr-realtime)按分钟计费,价格从 $0.002/min 起。whisper-1、seed-asr 和 Chirp 系列只返回完整转录结果。

全部 14 个模型都可以通过同一个网关端点调用,并统一计费。每个模型的当前标价见实时更新的模型页面;包含延迟和准确率数据的七模型实测对比见转录成本测试

← 返回博客