语音智能体 API 成本:10 分钟通话需 $0.04 到 $0.57
目录
一通 10 分钟的语音智能体对话,API 费用在 $0.04 到 $0.57 之间。差距几乎完全取决于两个选择:自行组装技术栈,还是使用端到端语音 API;以及选择哪一档文字转语音服务。我们通过同一个网关、在同一批次中测量了每个环节:3 个语音转文字模型按音频分钟计费,6 个文字转语音模型按实际合成的音频分钟计费,3 个 LLM(2 个 flash 档、1 个前沿档)完成 8 轮对话,以及一个按通道计费的实时 GPT Realtime 会话。本文将这些环节组合起来,算出每种架构每分钟的价格。
TL;DR
- 级联技术栈(STT + LLM + TTS)每对话分钟需要 $0.0037 到 $0.025;gpt-realtime-2.1 实测为 $0.057,mini 版为 $0.016,落在级联方案的价格区间内。
- 使用 flash 档大脑时,嘴比大脑贵,主流配置中相差 12 倍;换成前沿档大脑后,成本结构会反转。
- Realtime 的溢价主要换来低延迟:实测端到端语音延迟为 1.7-2.1 秒,级联方案则为 4.9-7.7 秒。
- TTS 按字符计费,因此在所有实测模型中,每音频分钟的中文语音都比英文便宜 3 到 7 倍。
语音智能体如何工作?为什么有两种架构?
语音智能体会把用户说的话转换成语音回复。市面上的所有方案基本都属于两种架构之一。级联架构依次串联 3 个专用 API:语音活动检测器判断用户是否说完,语音转文字服务将话语转写成文本,LLM 根据转写结果和对话历史生成回复,文字转语音服务再把回复合成为音频。每个环节都是独立计费的服务,因此级联方案既便宜又容易替换组件:STT、大脑和声音都可以独立选择,费用也分成 3 笔小账单。
端到端语音(Realtime)架构用一个模型取代上述 3 个环节。模型通过 WebSocket 直接接收和生成音频。(Synthorai 原生支持这种连接方式:网关在 /v1/realtime 提供 WebSocket 接入,现有的 OpenAI Realtime SDK 无需改动、指向我们的端点即可使用,详见 Realtime API 文档。本文所有 Realtime 会话都通过这条连接完成。)主流程中没有转写步骤,模型听到的是语气和节奏,而不是文本记录。对话历史以音频 token 的形式保存在服务端,并在每次响应时重新发送给模型。这种设计实现了级联架构天然无法提供的两项能力:低于 2 秒的端到端语音延迟,以及自然的插话处理能力(用户可以在模型说到一半时打断,模型也能直接听到)。计费方式也随之改变:不再是 3 个固定计量项,而是分别按音频输入和音频输出费率计费,也就是不同的“通道”;此外,对话历史会持续累积并重复计费,必须依靠缓存控制成本。
下文将分别计算这两种架构的价格:先按各自的计量方式计算每个级联环节,再逐通道计算 Realtime 循环。
语音智能体每分钟要花多少钱?
我们测算的 6 种配置,每对话分钟成本在 $0.0037 到 $0.057 之间,相差 15 倍。下文必须区分两个单位:对话分钟指通话实际持续 1 分钟;音频分钟指一方实际说话 1 分钟,也是 STT 和 TTS 的计费单位。所有方案采用同一场景:用户和智能体各占一半说话时间,每分钟交流 4 轮,话语长度接近简短的客服对话。级联环节按实测音频时长和 token 数量计费;Realtime 数据则来自一个实时的 8 轮会话:
| 配置 | 聆听 | 说话 | 大脑 | $/对话分钟 | 10 分钟通话 |
|---|---|---|---|---|---|
| 经济型级联(qwen3-asr-flash + deepseek-v4-flash-0731 + google-tts-standard) | $0.0010 | $0.0020 | $0.0006 | $0.0037 | $0.04 |
| 主流级联(gpt-4o-mini-transcribe + deepseek + tts-1) | $0.0015 | $0.0076 | $0.0006 | $0.0097 | $0.10 |
| 端到端语音,gpt-realtime-2.1-mini | — | — | — | $0.0159 | $0.16 |
| 顶级大脑级联(gpt-4o-mini-transcribe + gpt-5.6 + tts-1) | $0.0015 | $0.0076 | $0.0110 | $0.0200 | $0.20 |
| 高端级联(whisper-1 + gemini-3.7-flash + google-tts-chirp3-hd) | $0.0030 | $0.0172 | $0.0050 | $0.0252 | $0.25 |
| 端到端语音,gpt-realtime-2.1 | — | — | — | $0.0573 | $0.57 |
比两端价格更值得关注的是中间两个位置。旗舰 Realtime API 的成本甚至是高端级联方案的 2.3 倍。因此,这笔溢价买到的并非同等质量,而是级联方案无法提供的能力:本次会话中约 2 秒的端到端语音延迟、原生插话,以及不会因为音频先转成文字而丢失的语气和节奏(韵律)。mini 版则落在主流与高端级联方案之间。所以,“级联还是 Realtime”只有在旗舰档才是真正的价格比较;到了 mini 档,选择取决于延迟和控制能力,而不是价格。
另外需要做一个公平性校验,因为其余 3 种级联方案使用的是 flash 档大脑,而对比对象是 OpenAI 的旗舰语音模型。顶级大脑一行给级联方案配上了同一家供应商的前沿文本模型 gpt-5.6,价格为每百万 token 输入 $5、输出 $30。即便如此,级联方案每对话分钟也只有 $0.0200,只有旗舰 Realtime 的约三分之一。原因是即便采用前沿模型的价格,一轮文本对话所需的高价 token 数量仍比音频通道少两个数量级。对齐质量后,大脑每分钟会增加 $0.010,但仍不足以填平两种架构的成本差距。
级联方案中哪个环节最贵?
只要大脑使用 flash 档模型,最贵的就是嘴。在主流配置中,每对话分钟的 TTS 成本为 $0.0076,LLM 只有 $0.0006,相差 12 倍;即便在经济型配置中,说话环节的成本也是大脑的 3 倍。将大脑升级到 gpt-5.6 后,成本结构就会反转:每轮对话需要 $0.00274,大脑每分钟成本升至 $0.0110,成为最大开销,是 tts-1 说话环节的 1.4 倍。使用 flash 大脑时,语音智能体的成本主要在嘴;使用前沿大脑时,则主要在大脑。语音转文字位于两者之间,每对话分钟为 $0.0010 到 $0.0030(来自我们对 14 个模型的每分钟价格测试,并在本批次中再次验证:qwen3-asr-flash 每音频分钟 $0.00198,gpt-4o-mini-transcribe 为 $0.00294,whisper-1 为 $0.006)。
在推理介入之前,大脑几乎不花钱。我们让 deepseek-v4-flash-0731 完成了 8 轮客服对话,稳定后每轮约有 310 个输入 token 和 71 个输出 token,每轮成本为 $0.00016。gemini-3.7-flash 完成同一段对话时,每轮需要 $0.00126,贵了 8 倍。token 明细直接说明了原因:它每轮会花费 89 到 361 个推理 token,思考如何生成只有两句话的回复。Gemini 3.7 Flash 无法关闭思考,因此基于它构建的语音智能体每轮对话都要支付推理成本。对于可以关闭推理的模型,语音对话正是适合安全关闭推理的单步任务。
文字转语音每音频分钟要花多少钱?
每合成 1 分钟音频需要 $0.004 到 $0.034,相差 8.4 倍,而按字符标出的价格无法直接体现这个差距。下列所有模型都按输入字符计费,因此我们分别合成固定的英文和中文文本,测量返回音频的时长,再据此计算:
| 模型 | 标价 | 英文 $/音频分钟 | 中文 $/音频分钟 | 中文与英文之比 |
|---|---|---|---|---|
| google-tts-standard | $4/M 字符 | $0.0041 | $0.0007 | 0.18x |
| qwen3-tts-instruct-flash | $11.5/M | $0.0098 | $0.0033 | 0.34x |
| tts-1 | $15/M | $0.0151 | $0.0043 | 0.28x |
| google-tts-neural2 | $16/M | $0.0162 | $0.0030 | 0.18x |
| tts-1-hd | $30/M | $0.0303 | $0.0085 | 0.28x |
| google-tts-chirp3-hd | $30/M | $0.0344 | $0.0052 | 0.15x |
语速是隐藏变量。tts-1-hd 和 chirp3-hd 的标价同为 $30,但 chirp3-hd 用更短的音频读完了我们的英文文本,因此按音频分钟计算反而贵 13%;在表格另一端,google-tts-standard 每合成 1 分钟音频的价格还不到其他实测模型的一半。标价只能给模型排序;要计算实际成本,必须看每音频分钟的费率。
中文一栏的差距之大超出了我们的预期:口语中文每分钟需要计费的字符数只有英文的 1/3 到 1/7,因为每个汉字承载的语音信息更多。按字符计费时,中文语音智能体的说话环节比同一款英文智能体便宜 66% 到 85%。再加上文本侧不同语言的 token 成本差异,整体差距还会进一步扩大。
Realtime API 什么时候值得使用?
当 2 秒的端到端语音延迟和原生插话能力能够产生足够价值时。单看价格,旗舰 Realtime 比我们构建的所有级联方案都贵。本批次再次精确复现了官方的两项音频换算规则:30.0 秒输入音频计为 300 个 token(每 100 ms 计 1 个 token),3.7 秒输出音频计为 74 个 token(每 50 ms 计 1 个 token),与我们 7 月的研究结果一致。按 gpt-realtime-2.1 的标价计算,仅聆听每分钟就需要 $0.0192,说话每分钟需要 $0.0768;这还没有算上对话历史的重复计费,后者会让长会话的成本不断累积。
实际累积速度没有看上去那么快,原因在于缓存。在我们的 8 轮会话中,每次响应的输入从 72 个 token 增长到 643 个,但到第 8 轮时,其中 512 个走的是每百万 token $0.40 的缓存价格。整个会话中,76% 的输入 token 按缓存费率计费。实测总成本为 $0.0752,对话时长 1.31 分钟,即每对话分钟 $0.0573。各通道的费用分布也值得拆开看:66% 来自音频输出,17% 来自未缓存的音频输入,16% 来自文本。原因是模型还会为每条回复生成文本版本,并按每百万文本输出 token $24 计费。也就是说,一张“端到端语音”账单中约有六分之一实际上是文本模型的费用。把同一组实测 token 数据套用到 mini 版的费率后,结果为 $0.0159。这个数字更有意义:它比高端级联方案便宜,同时保留了级联架构无法提供的低延迟和插话能力。
Realtime 还有一项运营层面的成本,而不是按 token 收取的费用:会话会在 60 分钟时强制结束,而且无法带着音频历史恢复。任何超过这个边界的对话都必须以冷缓存重新开始。7 月的研究详细介绍了这些机制。
端到端语音比级联方案快多少?
在上述配置中快 2.3 到 4.5 倍,而且级联方案越复杂,差距越大。下图采用与成本表相同的 6 种配置,每个柱形都表示一轮对话。测量场景也贴近真实使用:输入一段 5 秒话语,输出两句话的回复;级联柱形由各环节 3 次运行的中位数相加而成:
具体来看,级联方案每轮合计需要 4.9 秒(经济型)、5.6 秒(主流)、5.7 秒(顶级大脑)和 7.7 秒(高端)。两种端到端语音方案都维持在相同区间:gpt-realtime-2.1-mini 在 4 轮实时对话中为 1.6-2.1 秒,gpt-realtime-2.1 在 8 轮中为 1.7-2.1 秒。
把延迟图和成本表放在一起看,取舍就很清楚了:在级联方案中,价格和延迟朝相反方向变化。经济型配置既是最便宜的,也是最快的级联方案;高端配置的价格是经济型的 6.8 倍,却慢了 2.8 秒,因为昂贵的组件(需要推理的大脑、HD 声音)同时也是较慢的组件。在端到端语音方案中,无论档位如何,两种模型都维持在 2 秒左右。因此,mini 版既比其中两种级联方案便宜,也比全部 4 种级联方案更快。
这些数据还能说明 3 点。第一,LLM 是所有级联方案的延迟瓶颈,强制推理会使其延迟接近翻倍:gemini-3.7-flash 为生成两句话花了 4.5 秒进行推理,deepseek 只需 2.6 秒,gpt-5.6 为 2.7 秒。因此,同一项推理成本不仅让 token 费用增加到 8 倍,也让高端配置的延迟排在最后。第二,即便为每个环节挑选实测最快的组件(gpt-4o-mini-transcribe、deepseek、google-tts-standard),最低也要 4.1 秒,仍超过 Realtime 区间的两倍,而且尚未计入语音活动检测器等待用户结束说话的时间和音频播放时间。第三,级联方案的耗时是顺序累加的完整响应时间,每一步都等上一步全部返回才开始:生产环境可以把 LLM 的 streaming 输出接入支持 streaming 的 TTS,让两个最慢的环节重叠执行,从而缩小大部分差距。但这需要自行开发和调优;Realtime API 只要建立第一个 WebSocket 会话,就能得到约 2 秒的延迟。
一轮级联对话的时间究竟花在哪里?主要花在 3 次请求本身,而不是处理的内容。纯网络耗时只占很小一部分:到 API 边缘节点的一次热 HTTPS 往返约为 0.09 秒,所以 3 个串行环节每轮合计约有 0.3 秒的纯网络时间;连接为冷启动时,还要额外增加 0.2 秒的 TLS 握手。主要成本是每次请求固定的调度开销。为了单独测量这部分,我们用近乎空的 payload 重新运行了最快组合的各个环节:LLM 只回复 1 个 token 仍需 2.5 秒,半秒音频仍需 1.6 秒完成转写,合成两个词也要 0.4 秒。这些最低耗时合计为 4.4 秒,而完整 payload 的实测值为 4.1 秒,两者在测量误差范围内基本相同。换言之,级联对话的时间几乎全是单次请求开销,实际内容(回复 70 个 token 而不是 1 个、音频长度增加到 10 倍)基本可以顺带处理,不会显著增加延迟。这一结论有两面:缩短级联方案的回复并不会让它更快;但凡能减少请求或让请求重叠执行的手段(让各环节通过 streaming 相互衔接、复用持久连接),都能直接减少真正的开销。Realtime API 正是这一思路的极致形态:始终保持一个 socket,因此每轮都不需要重新走完整的请求周期。
常见问题
运行语音智能体最便宜的方式是什么?
使用经济型级联方案:qwen3-asr-flash 负责聆听,deepseek-v4-flash-0731 作为大脑,google-tts-standard 负责说话。每对话分钟成本为 $0.0037,一通 10 分钟电话约为 $0.04。它比旗舰端到端语音方案便宜 15 倍,代价是更高的端到端语音延迟,以及不够自然的插话处理能力。
GPT Realtime 比级联技术栈贵吗?
旗舰版更贵:gpt-realtime-2.1 实测每对话分钟为 $0.0573,是高端级联方案的 2.3 倍,也是经济型方案的 15 倍。gpt-realtime-2.1-mini 则不是:采用相同 token 数据计算时,每对话分钟为 $0.0159,位于主流和高端级联方案之间。因此,在 mini 档,选择取决于延迟和控制能力,而不是价格。
语音智能体哪个部分最贵?
在我们测试的所有 flash 大脑级联方案中,文字转语音最贵:每对话分钟为 $0.002 到 $0.017,而 flash LLM 为 $0.0006 到 $0.005;主流配置中相差 12 倍。换成前沿大脑后,结构会反转:gpt-5.6 每分钟需要 $0.0110,高于 tts-1 的 $0.0076。在 TTS 内部,不同模型每音频分钟的成本相差 8.4 倍,是实测影响最大的单项选择。
对话语言会影响成本吗?
对说话环节影响很大:由于按字符计费,在全部 6 个实测 TTS 模型中,每分钟中文语音都比英文便宜 3 到 7 倍,因为每个汉字承载的语音信息更多。我们再次验证的 3 个语音转文字模型在两种语言上的费率不变,文本侧的差异则取决于不同语言的 tokenizer 成本差距。
数据于 2026-08-17 通过 Synthorai 网关在同一批次中测得:6 个 TTS 模型分别合成固定的英文和中文文本,并从返回文件中读取音频时长(各运行 2 次);3 个 STT 模型使用标准测试音频,根据计费 header 计算每分钟成本;3 个 LLM 大脑(2 个 flash 档、1 个前沿档)完成预先编排的 8 轮客服对话,并记录每轮用量;逐环节延迟测试包括 5 秒话语输入 STT、稳定状态下的一轮 LLM 对话、两句话的回复输入 TTS(n=3,等待完整响应),同一组环节还进行了最小 payload 的耗时下限测试,包括 1 个 token 的回复、半秒音频和两个词的语音合成(n=3),同时测量到 API 边缘节点的热连接和冷连接往返时间;GPT Realtime 实时会话使用 5 秒话语,旗舰版进行 8 轮,mini 版进行 4 轮,并根据 response.done 用量事件逐通道计费。mini 版成本是将旗舰会话的实测 token 数据套用到 mini 标价后得出,其延迟区间则来自 mini 自身的会话。级联组合假设用户和智能体各占一半说话时间,每分钟交流 4 轮;所有费率均为测量时模型目录中的标价。seed-tts-2.0 已接入,但在获得稳定测量结果前暂不纳入。价格和语速都会变化,确定架构前请重新测量。
同系列文章:14 个语音转文字模型的价格对比、GPT Realtime 计费机制、图像输入 token 成本、视频生成价格。