新人 免费注册,送 10 次调用,最高 $1,免绑卡。
AI API 计费单位:从 token 到 PTU-hour 的 17 种计量方式

AI API 计费单位:从 token 到 PTU-hour 的 17 种计量方式

目录
  1. AI API 使用哪些计费单位?
  2. 哪些单位用于计算实际用量?
  3. 哪些单位按时间或容量收费?
  4. 哪些因素只改变费率,不改变单位?
  5. 额度和 CCU 是什么?
  6. 哪些取整规则和最低计费最容易出问题?
  7. 如何跨单位比较成本?
  8. Gateway 如何统一这些计费单位
  9. FAQ

AI API 至少使用 17 种不同的计费单位:文本 token、推理 token、缓存 token、媒体输入 token、实时音频 token、字符、媒体分钟数和秒数、输出对象、请求、页数、GPU-second、容器小时、GB-day、token-hour、PTU-hour、训练 token,以及额度/CCU 这类合成计费单位。只要产品涉及多种模态,成本估算就必须在其中几种单位之间换算,而预算往往就错在换算规则上。本文汇总了每种单位的计量方式,以及对应的常见陷阱。

TL;DR

  • AI API 至少使用 17 种不同的计费单位,分布在四层:用量、时间与容量、费率修正项,以及合成计费单位。
  • 一分钟音频有两种计费方式:专用语音转文字模型按音频分钟收费,每分钟 $0.0020 到 $0.0164;gpt-realtime-2.1 则按每听取 100 ms 计 1 个音频 token。
  • 仅存储就有两套计量方式:OpenAI file search 按 $0.10 每 GB-day 收费;Gemini 上下文缓存按每百万 token 每小时 $0.50 收费。
  • 修正项改变的是费率,而不是单位:batch 价格减半,DeepSeek 非高峰时段再减半,将 Claude 推理固定在美国区域则按 1.1x 收费。

AI API 使用哪些计费单位?

共 17 种,顺序与下文章节一致:用量单位(1 到 10)、时间与容量单位(11 到 16)、合成计费单位(17),外加一层只改变费率、不改变单位的修正项。下表可作为索引,每一行都链接到对应的详细说明。

AI API 计费单位全景图:从文本 token 到页数的十种用量单位,从 GPU-second 到训练 token 的六种时间与容量单位,以额度和 CCU 表示的合成计费单位,以及从 batch 折扣到免费额度断崖的费率修正项侧栏

#单位使用场景容易踩的坑
1文本 token所有对话 API相同文本经过不同 tokenizer,计数也不同;新一代 tokenizer 比上一代多产出约 30% 的 token
2推理 token思考模型看不到的输出照样收费;某些回答中推理 token 占 88% 到 99.3%
3缓存 tokenPrompt caching写入溢价取决于 TTL,读取享受折扣,而且各提供商有不同的最低缓存要求
4媒体输入 token视觉、音频、PDF 输入同一张图片有三种换算方案;PDF 按图片费率计费
5实时音频 token语音到语音每听取 100 ms 计 1 个 token,每输出 50 ms 计 1 个 token
6字符TTS、安全护栏按音频分钟计算,中文语音成本只有英语的 1/3 到 1/7
7媒体分钟数/秒数语音转文字、视频和音乐生成准确率接近的模型,每音频分钟价格最多相差 8 倍
8输出对象图片生成、人工评测分辨率相同,仅调整质量参数就能让单张图片的价格相差 36 倍
9请求Web search、grounding、file search每次搜索 $0.01,另收注入 token 的费用,token 按模型输入费率计算
10页数OCR、文档 AIMistral 按每 1,000 页收费,还可叠加 batch 和缓存折扣
11GPU-secondServerless 模型托管费率取决于显卡型号,从 $0.000225/s(T4)到 $0.001525/s(H100)
12容器小时/会话小时代码执行、托管 agent最低计费 5 分钟,请求中预载文件也会产生费用,即使工具从未运行
13GB-day文件和向量存储免费 1 GB 用完后,每 GB-day 收费 $0.10
14Token-hour上下文缓存存储Gemini 每百万 token 每小时收费 $0.50,2027 年翻倍
15PTU/模型单元小时预置容量缓存 token 不消耗容量;输出 token 的权重高于输入 token
16训练 tokenFine-tuningEpoch 数会成倍放大账单;部分模型改为每小时 $100
17额度/CCUMarketplace、订阅在真实价目表上套一层换算系数;AWS Marketplace 中 100 CCU = $1.00

哪些单位用于计算实际用量?

17 种单位中有 10 种属于用量单位:只要使用服务,计量就会走表,而且不同模态选择了不同的计量对象。

Token 系列(单位 1 到 5)。 文本 token 是基础,但并不是统一单位。不同模型系列使用不同 tokenizer,因此同一段文本的计费数量也不同。Anthropic 文档显示,其 4.7 及后续版本使用的 tokenizer,相比上一代处理相同文本时会产生约 30% 更多的 token。推理 token 属于输出 token,但通常不会展示给用户。我们测得一个只有 10 个 token 的答案被计费 81 个 token,其中 88% 是推理 token。缓存 token 的价格取决于操作类型和缓存生命周期(TTL):Claude API 的5 分钟缓存写入按基础输入价格的 1.25x 计费,1 小时写入按 2x 计费,读取则按 0.1x 计费。媒体输入按提供商各自的公式换算为 token:同一张 1024x1024 图片,在 GPT-5.6、Gemini 和 Claude 上分别计为 693、1,089 和 1,372 个 token。Gemini 对音频按每秒 25 个 token、720p 视频按每秒 5,792 个 token计费,PDF 则套用图片 token 费率。实时语音使用单独的 token:gpt-realtime-2.1用户语音每 100 ms 精确计 1 个音频 token,模型语音每 50 ms 计 1 个音频 token

字符和时长(单位 6 和 7)。 文本转语音(TTS)按字符收费,OpenAI 的标价为每百万字符 $15 到 $30。因此,按音频分钟计算,中文语音成本只有英语的 1/3 到 1/7:相同的说话时长,中文使用的字符更少。Bedrock 的安全护栏定义了自己的字符单位,即最多包含 1,000 个字符的“文本单位”。专用语音转文字模型按音频分钟收费,我们测量的各模型价格为每分钟 $0.0020 到 $0.0164;视频生成按分辨率和秒数收费;Gemini 的音乐生成则按歌曲收费。

对象、请求和页数(单位 8 到 10)。 图片生成可以按图片档位收费,也可以按输出 token 收费,两种模式存在成本交叉点:输出低于约 1,000 个 token 时,按 token 更划算;超过后,按单张图片固定收费更划算。服务端工具按请求收费:我们测量的三个平台中,Web search 都是每次搜索 $0.01,返回结果还会再次按输入 token 计费,每次搜索为 1,500 到 3,100 个 token。Gemini 的搜索 grounding 允许模型在请求处理中查询 Google Search,并采用阶梯额度:每月前 5,000 次请求免费,之后每 1,000 次 $14。OCR 按页收费。Bedrock 的模型评测按每项已完成的人工任务 $0.21收费,这是这套计费体系中唯一以人工任务为单位的项目。

哪些单位按时间或容量收费?

有 6 种单位按资源占用计费,无论是否有 token 流经系统。这一层最容易导致成本估算失准,因为即使代码什么都没做,计量器仍可能继续运行。

哪些因素只改变费率,不改变单位?

有 7 类因素会改变单位价格,但不会改变单位本身:batch 档位、服务档位、时段、上下文长度、地域、质量参数和免费额度。如果计费代码为每个模型只保存一个价格,这 7 类情况都会算错,因为同一个 token 的价格取决于处理方式、处理时间和处理地点。

修正项影响示例
Batch 档位输入和输出均打 5 折AnthropicOpenAI 的 batch API;Mistral OCR 也一样
服务档位更快服务需要溢价OpenAI fast 档位为标准费率的 2x;flex 档位有折扣
时段非高峰折扣DeepSeek:非高峰费率是高峰费率的一半;工作日 UTC 01:00-04:00 和 06:00-10:00 为高峰时段
上下文长度超过阈值后费率跳档Gemini 在 prompt token 超过 200k 后提高费率;Claude 4.6+ 在完整 1M 上下文窗口内采用统一费率
地域数据驻留溢价Claude inference_geo: "us"每类 token 都按 1.1x 收费;Bedrock 和 Google Cloud 上 Claude 模型的区域端点比全球端点贵 10%
质量参数单位相同,用量不同对一张 1024x1024 图片,gpt-image 的质量设置可使计费 token 从 196 增至 7,024
免费额度超过阈值后费率突变Grounding:每月 5,000 次免费请求;代码执行:每月 1,550 个免费小时

这些倍率可以叠加。Anthropic 文档说明,缓存倍率可同时叠加 batch 折扣和数据驻留溢价,因此一个经过缓存、batch 处理并固定在美国区域的 token,会同时应用三个系数。

额度和 CCU 是什么?

它们是在真实计量单位外再封装一层的合成计费单位,用于将账单统一为一个项目。Claude 通过 AWS 或 Azure Marketplace 计费时,先按正常单位费率将用量折算为美元,再按每美元 100 个 Claude Consumption Units 转换为 CCU。折扣体现为计量的 CCU 更少,而不是 CCU 单价降低。订阅产品也会用额度完成类似换算,而且同一家公司的不同产品线也可能采用不同边界:ElevenLabs 的订阅套餐以额度计量,但明确说明 API 用量以美元而非额度计费。看到合成计费单位时,需要确认底层对应的是哪种用量或容量单位,以及具体换算率。

哪些取整规则和最低计费最容易出问题?

这些是各类量化规则。它们散落在不同文档中,这里统一列出:

如何跨单位比较成本?

统一换算为每次用户交互的美元成本,因为这是所有计量单位都能转换成的共同单位。

一次语音通话的流程图:级联系统分别按音频分钟计算语音转文字费用、按 token 计算 LLM 费用、按字符计算文本转语音费用,每分钟对话总计 $0.0037 到 $0.025;实时系统只按音频 token 计费,成本为 $0.016 到 $0.057

我们对语音 agent 的研究采用了这种方法:级联系统分别以音频分钟(语音转文字)、token(LLM)和字符(TTS)计费,每分钟对话成本为 $0.0037 到 $0.025,而 gpt-realtime-2.1 为 $0.057,其 mini 版本为 $0.016。这样就能用同一个数字衡量实时模式的溢价和低延迟收益。这套方法适用于所有场景:先定义一次交互,例如一张支持工单、一份文档或一分钟对话;再按每个环节的原生单位计量,并套用当前费率;最后再比较。直接拿 $/1M token 与 $/音频分钟比较,是把不同类别混为一谈。换算成 $/交互后,才是可比较的算术问题。

Gateway 如何统一这些计费单位

Synthorai 的做法是在请求处理时完成计价,同时保留原生单位和美元金额。每个请求都会生成一条用量记录,其中包含原生计量值(按类别拆分的 token、秒数、字符数、请求数)、实际采用的价格版本,以及最终计算出的成本。这样,任何账单项目都能还原成单位乘以费率。CCU 在 Marketplace 边界执行的也是同类换算,只是 Synthorai 会对每条记录单独计算,并保留可审计信息。它也能与零保留模式配合:用量记录只需要计量值和内容哈希,不需要保存 payload。上游价格发生变化时,价格版本会固定每条历史记录所采用的价目表,因此月末对账可以按记录审计,而不必争论当时到底用了哪个价格。

FAQ

音频 token 和文本 token 是同一种单位吗?

不是。实时音频 token 是独立计量单位,也有独立费率。在 gpt-realtime-2.1 中,听取 100 ms 语音或输出 50 ms 语音各计 1 个 token,折算后每分钟听取成本为 $0.0192,每分钟输出成本为 $0.0768。即使在同一个模型中,音频和文本也使用不同的价目表。

为什么同一张图片在不同提供商处计出的 token 数不同?

因为换算方案不同,而不是图片发生了变化。目前同时存在图块公式、带上限的分块计费和固定费用等方案。同一张 1024x1024 图片在 GPT-5.6、Gemini 和 Claude 上分别计为 693、1,089 和 1,372 个 token,而且更改文件格式或图片内容都不会使计数发生任何变化。

缓存 token 算输入 token 吗?

它们单独计量,并按操作类型定价:缓存写入相对基础输入有溢价,在 Claude API 上按 TTL 分别为 1.25x 或 2x;读取则按 0.1x 折扣计费。对预置容量而言,这一区别会产生双重影响:缓存 token 不消耗 PTU 容量,因此缓存既能降低账单,也能减少必须预留的容量。

语音按字符还是按分钟收费更便宜?

取决于语言。按字符计费的 TTS 使中文语音按音频分钟计算的成本只有英语的 1/3 到 1/7,因为中文用更少的字符承载同样的说话时长;按分钟计费则与语言无关。对于语音转文字,我们测量的模型在干净语音上的准确率接近,而价格为每音频分钟 $0.0020 到 $0.0164

单位定义和费率来自 2026-08-30 获取的各提供商定价页面,以及文中链接的实测研究。价格变化很快,单位结构相对稳定,但在把任何数字写入计费代码前,仍应核对链接中的原始来源。

相关实测研究:token 构成prompt caching缓存最低要求图片输入 token图片生成语音转文字语音转文字 API实时语音视频生成Web search语音 agenttokenizer不同语言的成本

← 返回博客