AI API 计费单位:从 token 到 PTU-hour 的 17 种计量方式
目录
AI API 至少使用 17 种不同的计费单位:文本 token、推理 token、缓存 token、媒体输入 token、实时音频 token、字符、媒体分钟数和秒数、输出对象、请求、页数、GPU-second、容器小时、GB-day、token-hour、PTU-hour、训练 token,以及额度/CCU 这类合成计费单位。只要产品涉及多种模态,成本估算就必须在其中几种单位之间换算,而预算往往就错在换算规则上。本文汇总了每种单位的计量方式,以及对应的常见陷阱。
TL;DR
- AI API 至少使用 17 种不同的计费单位,分布在四层:用量、时间与容量、费率修正项,以及合成计费单位。
- 一分钟音频有两种计费方式:专用语音转文字模型按音频分钟收费,每分钟 $0.0020 到 $0.0164;gpt-realtime-2.1 则按每听取 100 ms 计 1 个音频 token。
- 仅存储就有两套计量方式:OpenAI file search 按 $0.10 每 GB-day 收费;Gemini 上下文缓存按每百万 token 每小时 $0.50 收费。
- 修正项改变的是费率,而不是单位:batch 价格减半,DeepSeek 非高峰时段再减半,将 Claude 推理固定在美国区域则按 1.1x 收费。
AI API 使用哪些计费单位?
共 17 种,顺序与下文章节一致:用量单位(1 到 10)、时间与容量单位(11 到 16)、合成计费单位(17),外加一层只改变费率、不改变单位的修正项。下表可作为索引,每一行都链接到对应的详细说明。
| # | 单位 | 使用场景 | 容易踩的坑 |
|---|---|---|---|
| 1 | 文本 token | 所有对话 API | 相同文本经过不同 tokenizer,计数也不同;新一代 tokenizer 比上一代多产出约 30% 的 token |
| 2 | 推理 token | 思考模型 | 看不到的输出照样收费;某些回答中推理 token 占 88% 到 99.3% |
| 3 | 缓存 token | Prompt caching | 写入溢价取决于 TTL,读取享受折扣,而且各提供商有不同的最低缓存要求 |
| 4 | 媒体输入 token | 视觉、音频、PDF 输入 | 同一张图片有三种换算方案;PDF 按图片费率计费 |
| 5 | 实时音频 token | 语音到语音 | 每听取 100 ms 计 1 个 token,每输出 50 ms 计 1 个 token |
| 6 | 字符 | TTS、安全护栏 | 按音频分钟计算,中文语音成本只有英语的 1/3 到 1/7 |
| 7 | 媒体分钟数/秒数 | 语音转文字、视频和音乐生成 | 准确率接近的模型,每音频分钟价格最多相差 8 倍 |
| 8 | 输出对象 | 图片生成、人工评测 | 分辨率相同,仅调整质量参数就能让单张图片的价格相差 36 倍 |
| 9 | 请求 | Web search、grounding、file search | 每次搜索 $0.01,另收注入 token 的费用,token 按模型输入费率计算 |
| 10 | 页数 | OCR、文档 AI | Mistral 按每 1,000 页收费,还可叠加 batch 和缓存折扣 |
| 11 | GPU-second | Serverless 模型托管 | 费率取决于显卡型号,从 $0.000225/s(T4)到 $0.001525/s(H100) |
| 12 | 容器小时/会话小时 | 代码执行、托管 agent | 最低计费 5 分钟,请求中预载文件也会产生费用,即使工具从未运行 |
| 13 | GB-day | 文件和向量存储 | 免费 1 GB 用完后,每 GB-day 收费 $0.10 |
| 14 | Token-hour | 上下文缓存存储 | Gemini 每百万 token 每小时收费 $0.50,2027 年翻倍 |
| 15 | PTU/模型单元小时 | 预置容量 | 缓存 token 不消耗容量;输出 token 的权重高于输入 token |
| 16 | 训练 token | Fine-tuning | Epoch 数会成倍放大账单;部分模型改为每小时 $100 |
| 17 | 额度/CCU | Marketplace、订阅 | 在真实价目表上套一层换算系数;AWS Marketplace 中 100 CCU = $1.00 |
哪些单位用于计算实际用量?
17 种单位中有 10 种属于用量单位:只要使用服务,计量就会走表,而且不同模态选择了不同的计量对象。
Token 系列(单位 1 到 5)。 文本 token 是基础,但并不是统一单位。不同模型系列使用不同 tokenizer,因此同一段文本的计费数量也不同。Anthropic 文档显示,其 4.7 及后续版本使用的 tokenizer,相比上一代处理相同文本时会产生约 30% 更多的 token。推理 token 属于输出 token,但通常不会展示给用户。我们测得一个只有 10 个 token 的答案被计费 81 个 token,其中 88% 是推理 token。缓存 token 的价格取决于操作类型和缓存生命周期(TTL):Claude API 的5 分钟缓存写入按基础输入价格的 1.25x 计费,1 小时写入按 2x 计费,读取则按 0.1x 计费。媒体输入按提供商各自的公式换算为 token:同一张 1024x1024 图片,在 GPT-5.6、Gemini 和 Claude 上分别计为 693、1,089 和 1,372 个 token。Gemini 对音频按每秒 25 个 token、720p 视频按每秒 5,792 个 token计费,PDF 则套用图片 token 费率。实时语音使用单独的 token:gpt-realtime-2.1 对用户语音每 100 ms 精确计 1 个音频 token,模型语音每 50 ms 计 1 个音频 token。
字符和时长(单位 6 和 7)。 文本转语音(TTS)按字符收费,OpenAI 的标价为每百万字符 $15 到 $30。因此,按音频分钟计算,中文语音成本只有英语的 1/3 到 1/7:相同的说话时长,中文使用的字符更少。Bedrock 的安全护栏定义了自己的字符单位,即最多包含 1,000 个字符的“文本单位”。专用语音转文字模型按音频分钟收费,我们测量的各模型价格为每分钟 $0.0020 到 $0.0164;视频生成按分辨率和秒数收费;Gemini 的音乐生成则按歌曲收费。
对象、请求和页数(单位 8 到 10)。 图片生成可以按图片档位收费,也可以按输出 token 收费,两种模式存在成本交叉点:输出低于约 1,000 个 token 时,按 token 更划算;超过后,按单张图片固定收费更划算。服务端工具按请求收费:我们测量的三个平台中,Web search 都是每次搜索 $0.01,返回结果还会再次按输入 token 计费,每次搜索为 1,500 到 3,100 个 token。Gemini 的搜索 grounding 允许模型在请求处理中查询 Google Search,并采用阶梯额度:每月前 5,000 次请求免费,之后每 1,000 次 $14。OCR 按页收费。Bedrock 的模型评测按每项已完成的人工任务 $0.21收费,这是这套计费体系中唯一以人工任务为单位的项目。
哪些单位按时间或容量收费?
有 6 种单位按资源占用计费,无论是否有 token 流经系统。这一层最容易导致成本估算失准,因为即使代码什么都没做,计量器仍可能继续运行。
- GPU-second。 Serverless 托管平台按硬件类型计算模型运行时间:在 Replicate 上,T4 每秒 $0.000225,H100 每秒 $0.001525。该单位计算的是显卡资源,而不是输出结果。
- 容器小时和会话小时。 Anthropic 的代码执行服务在每月 1,550 个免费小时之外,每容器小时收费 $0.05,每次执行至少计费 5 分钟;OpenAI 的 code interpreter 以 20 分钟会话为单位,并按内存容量定价,1 GB 收费 $0.03,64 GB 收费 $1.92。Claude 的托管 agent 每会话小时收费 $0.08,精确到毫秒,而且只在实际运行时计费。
- GB-day 和 token-hour。 同一种存储需求有两种计量方式。OpenAI file search 存储提供 1 GB 免费额度,超出后每 GB-day 收费 $0.10;Gemini 显式上下文缓存按存储量收费,每百万 token 每小时 $0.50,2027 年涨至 $1.00。忘记删除的缓存,相当于在不知情的情况下开了一项订阅。
- PTU-hour 和模型单元。 预置容量无论流量多少,都按单元小时收费。Azure 的预置吞吐量单位(PTU)是与模型无关的配额,但不同模型有各自的最低部署规模。输出 token 比输入 token 消耗更多容量,而缓存 token 不消耗容量,因此较高的缓存命中率能降低所需的 PTU 数量。Bedrock 也提供相同模式,称为模型单元,并要求承诺使用 1 个月或 6 个月。
- 训练 token。 Fine-tuning 按训练数据 token 数乘以 epoch 数收费,但部分服务按实际时长计费:OpenAI 的一些模型标价为每训练小时 $100。
哪些因素只改变费率,不改变单位?
有 7 类因素会改变单位价格,但不会改变单位本身:batch 档位、服务档位、时段、上下文长度、地域、质量参数和免费额度。如果计费代码为每个模型只保存一个价格,这 7 类情况都会算错,因为同一个 token 的价格取决于处理方式、处理时间和处理地点。
| 修正项 | 影响 | 示例 |
|---|---|---|
| Batch 档位 | 输入和输出均打 5 折 | Anthropic 和 OpenAI 的 batch API;Mistral OCR 也一样 |
| 服务档位 | 更快服务需要溢价 | OpenAI fast 档位为标准费率的 2x;flex 档位有折扣 |
| 时段 | 非高峰折扣 | DeepSeek:非高峰费率是高峰费率的一半;工作日 UTC 01:00-04:00 和 06:00-10:00 为高峰时段 |
| 上下文长度 | 超过阈值后费率跳档 | Gemini 在 prompt token 超过 200k 后提高费率;Claude 4.6+ 在完整 1M 上下文窗口内采用统一费率 |
| 地域 | 数据驻留溢价 | Claude inference_geo: "us" 对每类 token 都按 1.1x 收费;Bedrock 和 Google Cloud 上 Claude 模型的区域端点比全球端点贵 10% |
| 质量参数 | 单位相同,用量不同 | 对一张 1024x1024 图片,gpt-image 的质量设置可使计费 token 从 196 增至 7,024 |
| 免费额度 | 超过阈值后费率突变 | Grounding:每月 5,000 次免费请求;代码执行:每月 1,550 个免费小时 |
这些倍率可以叠加。Anthropic 文档说明,缓存倍率可同时叠加 batch 折扣和数据驻留溢价,因此一个经过缓存、batch 处理并固定在美国区域的 token,会同时应用三个系数。
额度和 CCU 是什么?
它们是在真实计量单位外再封装一层的合成计费单位,用于将账单统一为一个项目。Claude 通过 AWS 或 Azure Marketplace 计费时,先按正常单位费率将用量折算为美元,再按每美元 100 个 Claude Consumption Units 转换为 CCU。折扣体现为计量的 CCU 更少,而不是 CCU 单价降低。订阅产品也会用额度完成类似换算,而且同一家公司的不同产品线也可能采用不同边界:ElevenLabs 的订阅套餐以额度计量,但明确说明 API 用量以美元而非额度计费。看到合成计费单位时,需要确认底层对应的是哪种用量或容量单位,以及具体换算率。
哪些取整规则和最低计费最容易出问题?
这些是各类量化规则。它们散落在不同文档中,这里统一列出:
- 代码执行容器的最低计费时长为 5 分钟。只要请求包含文件,即使工具从未被调用,也会产生执行时间费用。
- Code interpreter 会话按 RAM 档位以20 分钟为一个计费区块。
- 实时语音中,每个音频 token 按听取 100 ms/输出 50 ms 量化;启用服务端语音活动检测(VAD)时,60 秒静音计费为零;模型回答开始 2 秒后取消,仍按 4 秒计费。
- 图片生成设置
n=4时,prompt 会重复计费 4 次;该接口不支持 prompt caching。 - 视频 token 公式中包含额外的 +1 帧,而且编码尺寸与标称尺寸不同:720p 按 1248x704 计费。
- Prompt cache 有各提供商自己的最低可缓存长度;低于最低长度时,既要支付写入溢价,又不会真正缓存任何内容。
- 安全护栏文本单位按每 1,000 个字符向上取整。
- 工具定义会在任何工具调用发生前按输入计费:Anthropic 的工具使用系统 prompt 会根据模型和工具选择额外增加 286 到 804 个 token,完整的计算机使用工具集则会增加约 4,500 个 token。
如何跨单位比较成本?
统一换算为每次用户交互的美元成本,因为这是所有计量单位都能转换成的共同单位。
我们对语音 agent 的研究采用了这种方法:级联系统分别以音频分钟(语音转文字)、token(LLM)和字符(TTS)计费,每分钟对话成本为 $0.0037 到 $0.025,而 gpt-realtime-2.1 为 $0.057,其 mini 版本为 $0.016。这样就能用同一个数字衡量实时模式的溢价和低延迟收益。这套方法适用于所有场景:先定义一次交互,例如一张支持工单、一份文档或一分钟对话;再按每个环节的原生单位计量,并套用当前费率;最后再比较。直接拿 $/1M token 与 $/音频分钟比较,是把不同类别混为一谈。换算成 $/交互后,才是可比较的算术问题。
Gateway 如何统一这些计费单位
Synthorai 的做法是在请求处理时完成计价,同时保留原生单位和美元金额。每个请求都会生成一条用量记录,其中包含原生计量值(按类别拆分的 token、秒数、字符数、请求数)、实际采用的价格版本,以及最终计算出的成本。这样,任何账单项目都能还原成单位乘以费率。CCU 在 Marketplace 边界执行的也是同类换算,只是 Synthorai 会对每条记录单独计算,并保留可审计信息。它也能与零保留模式配合:用量记录只需要计量值和内容哈希,不需要保存 payload。上游价格发生变化时,价格版本会固定每条历史记录所采用的价目表,因此月末对账可以按记录审计,而不必争论当时到底用了哪个价格。
FAQ
音频 token 和文本 token 是同一种单位吗?
不是。实时音频 token 是独立计量单位,也有独立费率。在 gpt-realtime-2.1 中,听取 100 ms 语音或输出 50 ms 语音各计 1 个 token,折算后每分钟听取成本为 $0.0192,每分钟输出成本为 $0.0768。即使在同一个模型中,音频和文本也使用不同的价目表。
为什么同一张图片在不同提供商处计出的 token 数不同?
因为换算方案不同,而不是图片发生了变化。目前同时存在图块公式、带上限的分块计费和固定费用等方案。同一张 1024x1024 图片在 GPT-5.6、Gemini 和 Claude 上分别计为 693、1,089 和 1,372 个 token,而且更改文件格式或图片内容都不会使计数发生任何变化。
缓存 token 算输入 token 吗?
它们单独计量,并按操作类型定价:缓存写入相对基础输入有溢价,在 Claude API 上按 TTL 分别为 1.25x 或 2x;读取则按 0.1x 折扣计费。对预置容量而言,这一区别会产生双重影响:缓存 token 不消耗 PTU 容量,因此缓存既能降低账单,也能减少必须预留的容量。
语音按字符还是按分钟收费更便宜?
取决于语言。按字符计费的 TTS 使中文语音按音频分钟计算的成本只有英语的 1/3 到 1/7,因为中文用更少的字符承载同样的说话时长;按分钟计费则与语言无关。对于语音转文字,我们测量的模型在干净语音上的准确率接近,而价格为每音频分钟 $0.0020 到 $0.0164。
单位定义和费率来自 2026-08-30 获取的各提供商定价页面,以及文中链接的实测研究。价格变化很快,单位结构相对稳定,但在把任何数字写入计费代码前,仍应核对链接中的原始来源。
相关实测研究:token 构成、prompt caching、缓存最低要求、图片输入 token、图片生成、语音转文字、语音转文字 API、实时语音、视频生成、Web search、语音 agent、tokenizer、不同语言的成本。