🎁 新人 免费注册,送 10 次调用,最高 $1,免绑卡。
Claude Sonnet 5 的新 tokenizer:同一 prompt 的 token 数增加 41%

Claude Sonnet 5 的新 tokenizer:同一 prompt 的 token 数增加 41%

目录
  1. 可用性
  2. 价格:当前优惠,9 月恢复至 Sonnet 4.6 水平
  3. 缓存和 TTL:可直接迁移
  4. token 数的隐性成本
  5. Sonnet 5 与 Opus 4.8:长期有效的价格优势
  6. 迁移检查清单
  7. 结论
  8. 常见问题

claude-sonnet-5 已在 Synthorai 网关上线,目前价格很低:每百万输入/输出 token 分别为 $2 / $10,比 Opus 4.8 低 2.5×,也低于 Sonnet 4.6。不过这个价格不会持续太久。根据限时优惠方案,有效期截至 2026 年 8 月 31 日;从 9 月 1 日起,价格将恢复为 $3 / $15,与 Sonnet 4.6 的标价相同。

如果你已经在 Claude 系列上使用缓存,可以原样沿用现有的缓存和 TTL 方案。真正需要仔细核算的是成本,因为 Sonnet 5 的 token 计算方式变了。它采用新的 tokenizer,同一段英文文本产生的输入 token 比 Sonnet 4.6 多约 41%。计费和额度限制都按 token 数计算,所以不能只看标价。

TL;DR

  • Claude Sonnet 5 在 2026 年 8 月 31 日前,每百万输入/输出 token 的价格为 $2/$10;9 月 1 日起恢复为 $3/$15,与 Sonnet 4.6 的标价相同。
  • 同一段文本在 Sonnet 5 上会生成 2,245 个 token,在 Sonnet 4.6 上则是 1,594 个,多出 41%,且与 Opus 4.8 的 token 数完全一致。
  • 按标准价格计算,同一段英文 prompt 在 Sonnet 5 上的成本比 Sonnet 4.6 高约 41%。
  • 缓存机制保持不变,读取折扣约为 90%;实测一次命中缓存的请求成本为 $0.0017,Opus 4.8 则为 $0.0043。

即使不考虑代码改动和模型质量,token 数的变化也会影响以下方面:

  • 单次 prompt 成本。 按标准价格计算,同一段英文 prompt 的成本比 Sonnet 4.6 高约 41%。两者每 token 单价相同,但 Sonnet 5 会将相同文本计算为更多 token。
  • 所有基于 token 的估算。 如果单次调用预算或本地 tokenizer 的估算以 4.6 为基准,那么在 Sonnet 5 上会低估约 40%。应以实际响应中的 usage 为准,而不是本地估算。
  • 上下文窗口余量。 同一份文档会多占用约 41% 的窗口,因此长上下文和 RAG 请求能容纳的实际文本更少。
  • 速率限制。 对相同工作负载,tokens-per-minute 配额的消耗速度会快约 41%,吞吐量也会下降。
  • 缓存资格(小幅利好)。 更容易达到 1,024 token 的最低门槛。某个 prefix 在 4.6 上略低于门槛,到了 Sonnet 5 上可能就能缓存。

下文会用实测数据逐项说明价格、缓存成本和 token 数变化。

价格、缓存、TTL 和 token 数均于 2026-07-01 通过 https://synthorai.io/(Anthropic 原生 /v1/messages)实测。每 token 价格根据线上调用的 usage 成本反推;优惠价、标准价及 8 月 31 日的截止日期来自 Anthropic 公告。对外引用前,请用自己的 prompt 复测。


可用性

import os
from anthropic import Anthropic

anth = Anthropic(
    api_key=os.environ["SYNTHORAI_KEY"],
    base_url="https://synthorai.io/",   # SDK appends /v1/messages
)

msg = anth.messages.create(
    model="claude-sonnet-5",            # the only line that changes
    max_tokens=512,
    system=[
        {"type": "text", "text": SYSTEM_PROMPT,
         "cache_control": {"type": "ephemeral"}},
    ],
    messages=[{"role": "user", "content": question}],
)
print(msg.usage)   # cache_creation_input_tokens, cache_read_input_tokens, cost

只需替换 model 字段,缓存链路无需改动。cache_control 的工作机制见缓存教程;缓存的架构原理见系列文章第 1 篇


价格:当前优惠,9 月恢复至 Sonnet 4.6 水平

以下是根据普通非缓存调用的 usage 成本反推出的网关单价:

模型输入($/M)输出($/M)
claude-sonnet-5(优惠价,截至 8 月 31 日)$2.00$10.00
claude-sonnet-5(标准价,9 月 1 日起)$3.00$15.00
claude-sonnet-4-6$3.00$15.00
claude-opus-4-8$5.00$25.00

优惠幅度确实不小。与 Opus 4.8 相比,Sonnet 5 的价格优势会长期存在:即使恢复到标准价格 $3 / $15,Sonnet 5 仍然更便宜。两者使用相同的 tokenizer(下文会详细说明),因此无论按哪档价格比较,都很直观。

Sonnet 4.6 相比,价格优势只是暂时的。9 月 1 日后,两者标价相同。因此,任何基于当前价格得出的“Sonnet 5 比 4.6 更便宜”结论,都会随优惠结束而失效。下一节还会说明:在标价相同的情况下,同一段文本在 Sonnet 5 上反而更贵。

我们不会发布未经实测的能力基准。Sonnet 5 相比 4.6 的质量提升是否值得增加的成本,需要由你自己的 eval 判断。


缓存和 TTL:可直接迁移

缓存规则与 Claude 系列其他模型完全一致。我们使用固定的 2.2K-token prefix,分别进行冷写入和热读取测试,并在每次调用中更换用户消息,避免响应级缓存干扰结果。以下是按当前优惠价计算的单次热请求成本:

模型冷请求(写入缓存)热请求(读取缓存)冷 → 热
claude-sonnet-5(优惠价)$0.0069$0.00174.0×
claude-sonnet-4-6$0.0079$0.00243.3×
claude-opus-4-8$0.0172$0.00434.0×

这些固定规则与 Opus 系列一致:

  • 读取折扣约为 90%。 命中缓存时,读取成本约为输入价格的 10%,与 Anthropic 文档所述“缓存读取最多节省 90%”一致。命中一次即可回本。
  • 1 小时 TTL 的行为相同。 Sonnet 5 支持 cache_control: {"type": "ephemeral", "ttl": "1h"}usage 对各部分的拆分也没有变化:cache_creation.ephemeral_5m_input_tokensephemeral_1h_input_tokens。1 小时缓存的写入成本约为无缓存时的 2×,5 分钟缓存则约为 1.25×;无论 TTL 多长,读取成本都保持在约 10%。

表中的热请求成本按优惠价计算。从 9 月 1 日起,Sonnet 5 的数字需要乘以 1.5×(输入从 $2 → $3,输出从 $10 → $15)。当前成本为 $0.0017 的一次 Sonnet 5 热请求,9 月约为 $0.0026,仍低于 Opus 4.8 的 $0.0043,但不再低于 Sonnet 4.6。


token 数的隐性成本

9 月恢复标准价后,成本会受到双重影响。同一段 system 文本在 Sonnet 5 上报告的输入 token 数比 Sonnet 4.6 多约 41%。

模型输入 token(相同文本)按标准价计算的输入成本
claude-sonnet-4-61,594$0.0048
claude-sonnet-52,245$0.0067
claude-opus-4-82,245$0.0112

同一段英文 prompt 在 Sonnet 5 上会被分为 2,245 个 token,与 Opus 4.8 报告的数量完全相同,明显高于 Sonnet 4.6 的 1,594 个。Sonnet 5 使用了 Opus 系列从 4.7 开始采用的新版 tokenizer。

把价格和 token 数放在一起看,结论很明确:

  • 优惠期间,token 数增加 41%,但单价降低了 33%($2 对 $3),两者基本抵消。因此,同一个非缓存 prompt 的成本与 4.6 接近;由于输出价格也有折扣,热请求反而更便宜。
  • 从 9 月 1 日起,Sonnet 5 与 4.6 的单价相同,但 token 数不同。同一段英文 prompt 在 Sonnet 5 上的成本会比 Sonnet 4.6 高约 41%(本例中的 prefix 为 $0.0067 对 $0.0048),原因就是相同文本按更多 token 计费。

与 Opus 4.8 比较则没有这个问题。两者使用相同的 tokenizer(2,245 = 2,245),因此 Sonnet 5 无论按优惠价还是标准价都更便宜,分别为 2.5× 和 1.67×。

预算应按 9 月的账单估算,而不是 7 月。9 月 1 日起每 token 单价会上涨 1.5×,而较高的 token 数现在就已经生效。应直接读取线上响应中的 cache_creation_input_tokens / cache_read_input_tokens,不要依赖可能仍使用旧词表的本地 tokenizer。


Sonnet 5 与 Opus 4.8:长期有效的价格优势

这是本次发布带来的长期变化。Sonnet 5 与 Opus 4.8 使用相同的 tokenizer,因此任何 prompt 的 token 数都一致,成本差异完全来自单价:无论是冷请求、热请求、输入还是输出,优惠价下便宜 2.5×,标准价下便宜 1.67×。当前一次命中缓存的热请求成本为 $0.0017,Opus 4.8 为 $0.0043;即使到了 9 月,也约为 $0.0026 对 $0.0043。

对于 prefix 每轮都会重复的高调用量缓存 agent 循环,这一差距会不断累积。选择方式没有变化:先运行自己的 eval。如果 Sonnet 5 达到质量要求,从网关成本看,它的优势不会只持续到 8 月。如果质量不达标,只需切换一个 model 字段即可改用 Opus 4.8,缓存代码无需调整。


迁移检查清单

  • 缓存代码可以原样沿用。 cache_control 标记、断点数量、ttl: "1h"usage 字段名都与 Opus 系列完全相同。
  • TTL 方案可以沿用。 实时或会话型工作负载使用 5m;突发型任务或中间会暂停的 agent 使用 1h。
  • 缓存折扣不变。 读取约为 90% 折扣,5m 写入约为 1.25×,1h 写入约为 2×。
  • ⚠️ 预算中标记 9 月 1 日。 优惠价于 8 月 31 日结束,Sonnet 5 将恢复为 $3 / $15。应提前按 1.5× 的涨幅建模。
  • ⚠️ 重新测量 token 数(从 4.6 或更早版本迁移时)。 同一段文本在 Sonnet 5 上会多出约 41% 的 token。按标准价计算,同一个 prompt 会比 4.6 更贵,而不是更便宜。
  • ⚠️ 以实际 usage 对象为准。 从响应中读取 *_input_tokenscost,不要使用基于旧一代模型缓存下来的估算值。

结论

Sonnet 5 当前很划算,但优惠有明确期限。与 Opus 4.8 相比,它在缓存方案无需修改的前提下,能长期便宜 1.67–2.5×。对于对质量没有极致要求的 Opus 工作负载,它应当是最先评测的选项。与 Sonnet 4.6 相比,优势则仅来自限时优惠:9 月 1 日后,两者单价相同,而新的 tokenizer 会让同一个 prompt 的实际成本更高。可以利用当前折扣,但预算应按 9 月的数字估算。在向财务承诺任何金额之前,还应根据实际 usage 对象确认 token 数。

完整的缓存实践指南见 prompt 缓存系列,可从 KV Cache 与 TTL 的工作原理可运行的 Python 教程开始。


常见问题

Sonnet 5 比 Sonnet 4.6 便宜吗? 只在优惠期间更便宜。截至 2026 年 8 月 31 日,Sonnet 5 的价格为 $2 / $10,4.6 则为 $3 / $15。9 月 1 日起,Sonnet 5 会恢复为 $3 / $15,与 4.6 相同。由于相同文本在 Sonnet 5 上会多出约 41% 的 token,按标准价计算,同一个 prompt 的成本会高于 4.6。

优惠价什么时候结束? 根据 Anthropic 的公告,优惠于 2026 年 8 月 31 日结束。从 9 月 1 日起,每百万输入 token 的价格为 $3,每百万输出 token 为 $15。

Sonnet 5 比 Opus 4.8 便宜多少? 输入和输出均是优惠价下便宜 2.5×,标准价下便宜 1.67×。两者使用相同的 tokenizer,因此 token 数一致,无论按哪档价格,差异都只来自单价。

需要修改 cache_control 代码吗? 不需要。标记语法、断点上限和 TTL 选项都与 Opus 系列相同。只需修改 model 字段。热读取成本约为输入价格的 10%;1 小时缓存的写入成本约为无缓存时的 2×,5 分钟缓存约为 1.25×。

Sonnet 5 可以直接替换 Opus 4.8 吗? 从缓存、TTL 和成本层面看,迁移很简单,而且 Sonnet 5 在两档价格下都更便宜。模型质量则需要自行 eval;我们不会发布未经实测的能力基准。关于模型质量的具体信息,请参阅 Anthropic 的 model card。


验证说明:价格、缓存、TTL 和 token 数数据均于 2026-07-01 通过 https://synthorai.io/ 的 Anthropic 原生 /v1/messages 路径在单租户环境中测得。每 token 价格根据普通调用的 usage 成本反推;单次请求成本取小样本中位数,使用 2.2K-token 的缓存 prefix,并按当前优惠价计算。优惠价及 2026 年 8 月 31 日的截止日期来自 Anthropic 的 Sonnet 5 公告;折扣和溢价比例已与 Anthropic Prompt Caching 文档交叉核对。实际数据会因 prompt、区域和负载而异。

← 返回博客