🎁 新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。
Claude Sonnet 5 的新 tokenizer:相同 prompt 多出 41% token

Claude Sonnet 5 的新 tokenizer:相同 prompt 多出 41% token

目錄
  1. 可用性
  2. 價格:目前較低,9 月恢復為 Sonnet 4.6 的費率
  3. 快取與 TTL:可直接沿用
  4. token 數量的陷阱
  5. Sonnet 5 與 Opus 4.8:長期有效的成本優勢
  6. 遷移檢查清單
  7. 結論
  8. 常見問題

claude-sonnet-5 已在 Synthorai 閘道上線,目前價格很低:每百萬 input / output token 為 $2 / $10,比 Opus 4.8 低 2.5×,也低於 Sonnet 4.6。這是截至 2026 年 8 月 31 日的首發優惠價;9 月 1 日起會恢復為 $3 / $15,與 Sonnet 4.6 的牌價相同。

如果你已經在 Claude 系列使用快取,快取機制與 TTL 規格都能直接沿用。成本則需要重新計算,原因在於 Sonnet 5 計算 token 的方式。新的 tokenizer 會讓同一段英文文字產生比 Sonnet 4.6 多約 41% 的 input token,而費用與用量限制都以 token 數為準。只看牌價,算不出實際帳單。

TL;DR

  • Claude Sonnet 5 在 2026 年 8 月 31 日前,每百萬 input / output token 為 $2/$10;9 月 1 日起恢復為 $3/$15,與 Sonnet 4.6 的牌價相同。
  • 同一段文字在 Sonnet 5 會切成 2,245 個 token,Sonnet 4.6 則是 1,594 個,多出 41%,而且與 Opus 4.8 的數量完全相同。
  • 採用標準費率後,同一段英文 prompt 在 Sonnet 5 上的成本比 Sonnet 4.6 高約 41%。
  • 快取規格維持不變,讀取折扣約 90%;實測一次命中快取的請求為 $0.0017,Opus 4.8 則為 $0.0043。

在考慮任何程式碼修改或品質問題之前,token 數量的變化就會影響以下項目:

  • 每個 prompt 的成本。 採用標準費率時,同一段英文 prompt 的成本比 Sonnet 4.6 高約 41%。原因是兩者每個 token 的價格相同,但 Sonnet 5 會將相同文字計為更多 token。
  • 所有以 token 為基礎的估算。 如果每次呼叫的預算或本機 tokenizer 計數是依 4.6 設定,套用到 Sonnet 5 時大約會低估 40%。應以線上回傳的 usage 為準,不要依賴本機估算。
  • context window 的可用空間。 同一份文件會多占約 41% 的 window,因此 long-context 與 RAG 請求每次能容納的實際文字更少。
  • 速率限制。 相同工作負載會以快約 41% 的速度用完每分鐘 token 上限,進而降低吞吐量。
  • 快取資格(少數好處之一)。 1,024-token 的最低門檻更容易達到;在 4.6 上略低於門檻的 prefix,到了 Sonnet 5 可能就符合快取資格。

下文會用實測數據逐一說明價格、快取的成本效益,以及 token 數量的變化。

價格、快取、TTL 與 token 數量均於 2026-07-01 透過 https://synthorai.io/(Anthropic 原生 /v1/messages)實測。每個 token 的價格由線上呼叫回傳的 usage 成本推算;首發優惠價、標準費率與 8 月 31 日到期資訊則來自 Anthropic 的公告。引用數據前,請用自己的 prompt 重現測試。


可用性

import os
from anthropic import Anthropic

anth = Anthropic(
    api_key=os.environ["SYNTHORAI_KEY"],
    base_url="https://synthorai.io/",   # SDK appends /v1/messages
)

msg = anth.messages.create(
    model="claude-sonnet-5",            # the only line that changes
    max_tokens=512,
    system=[
        {"type": "text", "text": SYSTEM_PROMPT,
         "cache_control": {"type": "ephemeral"}},
    ],
    messages=[{"role": "user", "content": question}],
)
print(msg.usage)   # cache_creation_input_tokens, cache_read_input_tokens, cost

只要更換 model 欄位,快取流程不需要修改。cache_control 的運作方式請參閱快取教學;快取存在的架構原因則在系列文章第 1 篇中說明。


價格:目前較低,9 月恢復為 Sonnet 4.6 的費率

以下是閘道上的每 token 價格,由一般未快取呼叫回傳的 usage 成本推算:

模型Input($/M)Output($/M)
claude-sonnet-5(首發優惠價,截至 8 月 31 日)$2.00$10.00
claude-sonnet-5(標準費率,9 月 1 日起)$3.00$15.00
claude-sonnet-4-6$3.00$15.00
claude-opus-4-8$5.00$25.00

首發費率確實有折扣。相較於 Opus 4.8,這項成本優勢不會隨優惠結束而消失。即使恢復為標準費率 $3 / $15,Sonnet 5 仍比 Opus 便宜,而且兩者共用 tokenizer(下文會再說明),因此無論採用哪種費率,都能直接比較。

相較於 Sonnet 4.6,折扣只是暫時的。9 月 1 日起,兩者牌價完全相同。因此,任何根據目前價格得出「Sonnet 5 比 4.6 便宜」的規畫,都會隨優惠結束而失效。下一節還會說明:牌價相同時,處理同一段文字反而是 Sonnet 5 較貴。

我們不會發布未經實測的能力 benchmark。Sonnet 5 相較 4.6 的品質是否足以支撐其成本,應由你自己的 eval 判斷。


快取與 TTL:可直接沿用

快取規格與其他 Claude 系列完全相同。我們使用固定的 2.2K-token prefix,依序測試冷快取寫入與命中快取的讀取。每次呼叫都更換使用者訊息,避免 response-level cache 影響結果。以下是目前首發優惠價下,每次命中快取的請求成本:

模型冷請求(寫入快取)命中請求(讀取快取)冷請求 → 命中請求
claude-sonnet-5(首發優惠價)$0.0069$0.00174.0×
claude-sonnet-4-6$0.0079$0.00243.3×
claude-opus-4-8$0.0172$0.00434.0×

以下規則與整個 Opus 系列相同:

  • 讀取折扣約 90%。 命中快取時,讀取成本約為 input 價格的 10%,符合 Anthropic 文件所述「最高 90%」的快取讀取折扣。命中一次即可回本。
  • 1 小時 TTL 的行為相同。 Sonnet 5 接受 cache_control: {"type": "ephemeral", "ttl": "1h"}usage 物件也維持原本的分類:cache_creation.ephemeral_5m_input_tokensephemeral_1h_input_tokens。1 小時快取的寫入費用約為未使用快取的 2×,5 分鐘快取則約為 1.25×;無論 TTL 為何,讀取費用都維持在約 10%。

表中的數據有一項限制:命中快取的成本採用首發優惠價。9 月 1 日起,Sonnet 5 的數字要乘以 1.5×(input 從 $2 → $3,output 從 $10 → $15)。目前成本為 $0.0017 的 Sonnet 5 命中請求,9 月大約會變成 $0.0026。這仍低於 Opus 4.8 的 $0.0043,但不再低於 Sonnet 4.6。


token 數量的陷阱

9 月恢復標準費率後,成本會受到雙重影響。同一段 system 文字在 Sonnet 5 回報的 input token 比 Sonnet 4.6 多約 41%。

模型Input token(相同文字)採標準費率計算的 input 成本
claude-sonnet-4-61,594$0.0048
claude-sonnet-52,245$0.0067
claude-opus-4-82,245$0.0112

同一段英文 prompt 在 Sonnet 5 會切成 2,245 個 token,與 Opus 4.8 回報的數量完全相同,也明顯高於 Sonnet 4.6 的 1,594 個。Sonnet 5 採用了 Opus 系列自 4.7 起使用的新版 tokenizer。

把價格與 token 數量放在一起看,結果很明確:

  • 首發優惠期間,token 增加 41% 的影響會被低 33% 的費率抵銷($2 對 $3)。因此,同一段未快取 prompt 的成本與 4.6 大致相同;由於 output 也有折扣,命中快取的請求會更便宜。
  • 9 月 1 日起,費率與 4.6 相同,但 token 數量不同。同一段英文 prompt 在 Sonnet 5 上的成本會比 Sonnet 4.6 高約 41%(此 prefix 為 $0.0067 對 $0.0048),因為相同文字在每 token 價格一致時,被計為更多 token。

相較於 Opus 4.8 則沒有這個問題。兩者使用相同 tokenizer(2,245 = 2,245),所以 Sonnet 5 在首發優惠價與標準費率下都明確較便宜,分別是 2.5× 與 1.67×。

預算應以 9 月的帳單為準,而不是 7 月。9 月 1 日起,每 token 費率會提高 1.5×,而較高的 token 數量目前就已經生效。請從線上回應讀取 cache_creation_input_tokens / cache_read_input_tokens,不要依賴可能仍使用舊版 vocabulary 的本機 tokenizer。


Sonnet 5 與 Opus 4.8:長期有效的成本優勢

這項比較才是此次上線帶來的長期改變。Sonnet 5 與 Opus 4.8 共用 tokenizer,所以任何 prompt 的 token 數量都相同,成本差異完全來自費率:首發優惠價便宜 2.5×,標準費率便宜 1.67×。無論冷請求、命中快取的請求、input 或 output,比例都相同。目前一次命中快取的請求成本是 $0.0017 對 $0.0043;即使到了 9 月,也大約是 $0.0026 對 $0.0043。

對於 prefix 每輪都會重複的高流量快取 agent loop,這項差距會持續累積。判斷方式仍然相同:執行自己的 eval。如果 Sonnet 5 達到你的品質門檻,從閘道的成本來看,它的優勢不只持續到 8 月,而是長期成立。如果品質未達要求,只要更換一個 model 欄位,就能在相同快取程式碼下改用 Opus 4.8。


遷移檢查清單

  • 快取程式碼可原樣沿用。 cache_control 標記、breakpoint 數量、ttl: "1h"usage 欄位名稱都和 Opus 系列相同。
  • TTL 選項可沿用。 即時或 session 工作負載使用 5m;突發流量或中間會暫停的 agent 工作使用 1h。
  • 折扣結構不變。 讀取約 90% 折扣、5m 寫入約 1.25×、1h 寫入約 2×。
  • ⚠️ 預算中要標記 9 月 1 日。 首發優惠價於 8 月 31 日結束,Sonnet 5 會調整為 $3 / $15。請在生效前先納入 1.5× 的漲幅。
  • ⚠️ 重新測量 token 數量(若從 4.6 或更早版本遷移)。 同一段文字在 Sonnet 5 會多出約 41% token。採用標準費率時,同一 prompt 會比 4.6 更貴,而不是更便宜。
  • ⚠️ 以線上 usage 物件為準。 從回應讀取 *_input_tokenscost,不要使用舊世代模型留下的快取估算值。

結論

Sonnet 5 目前很划算,但優惠有期限。相較於 Opus 4.8,它在快取流程可直接沿用的前提下,成本能長期低 1.67–2.5×。對任何品質要求並非最高等級的 Opus 工作負載,它都應該是第一個進行 eval 的選項。相較於 Sonnet 4.6,優勢則只有首發折扣。9 月 1 日起,兩者費率相同,而新版 tokenizer 會讓同一個 prompt 的實際成本更高。可以使用目前的折扣,但預算應以 9 月的數字估算。在向財務部門承諾任何金額前,也要根據線上 usage 物件確認 token 數量。

完整的快取實作指南請參閱 prompt caching 系列,先從 KV Cache 與 TTL 的運作方式開始,再搭配可直接執行的 Python 教學


常見問題

Sonnet 5 比 Sonnet 4.6 便宜嗎? 只有首發優惠期間較便宜。截至 2026 年 8 月 31 日,Sonnet 5 為 $2 / $10,4.6 則為 $3 / $15。9 月 1 日起,Sonnet 5 會恢復為相同的 $3 / $15。由於同一段文字在 Sonnet 5 會多算約 41% token,採用標準費率時,同一個 prompt 的成本會高於 4.6。

首發優惠價何時結束?Anthropic 公告,首發優惠價將於 2026 年 8 月 31 日結束。9 月 1 日起,每百萬 input token 為 $3,每百萬 output token 為 $15。

Sonnet 5 比 Opus 4.8 便宜多少? 首發優惠價下便宜 2.5×,標準費率下便宜 1.67×,input 與 output 都相同。兩者共用 tokenizer,所以 token 數量一致;無論採用哪種費率,差異都完全來自費率本身。

需要修改我的 cache_control 程式碼嗎? 不需要。標記語法、breakpoint 上限與 TTL 選項都和 Opus 系列相同,只要更換 model 欄位即可。命中快取的讀取成本約為 input 價格的 10%;1 小時快取的寫入成本約為未使用快取的 2×,5 分鐘快取則約為 1.25×。

Sonnet 5 可以直接取代 Opus 4.8 嗎? 就快取、TTL 與成本而言,遷移非常簡單,而且 Sonnet 5 在兩種費率下都更便宜。品質方面請自行執行 eval;我們不會發布未經實測的能力 benchmark。模型品質相關資訊請參閱 Anthropic 的 model card。


驗證資訊:價格、快取、TTL 與 token 數量均於 2026-07-01 透過 Anthropic 原生 /v1/messages 路徑,在單一租戶環境下對 https://synthorai.io/ 進行實測。每 token 價格由一般呼叫的 usage 成本推算;每次請求成本為少量樣本的中位數,使用 2.2K-token 的快取 prefix,並反映目前的首發優惠價。首發優惠價與 2026 年 8 月 31 日到期資訊來自 Anthropic 的 Sonnet 5 公告;折扣與加價比例則與 Anthropic Prompt Caching 文件交叉核對。實際數字會因 prompt、區域與負載而異。

← 返回部落格