Claude Sonnet 5.5 與 Sonnet 5:同價,單次任務省 80%
目錄
Claude Sonnet 5.5 與 Claude Sonnet 5 的 token 價格相同,每百萬個輸入 token 為 $2,每百萬個輸出 token 為 $10,因此成本差異完全取決於 token 用量。我們以 API 預設設定測試 13 項單輪任務,Sonnet 5.5 每項任務成本為 $0.0041,Sonnet 5 則為 $0.021,前者低了 80%,而且兩個模型全部答對。不過,Sonnet 5.5 的輸出格式有問題:在低於 xhigh 的推理強度下,它有時不使用隱藏推理,反而直接在回覆中寫出推導過程,即使 prompt 明確要求只回覆答案。
TL;DR
- 使用 API 預設設定時,Sonnet 5.5 每項任務成本為 $0.0041,Sonnet 5 則為 $0.021,兩者在 39 次呼叫中全部答對。
- Sonnet 5.5 在
low、medium與high的成本大致相同,max則是預設設定的 3.5 倍。 - 在低於
xhigh的設定下,156 個只要求答案的 prompt 中,Sonnet 5.5 有 68 次直接在回覆裡寫出推導過程,加入 system prompt 也沒有改善。 - 在包含四個問題的工具迴圈中,Sonnet 5.5 使用
max時每次執行成本為 $0.042,高於 Opus 5.5 的預設設定($0.033)。
Anthropic 於 2026-09-28 推出 Sonnet 5.5,宣稱速度提升 30%,而且每項任務的成本「最多降低 30%」。我們在隔天完成了測量。
Claude Sonnet 5.5 改了哪些地方?
價格沒有變,但推理控制方式和多個請求參數都已調整。Sonnet 5.5 採用自適應思考,由模型自行決定回答前需要進行多少隱藏推理,這些推理 token 會按輸出計費。你可以透過 effort 控制推理強度,在 Messages API 中對應 output_config.effort。這個請求參數分為 low 到 max 共五級,API 預設為 high。
| Sonnet 5.5 | Sonnet 5 | Opus 5.5 | |
|---|---|---|---|
| 發布日期 | 2026-09-28 | 2026-06-30 | 2026-09-22 |
| 每 1M token 的輸入/輸出價格 | $2 / $10 | $2 / $10 | $4 / $20 |
| 每 1M token 的快取讀取價格 | $0.20 | $0.20 | $0.20 |
| 上下文視窗/最大輸出 | 1M / 128K | 1M / 128K | 1M / 128K |
| 知識截止日期(官方只公布月份) | 2026 年 6 月 | 2026 年 1 月 | 2026 年 6 月 |
| API 預設推理強度 | high | high | medium |
| 最低推理設定 | between_tools(high 或以下) | disabled | 無法關閉,推理一律啟用 |
| 可快取 prompt 的最小長度 | 512 tokens | 1,024 tokens | 512 tokens |
Sonnet 5 的 $2 / $10 原本是上市優惠價,但 Anthropic 的定價頁面目前已將它列為標準價格,原定調漲至 $3 / $15 的計畫並未實施。
根據遷移指南,以下請求在 Sonnet 5 上可以使用,但 Sonnet 5.5 會回傳 HTTP 400:
thinking: {"type": "disabled"}。請改用thinking: {"type": "between_tools"},這會關閉第一次回答前的推理,而且只能搭配high或更低的推理強度。- 強制使用工具,也就是將
tool_choice設為any或指定工具。請保留auto,並在 prompt 中說明什麼情況下要使用工具。 - 手動設定推理預算
budget_tokens、使用非預設的temperature、top_p或top_k,以及預先填入 assistant 訊息,也就是替模型寫好回覆開頭。 - 對 2026-08-31 起建立的帳號,在修改 system prompt、工具或較早的訊息後,重播 Sonnet 5.5 的 thinking 區塊。
- 在 Claude API 與 Google Cloud 上使用舊版
computer_20251124電腦操作工具。
另有一項變更不會觸發錯誤:模型在工具呼叫之間寫下的簡短說明,現在會以 thinking 區塊傳回。預設顯示設定下,這些區塊是空的,因此原本透過串流顯示這些內容的介面將不再顯示文字。
官方 benchmark 顯示了什麼?
Anthropic 自己公布的表格顯示,Sonnet 5.5 的多項成績只落後 Opus 5.5 幾分,但 token 價格只有一半,而且明顯領先 Sonnet 5。
| Benchmark(測試內容) | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0(在終端機中進行代理式程式開發) | 70.6% | 10.3% | 66.4%(xhigh) | 未公布 |
| CursorBench 4.0(在編輯器中撰寫程式) | 55.5% | 34.1% | 57.8% | 未公布 |
| GDPval-AA v2.1(知識工作文件,Elo 評分,越高越好) | 1844 | 1449 | 1846 | 1487 |
| OSWorld 2.1(電腦操作,部分給分) | 80.1% | 57.0% | 81.8% | 未公布 |
| Humanity’s Last Exam,使用工具 | 64.5% | 54.9% | 67.7% | 未公布 |
Artificial Analysis 也提醒了成本問題:Sonnet 5.5 使用 max 時,在 Intelligence Index 得到 56 分,比同樣使用 max 的 Opus 5.5 少 2 分,但每項任務用了約 193K 個輸出 token,是該機構測過的最高紀錄。這比使用 max 的 Opus 5.5 或 Sonnet 5 多約 60%,每項指標任務的成本約為 $7.60。
我們怎麼測量?
我們準備了 13 項答案已知的單輪任務,也就是一次 prompt、一次回覆、不使用工具,並交給三個模型處理。其中 8 項較短,例如加總 60 以下的質數,以及計算 1 到 500 之間數字 7 出現的次數。另外 5 項需要真正的多步驟推導,包括 10 個項目的背包問題、穿越有障礙物之 8x8 網格的路徑數,以及 13 的 1,001 次方除以 10,007 的餘數。所有標準答案都在本機以暴力法計算,每個 prompt 最後都要求「只回覆一個整數,不要包含其他內容。」每項任務都分別以 API 預設設定和五種推理強度執行 3 次,總計 702 次呼叫,全部透過原生 Messages API 完成。每個 prompt 都加入唯一的隨機字串,避免回覆來自快取,成本則依 Anthropic 公開定價計算。我們檢查最終答案是否正確,也檢查回覆是否只包含答案。
正確率沒有拉開模型之間的差距。Sonnet 5.5 在 234 次呼叫中全部答對,Sonnet 5 則在成功回傳的 233 次呼叫中全部答對,另有一次發生伺服器錯誤。Opus 5.5 在 low 與預設設定下各答錯一項任務。
Sonnet 5.5 每項任務真的比 Sonnet 5 便宜嗎?
使用預設設定時,Sonnet 5.5 的成本比 Sonnet 5 低 80%;使用 low、medium 與 high 時則低 77% 到 78%。原因是 Sonnet 5.5 的輸出 token 約只有 Sonnet 5 的五分之一。兩者定價完全相同,因此節省的成本全都來自更高的 token 效率。Sonnet 5 在每種推理強度下,每項任務都會輸出約 1,800 到 2,100 個 token;Sonnet 5.5 在 xhigh 之前則只有約 400 個。
| 全部 13 項任務,每項任務 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| API 預設設定 | $0.0041(396 tokens) | $0.0212(2,105) | $0.0070(334) |
low | $0.0043(409) | $0.0184(1,817) | $0.0065(309) |
medium | $0.0040(383) | $0.0180(1,780) | $0.0082(393) |
high | $0.0043(416) | $0.0188(1,858) | $0.0088(421) |
xhigh | $0.0059(574) | $0.0202(2,001) | $0.0105(507) |
max | $0.0146(1,438) | $0.0193(1,909) | $0.0234(1,149) |
Token 數是每次呼叫的平均輸出 token,包含推理。在 5 項困難任務中,預設設定可節省 84%($0.0057 對 $0.0348)。在我們的工具迴圈裡,每一輪都會重新傳送整段對話記錄,成本主要來自輸入 token,因此只節省 8%。對這類單輪 prompt 而言,Anthropic 宣稱的「最多降低 30%」相當保守;對我們這種短工具迴圈而言,這個數字又顯得偏高。
由於只有 13 個任務,預設設定下 80% 的降幅範圍較寬:對任務重新抽樣得到的 95% 區間為低 66% 到 85%;從 low 到 xhigh 的每個檔位,區間下限都高於 50%。
各推理強度的成本是多少?
在 Sonnet 5.5 上,low、medium 與 high 每項任務的成本都在 $0.0042 左右,因此本次測試中,預設的 high 並沒有增加成本。xhigh 貴約 40%,max 則是預設設定的 3.5 倍。使用 max 時,Sonnet 5.5 每項任務的成本是 Opus 5.5 預設設定的兩倍($0.0146 對 $0.0070),正確率卻沒有提升。
成本曲線不會在所有工作負載上都這麼平坦。在一項較長的 DevOps 任務中,另一位測試者發現 high 使用的輸出 token 約為 medium 的兩倍。只要推理強度可能影響工作負載,就應該自行測試所有設定。
為什麼 Sonnet 5.5 會把推導過程寫進答案?
在低於 xhigh 的設定下,Sonnet 5.5 不一定會使用 thinking 區塊。沒有使用時,它就直接在回覆中推理。Thinking 區塊是回應中專門存放模型推理的獨立部分,預設不會顯示文字,正式答案則放在後續的 text 區塊。
Sonnet 5.5 的 234 則回覆中,166 則包含 thinking 區塊,而且都只回覆答案。其餘 68 則沒有 thinking 區塊,全都先寫出推導過程,例如先寫「09:47 + 3:46 = 13:33 … + 1:39 = 15:40」,最後才回答「15:40」。最終答案每次都正確,但回覆格式不符合 prompt 要求。
| 僅包含答案的回覆 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| API 預設設定 | 22 / 39 | 38 / 39 | 38 / 39 |
low | 12 / 39 | 37 / 39 | 38 / 39 |
medium | 24 / 39 | 37 / 39 | 39 / 39 |
high | 30 / 39 | 38 / 39 | 39 / 39 |
xhigh | 39 / 39 | 35 / 38 | 39 / 39 |
max | 39 / 39 | 37 / 39 | 39 / 39 |
這種現象按任務出現:凡是出現這種情況的任務,Sonnet 5.5 三次重複都寫出了推導過程,只有預設設定下的一個任務是三次中有兩次。low 下 13 個任務中有 9 個出現這種情況,預設設定下 6 個,medium 下 5 個,high 下 3 個(都是簡短的算術題)。以任務計算時,由於只有 13 個任務,這些差距都無法通過 Holm 校正,因此應把這些計數視為本次觀察到的結果,而不是可據以規劃的比例。Sonnet 5 的格式錯誤則不同:它會先以粗體顯示正確答案,再補上一小段說明。xhigh 那一列只有 38 次呼叫,是因為其中一次發生伺服器錯誤。
加入 system prompt,要求「只輸出最終結果」並在內部完成所有推導,仍然沒有改善。Sonnet 5.5 在 low 下的 24 項短任務中只有 8 次只回覆答案,在 medium 下則為 9 次;未加入 system prompt 時分別是 6 次與 9 次。xhigh 可以解決這個問題,每次都有 thinking 區塊,而且只回覆答案,但成本比 low 到 high 高約 40%。如果程式需要解析模型輸出:
- 如果回覆必須只有一行答案,請使用
xhigh。 - 或者讀取最後一個非空白行,本次測試的 68 個案例都能取得正確答案。
- Anthropic 的結構化輸出也能用 schema 限制回覆格式,但我們沒有測試這種方式。
import anthropic
client = anthropic.Anthropic()
prompt = "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else."
resp = client.messages.create(
model="claude-sonnet-5-5",
max_tokens=16000,
output_config={"effort": "xhigh"}, # low, medium, high (API default), xhigh, max
messages=[{"role": "user", "content": prompt}],
)
text = "".join(block.text for block in resp.content if block.type == "text")
lines = text.strip().splitlines()
answer = lines[-1] if lines else None # below xhigh, working can precede the answer
print(answer, resp.usage.output_tokens) # output_tokens includes the reasoning
放進工具迴圈後會怎樣?
使用預設設定、low 與 medium 時,Sonnet 5.5 在四題程式碼閱讀迴圈的每次執行中都能成功解題,成本約為 $0.011,只有 Opus 5.5 的三分之一。使用 max 時,工具呼叫次數增加為三倍,成本也超過 Opus 5.5。每個模型可以在一個小型合成程式碼庫中使用三種工具,分別是列出檔案、讀取檔案與搜尋。每個答案都需要跨檔案查詢 3 到 6 次。
| 工具迴圈,每種設定執行 12 次 | 成功解題 | 回合數中位數 | 每次執行的工具呼叫數 | 每次執行成本 | 總耗時中位數 |
|---|---|---|---|---|---|
| Sonnet 5.5,預設設定 | 12 / 12 | 3 | 4.8 | $0.0112 | 6.7 s |
Sonnet 5.5,low | 12 / 12 | 3 | 4.9 | $0.0112 | 7.4 s |
Sonnet 5.5,medium | 12 / 12 | 3 | 5.1 | $0.0113 | 6.8 s |
Sonnet 5.5,max | 12 / 12 | 4 | 14.7 | $0.0422 | 20.1 s |
| Opus 5.5,預設設定 | 12 / 12 | 4 | 5.3 | $0.0332 | 25.3 s |
| Sonnet 5,預設設定 | 11 / 12 | 3.5 | 4.2 | $0.0122 | 15.8 s |
VentureBeat 報導的客戶說法指出,Sonnet 5.5 的工具呼叫次數比 Sonnet 5 少,例如 Lovable 的呼叫次數少了三分之一。我們的迴圈太短,無法重現這項差異:Sonnet 5.5 每次執行呼叫 4.8 次,Sonnet 5 則是 4.2 次。不過,Sonnet 5.5 的成本仍低 8%,完成速度也快了一倍以上。
Sonnet 5.5 比較快嗎?
它較早完成,主要是因為輸出較少。使用預設設定執行單輪任務時,從送出請求到收完整回應的總耗時中位數,Sonnet 5.5 為 3.9 秒,Sonnet 5 為 8.1 秒,Opus 5.5 則為 5.5 秒。兩個 Sonnet 每秒總耗時輸出的 token 數差不多,分別為 88 與 91。等待時間減半,不是因為 Sonnet 5.5 生成 token 的速度更快,而是因為它只輸出五分之一的 token。在困難任務中,兩者耗時分別為 5.8 秒與 21.0 秒。
Sonnet 5 的 token 預算可以沿用嗎?
為 Sonnet 5 設定的上下文預算與 max_tokens 上限應仍然適用。Anthropic 的遷移說明指出 Sonnet 5.5 使用相同的 tokenizer;我們測試的四段固定文字(英文段落、Python 程式碼、JSON 工具參數、中文段落)在兩個模型以及 Opus 5.5 上的計數完全相同,例如英文為 1,270 個 token,中文為 493 個;Sonnet 5.5 與 Opus 5.5 每次請求固定多出 2 個 token。帶工具的請求在輸入上略便宜:Anthropic 的價格頁列出,隱藏的工具使用系統提示在 Sonnet 5.5 上為 286 個 token,在 Sonnet 5 上為 354 個。
該選哪一個?
大多數 Sonnet 5 工作負載都應該換到新版,接下來只需要選擇推理強度。
| 工作負載 | 注意事項 | 建議 | 數據 |
|---|---|---|---|
| 由程式解析輸出:擷取、分類、單一值 | 低於 xhigh 時,推導過程可能寫進回覆 | 使用 xhigh 的 Sonnet 5.5,或使用 medium 並解析最後一行 | xhigh 僅含答案 39 / 39,medium 為 24 / 39;xhigh 貴約 40% |
| 對話與使用者可見文字 | 延遲與成本 | 使用 medium 的 Sonnet 5.5 | 每項任務 $0.0040,耗時中位數 3.9 s |
| 使用工具的代理迴圈 | max 可能大幅增加工具呼叫 | 使用預設設定或 medium 的 Sonnet 5.5;與其使用 Sonnet 5.5 的 max,不如改用 Opus 5.5 | 預設設定每次執行 $0.011,max 為 $0.042,Opus 5.5 為 $0.033 |
| 關閉推理或強制使用工具的 Sonnet 5 程式碼 | 更換模型後收到 HTTP 400 | 使用 between_tools(high 或以下)以及 tool_choice: auto | Anthropic 遷移指南 |
無論使用哪種推理強度,程式中都應保留兩項檢查:回覆格式是否符合解析器預期,以及每次請求的輸出 token 上限。單輪 prompt 使用 max 時,每項任務成本增加到 3.5 倍;工具迴圈中的呼叫次數則增加到 3 倍。
常見問題
Sonnet 5.5 比 Opus 5.5 便宜嗎?
使用各自的預設設定時,Sonnet 5.5 的單輪任務成本比 Opus 5.5 低 41%,工具迴圈的每次執行成本只有三分之一。使用 max 時順序會反轉:Sonnet 5.5 的單輪任務成本是 Opus 5.5 預設設定的兩倍,工具迴圈成本則高 27%。
Sonnet 5.5 應該使用哪種推理強度?
在我們的任務中,Sonnet 5.5 使用 low、medium 與 high 的成本大致相同,介於 $0.0040 到 $0.0043,因此對話與工具迴圈可以先從 medium 開始。如果程式要把回覆解析成單一值,請使用 xhigh;max 的成本是預設設定的 3.5 倍。
Sonnet 5.5 還能關閉推理嗎?
Sonnet 5.5 會拒絕 thinking: {"type": "disabled"},並回傳 HTTP 400。請改送 thinking: {"type": "between_tools"},此設定可搭配 low、medium 或 high。
相關測量:Claude Opus 5.5 與 Opus 5 的比較、Claude Sonnet 5 tokenizer,以及各家模型的推理控制方式。
測量日期為 2026-09-29,也就是發布後一天,透過連接 Anthropic Messages API 的閘道完成。測試包含 702 次有評分的單輪呼叫,涵蓋 13 項以暴力法產生標準答案的任務、3 次重複、6 種推理強度與 3 個模型;另有 48 次呼叫用於測試 system instruction 對輸出格式的影響、72 次工具迴圈執行,涵蓋 4 個多步驟問題、3 次重複與 6 種設定,以及每個模型對四段固定文字的 token 計數。所有 prompt 都加入隨機字串,成本依 Anthropic 公開定價計算。