新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

Claude Sonnet 5.5 與 Sonnet 5:同價,單次任務省 80%

目錄
  1. Claude Sonnet 5.5 改了哪些地方?
  2. 官方 benchmark 顯示了什麼?
  3. 我們怎麼測量?
  4. Sonnet 5.5 每項任務真的比 Sonnet 5 便宜嗎?
  5. 各推理強度的成本是多少?
  6. 為什麼 Sonnet 5.5 會把推導過程寫進答案?
  7. 放進工具迴圈後會怎樣?
  8. Sonnet 5.5 比較快嗎?
  9. Sonnet 5 的 token 預算可以沿用嗎?
  10. 該選哪一個?
  11. 常見問題

Claude Sonnet 5.5 與 Claude Sonnet 5 的 token 價格相同,每百萬個輸入 token 為 $2,每百萬個輸出 token 為 $10,因此成本差異完全取決於 token 用量。我們以 API 預設設定測試 13 項單輪任務,Sonnet 5.5 每項任務成本為 $0.0041,Sonnet 5 則為 $0.021,前者低了 80%,而且兩個模型全部答對。不過,Sonnet 5.5 的輸出格式有問題:在低於 xhigh 的推理強度下,它有時不使用隱藏推理,反而直接在回覆中寫出推導過程,即使 prompt 明確要求只回覆答案。

TL;DR

  • 使用 API 預設設定時,Sonnet 5.5 每項任務成本為 $0.0041,Sonnet 5 則為 $0.021,兩者在 39 次呼叫中全部答對。
  • Sonnet 5.5 在 low、medium 與 high 的成本大致相同,max 則是預設設定的 3.5 倍。
  • 在低於 xhigh 的設定下,156 個只要求答案的 prompt 中,Sonnet 5.5 有 68 次直接在回覆裡寫出推導過程,加入 system prompt 也沒有改善。
  • 在包含四個問題的工具迴圈中,Sonnet 5.5 使用 max 時每次執行成本為 $0.042,高於 Opus 5.5 的預設設定($0.033)。

Anthropic 於 2026-09-28 推出 Sonnet 5.5,宣稱速度提升 30%,而且每項任務的成本「最多降低 30%」。我們在隔天完成了測量。

Claude Sonnet 5.5 改了哪些地方?

價格沒有變,但推理控制方式和多個請求參數都已調整。Sonnet 5.5 採用自適應思考,由模型自行決定回答前需要進行多少隱藏推理,這些推理 token 會按輸出計費。你可以透過 effort 控制推理強度,在 Messages API 中對應 output_config.effort。這個請求參數分為 low 到 max 共五級,API 預設為 high。

Sonnet 5.5Sonnet 5Opus 5.5
發布日期2026-09-282026-06-302026-09-22
每 1M token 的輸入/輸出價格$2 / $10$2 / $10$4 / $20
每 1M token 的快取讀取價格$0.20$0.20$0.20
上下文視窗/最大輸出1M / 128K1M / 128K1M / 128K
知識截止日期(官方只公布月份)2026 年 6 月2026 年 1 月2026 年 6 月
API 預設推理強度highhighmedium
最低推理設定between_tools(high 或以下)disabled無法關閉,推理一律啟用
可快取 prompt 的最小長度512 tokens1,024 tokens512 tokens

Sonnet 5 的 $2 / $10 原本是上市優惠價,但 Anthropic 的定價頁面目前已將它列為標準價格,原定調漲至 $3 / $15 的計畫並未實施。

根據遷移指南,以下請求在 Sonnet 5 上可以使用,但 Sonnet 5.5 會回傳 HTTP 400:

  • thinking: {"type": "disabled"}。請改用 thinking: {"type": "between_tools"},這會關閉第一次回答前的推理,而且只能搭配 high 或更低的推理強度。
  • 強制使用工具,也就是將 tool_choice 設為 any 或指定工具。請保留 auto,並在 prompt 中說明什麼情況下要使用工具。
  • 手動設定推理預算 budget_tokens、使用非預設的 temperature、top_p 或 top_k,以及預先填入 assistant 訊息,也就是替模型寫好回覆開頭。
  • 對 2026-08-31 起建立的帳號,在修改 system prompt、工具或較早的訊息後,重播 Sonnet 5.5 的 thinking 區塊。
  • 在 Claude API 與 Google Cloud 上使用舊版 computer_20251124 電腦操作工具。

另有一項變更不會觸發錯誤:模型在工具呼叫之間寫下的簡短說明,現在會以 thinking 區塊傳回。預設顯示設定下,這些區塊是空的,因此原本透過串流顯示這些內容的介面將不再顯示文字。

官方 benchmark 顯示了什麼?

Anthropic 自己公布的表格顯示,Sonnet 5.5 的多項成績只落後 Opus 5.5 幾分,但 token 價格只有一半,而且明顯領先 Sonnet 5。

Benchmark(測試內容)Sonnet 5.5Sonnet 5Opus 5.5GPT-6 Sol
Terminal-Bench 4.0(在終端機中進行代理式程式開發)70.6%10.3%66.4%(xhigh)未公布
CursorBench 4.0(在編輯器中撰寫程式)55.5%34.1%57.8%未公布
GDPval-AA v2.1(知識工作文件,Elo 評分,越高越好)1844144918461487
OSWorld 2.1(電腦操作,部分給分)80.1%57.0%81.8%未公布
Humanity’s Last Exam,使用工具64.5%54.9%67.7%未公布

Artificial Analysis 也提醒了成本問題:Sonnet 5.5 使用 max 時,在 Intelligence Index 得到 56 分,比同樣使用 max 的 Opus 5.5 少 2 分,但每項任務用了約 193K 個輸出 token,是該機構測過的最高紀錄。這比使用 max 的 Opus 5.5 或 Sonnet 5 多約 60%,每項指標任務的成本約為 $7.60。

我們怎麼測量?

我們準備了 13 項答案已知的單輪任務,也就是一次 prompt、一次回覆、不使用工具,並交給三個模型處理。其中 8 項較短,例如加總 60 以下的質數,以及計算 1 到 500 之間數字 7 出現的次數。另外 5 項需要真正的多步驟推導,包括 10 個項目的背包問題、穿越有障礙物之 8x8 網格的路徑數,以及 13 的 1,001 次方除以 10,007 的餘數。所有標準答案都在本機以暴力法計算,每個 prompt 最後都要求「只回覆一個整數,不要包含其他內容。」每項任務都分別以 API 預設設定和五種推理強度執行 3 次,總計 702 次呼叫,全部透過原生 Messages API 完成。每個 prompt 都加入唯一的隨機字串,避免回覆來自快取,成本則依 Anthropic 公開定價計算。我們檢查最終答案是否正確,也檢查回覆是否只包含答案。

正確率沒有拉開模型之間的差距。Sonnet 5.5 在 234 次呼叫中全部答對,Sonnet 5 則在成功回傳的 233 次呼叫中全部答對,另有一次發生伺服器錯誤。Opus 5.5 在 low 與預設設定下各答錯一項任務。

Sonnet 5.5 每項任務真的比 Sonnet 5 便宜嗎?

使用預設設定時,Sonnet 5.5 的成本比 Sonnet 5 低 80%;使用 low、medium 與 high 時則低 77% 到 78%。原因是 Sonnet 5.5 的輸出 token 約只有 Sonnet 5 的五分之一。兩者定價完全相同,因此節省的成本全都來自更高的 token 效率。Sonnet 5 在每種推理強度下,每項任務都會輸出約 1,800 到 2,100 個 token;Sonnet 5.5 在 xhigh 之前則只有約 400 個。

全部 13 項任務,每項任務Sonnet 5.5Sonnet 5Opus 5.5
API 預設設定$0.0041(396 tokens)$0.0212(2,105)$0.0070(334)
low$0.0043(409)$0.0184(1,817)$0.0065(309)
medium$0.0040(383)$0.0180(1,780)$0.0082(393)
high$0.0043(416)$0.0188(1,858)$0.0088(421)
xhigh$0.0059(574)$0.0202(2,001)$0.0105(507)
max$0.0146(1,438)$0.0193(1,909)$0.0234(1,149)

依推理強度分組的每項任務成本長條圖,單位為每 1,000 項任務的美元成本。Claude Sonnet 5.5:預設設定 4.1、low 4.3、medium 4.0、high 4.3、xhigh 5.9、max 14.6。Claude Opus 5.5:預設設定 7.0、low 6.5、medium 8.2、high 8.8、xhigh 10.5、max 23.4。Claude Sonnet 5:預設設定 21.2、low 18.4、medium 18.0、high 18.8、xhigh 20.2、max 19.3

Token 數是每次呼叫的平均輸出 token,包含推理。在 5 項困難任務中,預設設定可節省 84%($0.0057 對 $0.0348)。在我們的工具迴圈裡,每一輪都會重新傳送整段對話記錄,成本主要來自輸入 token,因此只節省 8%。對這類單輪 prompt 而言,Anthropic 宣稱的「最多降低 30%」相當保守;對我們這種短工具迴圈而言,這個數字又顯得偏高。

由於只有 13 個任務,預設設定下 80% 的降幅範圍較寬:對任務重新抽樣得到的 95% 區間為低 66% 到 85%;從 low 到 xhigh 的每個檔位,區間下限都高於 50%。

各推理強度的成本是多少?

在 Sonnet 5.5 上,low、medium 與 high 每項任務的成本都在 $0.0042 左右,因此本次測試中,預設的 high 並沒有增加成本。xhigh 貴約 40%,max 則是預設設定的 3.5 倍。使用 max 時,Sonnet 5.5 每項任務的成本是 Opus 5.5 預設設定的兩倍($0.0146 對 $0.0070),正確率卻沒有提升。

成本曲線不會在所有工作負載上都這麼平坦。在一項較長的 DevOps 任務中,另一位測試者發現 high 使用的輸出 token 約為 medium 的兩倍。只要推理強度可能影響工作負載,就應該自行測試所有設定。

為什麼 Sonnet 5.5 會把推導過程寫進答案?

在低於 xhigh 的設定下,Sonnet 5.5 不一定會使用 thinking 區塊。沒有使用時,它就直接在回覆中推理。Thinking 區塊是回應中專門存放模型推理的獨立部分,預設不會顯示文字,正式答案則放在後續的 text 區塊。

Sonnet 5.5 的 234 則回覆中,166 則包含 thinking 區塊,而且都只回覆答案。其餘 68 則沒有 thinking 區塊,全都先寫出推導過程,例如先寫「09:47 + 3:46 = 13:33 … + 1:39 = 15:40」,最後才回答「15:40」。最終答案每次都正確,但回覆格式不符合 prompt 要求。

僅包含答案的回覆Sonnet 5.5Sonnet 5Opus 5.5
API 預設設定22 / 3938 / 3938 / 39
low12 / 3937 / 3938 / 39
medium24 / 3937 / 3939 / 39
high30 / 3938 / 3939 / 39
xhigh39 / 3935 / 3839 / 39
max39 / 3937 / 3939 / 39

這種現象按任務出現:凡是出現這種情況的任務,Sonnet 5.5 三次重複都寫出了推導過程,只有預設設定下的一個任務是三次中有兩次。low 下 13 個任務中有 9 個出現這種情況,預設設定下 6 個,medium 下 5 個,high 下 3 個(都是簡短的算術題)。以任務計算時,由於只有 13 個任務,這些差距都無法通過 Holm 校正,因此應把這些計數視為本次觀察到的結果,而不是可據以規劃的比例。Sonnet 5 的格式錯誤則不同:它會先以粗體顯示正確答案,再補上一小段說明。xhigh 那一列只有 38 次呼叫,是因為其中一次發生伺服器錯誤。

加入 system prompt,要求「只輸出最終結果」並在內部完成所有推導,仍然沒有改善。Sonnet 5.5 在 low 下的 24 項短任務中只有 8 次只回覆答案,在 medium 下則為 9 次;未加入 system prompt 時分別是 6 次與 9 次。xhigh 可以解決這個問題,每次都有 thinking 區塊,而且只回覆答案,但成本比 low 到 high 高約 40%。如果程式需要解析模型輸出:

  • 如果回覆必須只有一行答案,請使用 xhigh。
  • 或者讀取最後一個非空白行,本次測試的 68 個案例都能取得正確答案。
  • Anthropic 的結構化輸出也能用 schema 限制回覆格式,但我們沒有測試這種方式。
import anthropic

client = anthropic.Anthropic()
prompt = "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else."
resp = client.messages.create(
    model="claude-sonnet-5-5",
    max_tokens=16000,
    output_config={"effort": "xhigh"},  # low, medium, high (API default), xhigh, max
    messages=[{"role": "user", "content": prompt}],
)
text = "".join(block.text for block in resp.content if block.type == "text")
lines = text.strip().splitlines()
answer = lines[-1] if lines else None  # below xhigh, working can precede the answer
print(answer, resp.usage.output_tokens)  # output_tokens includes the reasoning

放進工具迴圈後會怎樣?

使用預設設定、low 與 medium 時,Sonnet 5.5 在四題程式碼閱讀迴圈的每次執行中都能成功解題,成本約為 $0.011,只有 Opus 5.5 的三分之一。使用 max 時,工具呼叫次數增加為三倍,成本也超過 Opus 5.5。每個模型可以在一個小型合成程式碼庫中使用三種工具,分別是列出檔案、讀取檔案與搜尋。每個答案都需要跨檔案查詢 3 到 6 次。

工具迴圈,每種設定執行 12 次成功解題回合數中位數每次執行的工具呼叫數每次執行成本總耗時中位數
Sonnet 5.5,預設設定12 / 1234.8$0.01126.7 s
Sonnet 5.5,low12 / 1234.9$0.01127.4 s
Sonnet 5.5,medium12 / 1235.1$0.01136.8 s
Sonnet 5.5,max12 / 12414.7$0.042220.1 s
Opus 5.5,預設設定12 / 1245.3$0.033225.3 s
Sonnet 5,預設設定11 / 123.54.2$0.012215.8 s

VentureBeat 報導的客戶說法指出,Sonnet 5.5 的工具呼叫次數比 Sonnet 5 少,例如 Lovable 的呼叫次數少了三分之一。我們的迴圈太短,無法重現這項差異:Sonnet 5.5 每次執行呼叫 4.8 次,Sonnet 5 則是 4.2 次。不過,Sonnet 5.5 的成本仍低 8%,完成速度也快了一倍以上。

Sonnet 5.5 比較快嗎?

它較早完成,主要是因為輸出較少。使用預設設定執行單輪任務時,從送出請求到收完整回應的總耗時中位數,Sonnet 5.5 為 3.9 秒,Sonnet 5 為 8.1 秒,Opus 5.5 則為 5.5 秒。兩個 Sonnet 每秒總耗時輸出的 token 數差不多,分別為 88 與 91。等待時間減半,不是因為 Sonnet 5.5 生成 token 的速度更快,而是因為它只輸出五分之一的 token。在困難任務中,兩者耗時分別為 5.8 秒與 21.0 秒。

Sonnet 5 的 token 預算可以沿用嗎?

為 Sonnet 5 設定的上下文預算與 max_tokens 上限應仍然適用。Anthropic 的遷移說明指出 Sonnet 5.5 使用相同的 tokenizer;我們測試的四段固定文字(英文段落、Python 程式碼、JSON 工具參數、中文段落)在兩個模型以及 Opus 5.5 上的計數完全相同,例如英文為 1,270 個 token,中文為 493 個;Sonnet 5.5 與 Opus 5.5 每次請求固定多出 2 個 token。帶工具的請求在輸入上略便宜:Anthropic 的價格頁列出,隱藏的工具使用系統提示在 Sonnet 5.5 上為 286 個 token,在 Sonnet 5 上為 354 個。

該選哪一個?

大多數 Sonnet 5 工作負載都應該換到新版,接下來只需要選擇推理強度。

工作負載注意事項建議數據
由程式解析輸出:擷取、分類、單一值低於 xhigh 時,推導過程可能寫進回覆使用 xhigh 的 Sonnet 5.5,或使用 medium 並解析最後一行xhigh 僅含答案 39 / 39,medium 為 24 / 39;xhigh 貴約 40%
對話與使用者可見文字延遲與成本使用 medium 的 Sonnet 5.5每項任務 $0.0040,耗時中位數 3.9 s
使用工具的代理迴圈max 可能大幅增加工具呼叫使用預設設定或 medium 的 Sonnet 5.5;與其使用 Sonnet 5.5 的 max,不如改用 Opus 5.5預設設定每次執行 $0.011,max 為 $0.042,Opus 5.5 為 $0.033
關閉推理或強制使用工具的 Sonnet 5 程式碼更換模型後收到 HTTP 400使用 between_tools(high 或以下)以及 tool_choice: autoAnthropic 遷移指南

無論使用哪種推理強度,程式中都應保留兩項檢查:回覆格式是否符合解析器預期,以及每次請求的輸出 token 上限。單輪 prompt 使用 max 時,每項任務成本增加到 3.5 倍;工具迴圈中的呼叫次數則增加到 3 倍。

常見問題

Sonnet 5.5 比 Opus 5.5 便宜嗎? 使用各自的預設設定時,Sonnet 5.5 的單輪任務成本比 Opus 5.5 低 41%,工具迴圈的每次執行成本只有三分之一。使用 max 時順序會反轉:Sonnet 5.5 的單輪任務成本是 Opus 5.5 預設設定的兩倍,工具迴圈成本則高 27%。

Sonnet 5.5 應該使用哪種推理強度? 在我們的任務中,Sonnet 5.5 使用 low、medium 與 high 的成本大致相同,介於 $0.0040 到 $0.0043,因此對話與工具迴圈可以先從 medium 開始。如果程式要把回覆解析成單一值,請使用 xhigh;max 的成本是預設設定的 3.5 倍。

Sonnet 5.5 還能關閉推理嗎? Sonnet 5.5 會拒絕 thinking: {"type": "disabled"},並回傳 HTTP 400。請改送 thinking: {"type": "between_tools"},此設定可搭配 low、medium 或 high。

相關測量:Claude Opus 5.5 與 Opus 5 的比較、Claude Sonnet 5 tokenizer,以及各家模型的推理控制方式。

測量日期為 2026-09-29,也就是發布後一天,透過連接 Anthropic Messages API 的閘道完成。測試包含 702 次有評分的單輪呼叫,涵蓋 13 項以暴力法產生標準答案的任務、3 次重複、6 種推理強度與 3 個模型;另有 48 次呼叫用於測試 system instruction 對輸出格式的影響、72 次工具迴圈執行,涵蓋 4 個多步驟問題、3 次重複與 6 種設定,以及每個模型對四段固定文字的 token 計數。所有 prompt 都加入隨機字串,成本依 Anthropic 公開定價計算。

← 返回部落格