🎁 新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。
Claude Opus 5 與 Opus 4.8 實測:定價相同,費用相差 3 倍

Claude Opus 5 與 Opus 4.8 實測:定價相同,費用相差 3 倍

目錄
  1. Opus 5、Opus 4.8 與 Fable 5 作為平台有何差異?
  2. Opus 5 的預設費用比 Opus 4.8 高多少?
  3. 額外費用花到哪裡?
  4. 關閉思考的設定實際有何效果?
  5. Agent 工作負載也會多付 3 倍嗎?
  6. Opus 5 真的只要 Fable 5 一半的費用嗎?
  7. Context、快取與 tokenizer:我們還驗證了什麼?
  8. 常見問題

Claude Opus 5Claude Opus 4.8 的輸入、輸出定價相同,分別是每百萬 token $5 與 $25;但在相同 prompt 下,採用預設設定的 Opus 5 費用高出 3.1 倍。原因在於 adaptive thinking:Opus 5 預設會進行思考,思考 token 按輸出計費,內容卻完全不會顯示。只要調整一個請求設定,費用就能與 Opus 4.8 完全一致;但規模更大的 Fable 5 不接受這項設定。Opus 5 已於 2026-07-24 正式推出,定位是以一半的 token 單價提供 Fable 5 等級的智慧;實際帳單能否減半,幾乎完全取決於這個選項。

TL;DR

  • 在五項任務矩陣中,預設 Opus 5 的費用是同價 Opus 4.8 的 3.1 倍;其輸出 token 有 42-95% 是隱藏的思考內容。
  • thinking: {"type": "disabled"} 讓 Opus 5 的費用與 4.8 完全一致(輸出 token 為 384 對 384),準確率不變;Fable 5 會拒絕這個參數。
  • 在 agent 流量中,額外費用縮小至 +33%,工具與批次情境接近持平:adaptive thinking 在工具迴圈中很少啟動。
  • 1M context window 確實可用(在第 969,950 個 token 成功找回 needle),快取門檻是 512 token,只有 4.8 的 1,024 token 一半。

Opus 5、Opus 4.8 與 Fable 5 作為平台有何差異?

在深入分析費用前,先整理三個現行 Claude 層級在定價與請求格式上的差異。以下為並列比較(已標示實測項目,其餘取自模型文件):

Opus 4.8Opus 5Fable 5
定價(每百萬輸入/輸出 token)$5 / $25$5 / $25$10 / $50
預設思考模式除非明確要求,否則關閉adaptive,開啟(實測)永遠開啟
thinking: disabled接受,不受 effort 影響effort 為 high 或以下時接受拒絕並回傳 400(實測)
Effort 層級low-max,預設 highlow-max,預設 high(費用面實測如下)low-max,預設 high
是否回傳思考內容預設不適用永不回傳(實測)永不回傳
快取門檻1,024 token512 token(實測)512 token
Context window1M1M,預設與上限皆相同(第 969,950 個 token 的 needle,實測如下)1M
Assistant prefill拒絕拒絕,明確回傳 400(實測)拒絕
Fast mode可用(research preview)可用,$10/$50不提供
拒絕請求時的 fallback作為預設 fallback 目標fallbacks,包含新的 "default" 模式(beta)由此版本導入(明確清單)
資料保留標準選項標準選項強制保留 30 天

其中三列需要額外說明。thinking: disabled 是遷移時最容易踩到的坑:依文件說明,Opus 5 會把這項設定與 effort 綁定,只有 high 或以下才接受;4.8 則將兩項設定分開處理。遷移指令碼應依版本分流。Fast mode 則帶出後面一項重要比較:追求速度時,Opus 5 的定價正好等於 Fable 5,因此「fast Opus 5 與預設 Fable 5」是在相同 token 單價下,單純比較速度與能力。資料保留政策也有合規優勢:Opus 5 提供 Fable 等級的智慧,卻不受 Fable 5 強制保留資料 30 天的規定 約束。

另外還有兩項不適合放進表格的平台差異。Anthropic 文件指出,關閉思考可能出現少數邊界狀況,例如工具呼叫偶爾寫進可見文字,或內部標籤外洩。在下方實測的 agent 套件中,84 次關閉思考的呼叫都未發生這些問題;但這項指引仍支持同一條路由原則:工具密集的路由應保持思考開啟,反正這類流量的額外費用很低。Opus 5 還提供對話中途變更工具的 beta 功能,可在不同輪次新增或移除工具,而不會讓 prompt cache 失效。對長時間執行的 agent 工作階段而言,這能保住我們在 prompt 快取完整指南 中說明的快取前綴效益。

Opus 5 的預設費用比 Opus 4.8 高多少?

在定價相同、工作相同的情況下,費用高出 3.1 倍。我們透過原生 Messages API,以預設設定讓三個現行 Claude 層級執行五項任務矩陣(每格 n=3,prompt 加鹽),並加入 Fable 5 作為比較基準:

任務Opus 5 預設Opus 4.8Fable 5準確率
簡單算術12312全部 3/3
單句事實問答40611全部 3/3
小型程式函式703844
多步驟文字題15210252全部 3/3
120 字文章1,031236264
輸出 token 總數(每組費用)1,305 ($0.03427)384 ($0.01120)383 ($0.02233)

答案相同、定價與 4.8 相同,帳單卻是三倍。Opus 4.8 只有在明確要求時才會思考;Opus 5 預設開啟 adaptive thinking,而且思考 token 全數按 $25/M 的輸出價格計費。

Fable 5 這欄呈現了違反直覺的結果:它的定價高一倍($10/$50),實際費用卻比預設 Opus 5 低 35%。原因是 Fable 5 只用 383 個輸出 token 完成相同任務,而 Opus 5 使用了 1,305 個。三個模型的文件預設 effort 都是 high,所以差異來自思考的校準方式,而非設定不同。數據可由兩個機制解釋。首先,能力更強的模型回答簡單問題時,不需要花太多推理就能確認答案:文字題中 Fable 5 用了 52 個 token,Opus 5 則用了 152 個;文章任務分別為 264 與 1,031 個。其次,Opus 5 的主要能力來自 test-time compute scaling,面對困難問題時可透過更多推理提高品質;但預設校準會為每個請求都買下這份保障,包括完全不需要推理的請求。簡單流量等於付費購買沒有用到的保障;Fable 5 多半不會支付這筆成本。

額外費用花到哪裡?

花在看不到的推理上。將計費的輸出 token 與可見答案文字相比,Opus 5 預設輸出費用中有 42-95% 是隱藏思考,而且即使問題不需要推理也會啟動:17*23 的答案只有 1 個 token,背後卻用了 11 個思考 token;120 字寫作任務的 1,031 個輸出 token 中,約有 806 個花在推理。思考內容不會以任何形式回傳,沒有摘要,也沒有 trace。在我們的 token 用量解析 研究中,Opus 5 與 Fable 5 都位於可觀測性最低的一端。usage 明細只看得到數量,看不到這些 token 換來了什麼。

關閉思考的設定實際有何效果?

它會讓 Opus 5 的帳單變得與 Opus 4.8 相同。傳送 thinking: {"type": "disabled"} 後,每項任務的思考 token 都降為零,總輸出 token 與 4.8 完全一致,都是 384 個;每組費用則為 $0.01130 與 $0.01120:

測試組輸出 token(每組)費用(每組)相對於 Opus 4.8準確率(3 項可驗證任務)
Opus 5 預設(= effort high1,305$0.034273.1x9/9
Opus 5,effort low1,019$0.027202.4x9/9
Opus 5,effort medium1,167$0.030892.8x9/9
Opus 5,明確指定 effort high1,514$0.039563.5x9/9
Opus 5,effort xhigh1,633$0.042623.8x8/8
Opus 5,effort max1,569$0.040933.7x9/9
Opus 5,關閉思考384$0.011301.0x9/9
Opus 4.8 預設(= effort high,不思考)384$0.011201.0x9/9
Fable 5 預設(= effort high,永遠思考)383$0.022332.0x9/9

先說明標示方式:這裡所有模型的 API 文件預設值都是 effort high,Anthropic 也表示明確指定 high 與省略參數完全相同。我們的隱含預設組與明確指定 high 組仍相差 16%,這是寫作任務造成的執行間變異;在所有批次中,這一格的波動都最大,並不代表兩種設定真的不同。這兩列應視為同一測試組執行兩次。三個模型預設行為的差異不在 effort 層級,而在該層級如何處理思考:4.8 完全不思考、Fable 5 節制且自適應、Opus 5 則積極且自適應。

有兩點特別明顯。第一,effort 調節器控制的是品質階梯,不是費用開關。lowmax 這套階梯並非新功能,4.8 也接受相同範圍;但對這類簡單任務而言,高於 low 的每一級只會增加推理量,準確率完全相同,xhigh 的費用最高達 4.8 的 3.8 倍。最高幾級是為了在真正困難的問題上進行 test-time compute scaling,五項基本檢查任務無法驗證其能力面;但它能呈現費用面,而結果顯示無論如何調整,都無法讓費用降至 4.8 的水準。只有關閉思考才能做到,費用比預設低 67%。第二,Opus 5 至少提供了這個開關:Fable 5 會以 400 拒絕 thinking: {"type": "disabled"},因此這是 Opus 5 真正的差異,而非整個產品系列共有的特性。相同的 thinking 物件可用於兩種閘道介面:/v1/messages 與相容 OpenAI 的 /v1/chat/completions;在後者中,關閉思考後,completion_tokens_details 回報的 reasoning_tokens 為零:

{"model": "claude-opus-5", "thinking": {"type": "disabled"}}

這項結果也有明確限制:可驗證的任務主要是資訊擷取與單步驟問題。關閉思考後,準確率仍維持 9/9,其中也包含多步驟文字題。adaptive thinking 原本就是為了更困難的 agent 工作而設計,因此是否關閉應依路由決定,規則與我們測試 Kimi K3Gemini 3.6 Flash 後得出的結論相同:擷取、格式轉換與單步驟呼叫應關閉;若評測證明思考帶來的效益值得付費,則保留預設值。

Agent 工作負載也會多付 3 倍嗎?

不會,這項差異正是重點。在 agent 情境套件中(工具迴圈、RAG、工具操作、批次、長對話;每組 50 個 episode),預設 Opus 5 的費用只比 Opus 4.8 高 33%,而非 210%;工具型情境則接近持平(1.01-1.22x)。這類工作負載下的 adaptive thinking 確實會自我調整:agent 迴圈內每次呼叫約使用 88 個思考 token,單純的寫作 prompt 則用了 806 個。長對話是例外,費用達 1.58x,此時關閉思考仍然划算(關閉後為 1.22x)。Function calling 完全沒有思考附加費:預設設定下,工具呼叫請求以 52 個輸出 token 回傳,沒有附帶任何思考 token,與不進行思考的模型所需用量相同。

實務上應依流量形態分流,而不是只看模型。單純 completion 與對話型呼叫會承擔預設 3 倍費用,適合關閉思考;工具密集的 agent 流量大多不必關閉。

Opus 5 真的只要 Fable 5 一半的費用嗎?

只有關閉思考後才是。按 token 單價計算確實如此:Opus 5 是 $5/$25,Fable 5 則是 $10/$50。但在我們的單純任務矩陣中,預設 Opus 5 每組費用為 $0.03427,Fable 5 則為 $0.02233;前者實際高出 53%,因為 Fable 5 只用 383 個輸出 token 完成相同任務,Opus 5 卻用了 1,305 個。關閉思考後,Opus 5 的 $0.01130 幾乎正好是 Fable 5 帳單的一半。這時才真正兌現上市時的承諾,而且所使用的參數是 Fable 5 本身不接受的。

Context、快取與 tokenizer:我們還驗證了什麼?

1M context window 確實可用,而且超限時會明確失敗。在一個 969,950 token 的 prompt 開頭放入 recall needle,模型於 39 秒內正確找回;若 prompt 達 1,010,221 token,則會清楚回傳 prompt is too long: … > 1000000 maximum,不會默默截斷內容。

快取門檻減半。Anthropic 文件記載 Opus 5(以及 Fable 5)的最小可快取前綴為 512 token,低於 Opus 4.8 與 Sonnet 5 的 1,024 token;我們的掃描結果一致,接近 511 token 的前綴從未進入快取,547 token 則可穩定快取。快取讀取按 $0.50/M(0.1x)計費,寫入為 1.25x,TTL 是 5 分鐘。現在較短的 system prompt 也能快取,對高 QPS 路由有實際效益。

Opus 5、Opus 4.8、Fable 5 與 Sonnet 5 的 tokenizer 完全相同:在多語言與程式碼樣本中,token 數量一致。因此,各語言的預算與 prompt 大小估算都能直接沿用,不必重新建立基準。

常見問題

可以關閉 Claude Opus 5 的思考嗎?

可以,但 effort 必須是 high 或以下;文件指出,若與 xhighmax 搭配,會回傳 400。在我們的測試中,關閉後思考 token 降至零,費用也與 Opus 4.8 持平(任務矩陣的輸出 token 為 384 對 384)。這是 Opus 5 特有的功能:Fable 5 在任何 effort 下都會以 400 拒絕相同參數。Effort 調節器(lowmax)同樣可用,但無法降至持平;相較預設值,我們的矩陣中從 low 的 -21% 到 xhigh 的 +24% 不等。

Opus 5 與 Opus 4.8 定價相同,為何我的 Opus 5 帳單更高?

因為 Opus 5 預設會進行思考,而且思考 token 按 $25/M 的輸出費率計費。在我們的實測中,單純 prompt 的計費輸出有 42-95% 是隱藏推理;一題兩位數乘法的答案只有 1 個 token,背後卻使用了 11 個思考 token。你可以從 usage 明細讀取 reasoning_tokens,確認自身流量中的占比,並在不需要思考的路由上關閉這項功能。

Agent 工作負載應該關閉 Opus 5 的思考嗎?

通常不必。在我們的 agent 套件中,預設費用只比 Opus 4.8 高 +33%,工具與批次情境接近持平,因為 adaptive thinking 在工具迴圈內很少啟動。例外是長對話型工作階段(1.58x),這類流量關閉思考仍然划算。應依自身流量組合量測;額外費用主要出現在單純 completion,而非工具呼叫。

於 2026-07-25 至 2026-07-27,透過 Synthorai 閘道對 claude-opus-5claude-opus-4-8claude-fable-5 進行實測:五項任務矩陣及 effort/開關消融實驗取自同一個標準批次(每格 n=3、prompt 加鹽、使用原生 Messages API);agent 數據來自包含 150 個 episode 的情境套件;context 與快取測試分別採用 needle recall 與前綴掃描;API 格式相關項目(prefill、是否接受開關)來自直接請求測試。準確率只統計答案唯一且可驗證的任務。價格與行為可能變更,請以自身的 usage 紀錄再次確認。

← 返回部落格