新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。
GPT-5.6 成本指南:Prompt caching 省 90%,以及 reasoning effort 的影響

GPT-5.6 成本指南:Prompt caching 省 90%,以及 reasoning effort 的影響

目錄
  1. 三個級距,同一世代
  2. 文件中的 5.6 快取機制
  3. 計量結果
  4. 對照相同工作負載在 GPT-5.5 上的結果
  5. 第二個槓桿:reasoning effort
  6. 各類工作負載的建議
  7. Tokenizer 沒有改變
  8. 結論
  9. FAQ

GPT-5.6 同時調整了兩個成本槓桿:快取輸入降至一般輸入費率的 10%(5.x 的折扣是 50%);推理則預設開啟。在我們的 50 次呼叫矩陣中,未傳 reasoning_effort 的費用是明確設為 none 的 1.5 倍,但答案完全相同。輸入端現在最多可明確指定 4 個快取 breakpoint;輸出端則由 effort 設定決定要為多少推理量付費。我們在首日上線的 3 個模型上透過閘道實測這兩項設定:Sol(每 1M 輸入/輸出 token 為 $5/$30)、Terra($2.50/$15)與 Luna($1/$6)。所有費率都以即時 usage.cost 計量結果確認。

TL;DR

  • 快取輸入按一般輸入費率的 10% 計費;各級距實測每 1M token 分別為 $0.10/$0.25/$0.50。5.x 的折扣是 50%。
  • Breakpoint 支援部分重用:修改 marker 之後的區塊時,2,431 個 token 中只有 1,210 個重新計費。
  • 少於 1,024 個 token 的 prefix 永遠不會進入快取,重複請求也可能無聲 miss;估算預算時,不要假設命中率能達到 100%。
  • 快取寫入的 token 按 1.25x 計費;如果寫入後從未讀取,成本會高於完全不用快取。
  • 在 4 種任務的測試矩陣中,省略 reasoning_effort 的費用是 none 的 1.5 倍,答案完全相同;請明確指定這個參數。

測量日期為 2026-07-10,透過 Synthorai 閘道執行(相容 OpenAI chat completions),時間點是 OpenAI 發表此系列模型的隔天。3 個模型都已上線,新的快取參數也會原樣透傳。

三個級距,同一世代

這次採用新的命名方式:數字代表世代,Sol、Terra 與 Luna 則是能力級距,取代原本的 pro/mini/nano 後綴。3 個模型都具備 1M-token context window,最大輸出為 128K。下列費率已用已知 token 數量逐一對照 usage.cost,結果完全一致,包括快取輸入欄:

級距輸入 /1M輸出 /1M快取輸入 /1M(實測)
gpt-5.6-sol$5.00$30.00$0.50
gpt-5.6-terra$2.50$15.00$0.25
gpt-5.6-luna$1.00$6.00$0.10

Sol 是旗艦級,也是 gpt-5.5 同價位的後繼模型:費率表同樣是 $5/$30。Terra 與 Luna 則是同世代的精簡級距,價格分別為 Sol 的一半與五分之一,接替過去 mini 與 nano 所在的位置。就 token 計數而言,3 個級距可視為同一個模型:我們送出的每個樣本都得到完全相同的 token 數。

文件中的 5.6 快取機制

過去 GPT 的快取只有一種運作方式:API 會自行偵測重複且至少 1,024 個 token 的 prefix,快取部分按半價計費。因此,我們的供應商快取比較才會把 GPT 歸類為「全自動」。5.6 快取指南則改成雙模式設計:

{
  "model": "gpt-5.6-luna",
  "prompt_cache_options": { "mode": "explicit", "ttl": "30m" },
  "prompt_cache_key": "tenant-42",
  "messages": [
    {
      "role": "system",
      "content": [
        {
          "type": "text",
          "text": "...stable system prompt, 1024+ tokens...",
          "prompt_cache_breakpoint": { "mode": "explicit" }
        }
      ]
    },
    { "role": "user", "content": "the varying part" }
  ]
}

以下是指南中最重要的規則:

  • Breakpoint 代表快取 prefix 的結尾,涵蓋該區塊及之前的所有內容。implicit 模式(預設值)仍會在最新一則訊息自動放置 breakpoint;explicit 模式則只快取明確標記的內容。
  • 每個請求最多進行 4 次快取寫入。implicit 的自動 breakpoint 會占用其中一個名額,因此預設模式可放 3 個 explicit marker,explicit 模式則可放 4 個。對後續請求而言,先前對話 turn 的 breakpoint 只能讀取,不能寫入。
  • 1,024-token 下限依然存在:即使已標記,少於這個長度的 prefix 也不會進入快取。
  • ttl: "30m" 是保證的最短存活時間,不是上限(「至少 30 分鐘……也可能保留更久」)。它取代了 5.6 已棄用的 prompt_cache_retention,舊有的 24h 延長保留選項也隨之移除。
  • 要讓比對結果穩定,請使用 prompt_cache_key:指南建議每個 tenant 或 session 使用固定 key,將重複請求路由到同一份快取。每個 key 的軟性限制約為每分鐘 15 個請求。快取的作用範圍限定在你的組織內。
  • 5.6+ 的快取寫入按一般輸入費率的 1.25x 計費,並記錄在新的 usage.prompt_tokens_details.cache_write_tokens 欄位中。5.x 及更早版本不收取寫入費用。

GPT-5.5 與更舊的模型會直接以 400 拒絕新參數(prompt_cache_options is not supported on this model),因此 rollout 時必須按版本啟用。

這套設計應該不陌生:在 content block 上放 marker、4 個 breakpoint、寫入加價,以及可滑動且唯讀的歷史記錄,都是 Claude cache_control 長期以來的運作方式。差別在 TTL:OpenAI 保證至少 30 分鐘,是 Claude 預設 5 分鐘的 6 倍。

計量結果

文件寫的是規格,以下則是閘道逐項 probe 後回傳的實測結果。完整原始資料收錄於執行紀錄;下列每筆成本都能按各級距費率精確對上。

測試項目結果
explicit 寫入,已標記約 3k-token prefix(Luna)cache_write_tokens=3012,按 $1.25/1M 計費:正好是 1.25x
改用不同問題重複呼叫cached_tokens=3012,完整命中標記內容,按 $0.10/1M 計費;這次呼叫的成本比寫入呼叫低 90%
Sol/Terra 的寫入加價每 1M 寫入 token 為 $6.25 / $3.125:兩者都精確為 1.25x
Sol/Terra 的快取費率每 1M 為 $0.50 / $0.25:正好是一般輸入的 10%
621-token 的已標記區塊,呼叫兩次始終未快取:cache_write=0cached=0,兩次都按全額計費
1,221-token 的已標記區塊正常寫入(寫入 1,212 個)
兩個 breakpoint [A][B],接著修改 Bcached=1212(正好是區塊 A)+ cache_write=1210(新的 tail,按 1.25x 計費)
單一請求中放置 5 個 breakpoint全部接受,未回傳錯誤,寫入全部 5,548 個 token(4 次寫入的上限計算的是 slot,不是 token;後面的 mark 會涵蓋它之前的所有內容)
在 Luna 寫入 prefix,再傳給 Terracached=0,重新寫入:快取按模型隔離
快取 miss也可能同時出現 cache_write=0:按全額計費、沒有快取,也不會報錯

其中 3 項需要進一步說明。

部分重用確實有效,也是採用 breakpoint 的主要理由。 當區塊 A 維持不變、只替換 tail B 時,計量結果只重新計費 tail:在 2,431-token prompt 中,有 1,212 個 token 按快取費率讀取,新 B 的 1,210 個 token 則按寫入加價計費;總成本可逐位對上費率表。這就是分層 prefix 的運作方式:依序標記 system prompt、工具與文件。Claude 使用者一直都會按照這種方式設計 prompt,而 GPT 的自動模式無法保證這種行為。另有一點要注意:完整重複請求的比對長度有時會縮到 mark 之前。某次 probe 寫入 2,422 個 token,卻只命中 1,897 個。因此,編列預算時可採用折扣費率,但不要假設每次都能精確命中全部標記內容。

token 下限與無聲 miss 是營運上最容易踩到的問題。 一個 621-token 的已標記區塊連續兩次都未進入快取,既不報錯,usage 中也只有 0。如果你的「穩定 prefix」只是簡短的 system prompt,實際上仍按全額付費,系統也不會主動提醒。快取 miss 同樣可能不觸發寫入、按全額計費,而且不會發出任何訊號。無論請求走哪條路徑,命中率都是一種分布,不是保證。請在正式環境讀取 cached_tokens 並設定告警,就像我們在五分鐘快取稽核中採用的方式。

寫入加價確實存在,也改變了損益平衡點。 3 個級距的寫入 token 都精確按一般輸入費率的 1.25x 計費(Luna 每 1M 寫入 token 為 $1.25、Terra 為 $3.125、Sol 為 $6.25)。最終測試中的每筆資料都能逐位對上。只有再次讀取該 prefix,這筆加價才會回本:如果寫入後從未命中,成本會比完全不用快取高 25%。這與我們在 LangChain 文章中實測 Claude 寫入加價時發現的問題相同。只標記確定會重複使用的 prefix,不要看到內容穩定就全部標記。

在我們測試的時間範圍內,至少 30 分鐘的承諾成立。寫入 15 分鐘後,使用相同 key 重新讀取,1,313 個 token 全數命中,並按 10% 費率計費,已明顯超過舊有記憶體快取的 5 至 10 分鐘範圍。第二個使用相同時間間隔與 key 的 probe 也得到相同結果。我們沒有測滿 30 分鐘。

對照相同工作負載在 GPT-5.5 上的結果

最公平的比較方式是看相同價位:Sol 沿用 gpt-5.5 的完整費率表($5/$30),因此是直接對應的後繼模型;Terra 與 Luna 則是更低的精簡級距。牌價相同,快取條件卻差很多:

gpt-5.5gpt-5.6-sol
每 1M 輸入/輸出牌價$5.00 / $30.00$5.00 / $30.00
快取輸入費率一般輸入的 50%(文件規格)一般輸入的 10%(實測)
快取控制僅自動模式自動模式 + 最多 4 個 explicit mark
存活時間5-10 分鐘,best effort;可選 24h 保留使用 key 時保證至少 30 分鐘;24h 選項已移除
快取寫入費用寫入 token 按一般輸入的 1.25x 計費

在相同牌價下,升級的核心是快取條件。對 3,000-token prefix 而言,gpt-5.5 每次呼叫成本為 $0.0075,前提是自動快取判定命中;在已預熱的 Sol 上則是 $0.0015,快取部分便宜 5 倍。更深層的改變在控制能力與可觀測性:5.5 是否命中取決於不透明的 prefix 偵測,你既不能主動觸發,也無法除錯;5.6 則能精確標記要快取的內容,用 prompt_cache_key 路由重複請求,並在 usage 中查看每次寫入。現在 miss 會在你啟用的欄位中顯示為 0,而不是完全沒有訊號。往低級距調整還能進一步降低成本:如果 5.5 對工作負載來說效能過剩,Terra 會把整張費率表減半,Luna 則降為五分之一;同一個已預熱 prefix 的成本也會降至 $0.00075 與 $0.0003。5.5 唯一保留的優勢是可選的 24 小時保留。如果流量模式是每天針對大型 prefix 執行一次批次工作,這項取捨可能反而有利於 5.5。遷移時還要留意另一個方向的成本:5.6 預設會推理,因此若直接把 5.5 工作負載移過去,卻未明確設定 reasoning_effort,即使費率表相同,仍會增加新的輸出成本。

第二個槓桿:reasoning effort

快取控制的是輸入成本;reasoning_effort 控制輸出端。reasoning token 按輸出費率計費,而且不像 prefix,永遠無法快取。GPT-5.6 的所有級距都接受從 nonexhigh 的設定。發表文章也為 Sol 介紹了 max effort,但 chat completions 並不支援(Sol 與 Terra 都會回傳 400: 'reasoning_effort' does not support 'max' with this model)。因此,對閘道與 SDK 使用的 API 路徑而言,實際上限是 xhigh

我們執行了 50 次呼叫的測試矩陣:4 種任務型態(評論分類、從 log line 擷取欄位、多步驟算術文字題、小型程式碼生成),搭配全部 6 種設定,包含從 nonexhigh,再加上省略參數;主要在 Terra 與 Luna 上執行,並以 Sol 抽查。50 次呼叫在所有設定下都得到正確答案。差異只在帳單。這些呼叫的可見輸出都很短,只有數十個 token,因此即使只有幾十個 reasoning token,按輸出費率計價後也會成為總成本的主要部分。比率欄比較的是整次呼叫的成本:

任務(Luna)none 的 reasoning token預設值(省略參數)預設成本相對於 none
分類001.0x
擷取001.0x
數學0243.5x
程式碼0392.5x

有 3 個發現。第一,5.6 本身具備自適應能力:在兩種簡單任務中,無論設定為何,都沒有消耗任何 reasoning token,因此這裡調整 effort 不會產生成本。第二,遇到看似需要思考的任務(數學、程式碼)時,預設值會進行推理,即使結果並未改善。在 Luna 的數學與程式碼任務,以及 Terra 的數學任務中,省略參數的成本是 none 的 2.5x 至 3.5x,但答案完全相同。Terra 的程式碼測試碰巧在預設值下未消耗 reasoning token。合計 Terra 與 Luna 的測試矩陣後,省略參數的總成本是 none 的 1.5x。第三,介於兩者之間的設定(表中未列)比較像雜訊,而不是可精準控制的旋鈕:Terra 的數學任務在 low 消耗 19 個 reasoning token、medium 為 0、high 為 21、xhigh 又回到 0;Luna 的程式碼任務在 xhigh 消耗 101 個,在 high 則是 41 個。這些名稱表達的是意圖,不是預算,與我們在 GLM 5.2上的實測行為相同。

每次呼叫都應明確傳送 reasoning_effort,並以 none 作為預設值,尤其是分類、擷取、路由與簡短轉換。只有當 eval 證明較高設定會改變結果時,才升級特定 call site;不要只因為任務感覺很難就提高設定。我們測試的 4 種型態都是短輸出的 API 工作負載。真正困難的多步驟任務可能值得支付推理成本,但應由測量結果決定。

這兩個槓桿會疊加作用。prefix 預熱後,Luna 呼叫的輸入端只需支付牌價的十分之一;對短任務來說,預設推理就會變成剩餘成本中最大的一項。Luna 的數學呼叫在 none 下總成本為 $0.00007,省略參數時則為 $0.00025:光是預設推理就增加 $0.00018,超過受控呼叫完整成本的兩倍。只做快取卻不固定 effort,省下的成本會從另一端流失。

各類工作負載的建議

現在可以按照明確條件做決策。以下是我們提供給閘道客戶的建議:

工作負載型態建議
chat,只有一個大型且穩定的 system prompt保持 implicit;自動 breakpoint 已足夠,兩種模式的折扣都是 90%
具有分層 prefix 的 agent(system + tools + files)使用 explicit 模式,標記每一個穩定層,把易變內容放在最後;某層改變時,只會從該層的 mark 開始重新計費
context 會重新排序的 RAG在 retrieved chunk 上方的各層放置 explicit mark;重新排序後只需支付 tail 的成本
相隔 10-30 分鐘的 cron 與零星工作30m TTL 下限正是針對這類工作負載(5.x 與 Claude 預設的 5m 都無法命中);實測中,15 分鐘後使用 key 重新讀取會完整命中
短 prompt(<1,024 個 token)不適用快取;不必浪費時間標記

無論工作負載型態為何,都應為每個 tenant 或 session 傳送穩定的 prompt_cache_key。文件把 key 視為可靠比對的基礎。每個已標記層也必須超過 1,024-token 下限,並監控 cached_tokens,因為無聲 miss 確實存在。快取按模型隔離:如果跨級距進行 A/B test,兩邊都必須從零重新預熱。同一個 commit 也應處理另一個成本槓桿:根據上面的矩陣固定 reasoning_effort;除非 eval 顯示應使用其他值,否則設為 none

在級距選擇上,90% 折扣對成本的影響大於級距本身。重複使用 3,000-token prefix 的工作負載,在已預熱的 Luna 流量中,每 1,000 次呼叫約支付 $0.30 的 prefix 成本;已預熱的 Sol 則為 $1.50。不同級距在快取輸入上的價差,小於輸出 token 的價差。因此,先依輸出品質與價格選擇級距,再用快取壓低輸入成本。如果目前使用 gpt-5.5,Sol 可在相同費率表下直接升級,快取讀取便宜 5 倍,而且能控制何時快取。若 eval 顯示較小級距仍可滿足需求,再降到 Terra 或 Luna;費率表會進一步減半或降為五分之一。

Tokenizer 沒有改變

我們使用 24 個樣本進行比較,包括 9 種語言的敘事文章、其中 6 種語言的技術與新聞版本、一個 Python 函式,以及一個 JSON tool call。所有成功完成的比較中,GPT-5.5、Sol、Terra 與 Luna 的 token 計數完全相同。以 5.5 校準的 token 預算與快取下限估算可以直接沿用;跨語言行為整理在各語言 tokenizer 比較文章中,同樣適用於 5.6。

結論

  • 快取折扣從 50% 加深至 90%,再加上保證至少 30 分鐘的 TTL,才是這次發布真正的降價。級距價格比較吸睛,但快取條件對實際帳單的影響更大。
  • 分層 prompt 應採用 explicit breakpoint:部分重用已經實測驗證,不只是理論,而且操作方式可直接沿用 Claude 的心智模型。
  • 遵守 1,024-token 下限,傳送 prompt_cache_key,並監控 cached_tokens;無聲 miss 與完全未進快取都確實存在。
  • 明確傳送 reasoning_effort,預設設為 none:在我們的測試矩陣中,未受控的預設值費用是 1.5x,單一任務最高達 3.5x,但答案完全相同。
  • xhigh 是可用的最高設定(透過 chat completions 傳送 max 會得到 400);從 5.5 遷移時不必重新校準 tokenizer。

FAQ

GPT-5.6 是否像 Claude 一樣支援明確的 prompt caching? 是。使用 prompt_cache_options: {"mode": "explicit"},並在 content block 上放置 prompt_cache_breakpoint marker。每個請求最多可進行 4 次寫入;在 implicit 模式下,自動 breakpoint 會占用一個名額,因此只剩 3 個。我們透過相容 OpenAI 的閘道實測:已標記的 3,012-token prefix 在第一次呼叫時寫入,第二次呼叫則以快取費率完整讀回。

GPT-5.6 的快取輸入成本是多少? 一般輸入費率的 10%。3 個級距的實測結果分別是:Luna 每 1M 為 $0.10、Terra 為 $0.25、Sol 為 $0.50。GPT-5.x 的快取 token 按一般輸入的 50% 計費,因此 5.6 的快取 token 費率低了 5 倍。

GPT-5.6 的快取是否優於 GPT-5.5? 若比較折扣幅度與控制能力,答案是肯定的:快取費率從 50% 降到 10%;從只能依賴無法觸發或除錯的自動偵測,改為支援 4 個 explicit breakpoint;使用 key 時保證至少 30 分鐘,而不是 5-10 分鐘的 best effort。5.5 僅剩的優勢是可選的 24 小時保留級距,5.6 已移除這個選項。

GPT-5.6 快取可以存活多久? 文件保證至少 30 分鐘(ttl: "30m" 是唯一接受的值),也可能更久。這個選項取代已棄用的 prompt_cache_retention,包括舊有的 24 小時延長級距。在我們的 probe 中,寫入 15 分鐘後使用 key 重新讀取,內容會完整命中;我們沒有測滿 30 分鐘。

我需要使用 prompt_cache_key 嗎? 請傳送。文件把每個 tenant 或 session 的穩定 key 視為 5.6 可靠比對的基礎,每個 key 的軟性限制約為每分鐘 15 個請求。加入這個參數沒有成本;搭配監控 cached_tokens,才能確認折扣是否真的生效。

reasoning_effort 對 GPT-5.6 成本有多大影響? 在我們的 50 次呼叫矩陣中(4 種任務型態、6 種設定、Terra 與 Luna),所有設定都產生正確答案。整體而言,省略參數的費用是 none 的 1.5x;算術任務最高達 3.5x。簡單任務(分類、擷取)在任何設定下都沒有消耗 reasoning token。請固定使用 none,只有在 eval 顯示有必要時才提高設定。

GPT-5.6 Sol 是否支援 max reasoning effort? chat completions 不支援。在 Sol 與 Terra 上傳送 reasoning_effort: "max",都會回傳 400,並列出從 nonexhigh 的可用值。

API 工作負載應選擇哪個 GPT-5.6 級距? Sol 是 gpt-5.5 的同價位後繼模型,費率表同為 $5/$30,快取讀取便宜 5 倍;Terra 與 Luna 則是精簡級距,價格分別為 Sol 的一半與五分之一。prefix 穩定並使用 key 後,90% 快取折扣會大幅壓低輸入成本。因此,只要輸出品質 eval 允許,就盡量選擇較低級距,讓模型級距主要決定輸出價格。

本系列其他實測成本指南:7 個 ASR 模型的音訊轉錄成本圖像生成成本GPT Realtime 語音定價

← 返回部落格