新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。
GPT-5.6 提示詞指南:兩個預設值讓費用變成 1.5 倍與 10 倍

GPT-5.6 提示詞指南:兩個預設值讓費用變成 1.5 倍與 10 倍

目錄
  1. GPT-5.6 的請求應該長什麼樣子?
  2. reasoning_effort 應該怎麼設定?
  3. 提示詞該如何安排,才能發揮快取效益?
  4. 從 GPT-5.5 移植提示詞時,哪些地方會出問題?
  5. 該用哪個層級執行提示詞?
  6. 常見問題

要用好 GPT-5.6,關鍵主要在兩個請求參數,而且兩者的預設值都是成本較高的選項。在我們涵蓋 50 次呼叫的測試矩陣中,省略 reasoning_effort 的計費是明確設為 "none" 的 1.5 倍,但答案完全相同;若未標記固定前綴,每次呼叫都會按快取讀取費率的 10 倍計費。本文根據 GPT-5.6 成本指南的實測結果,整理出一套請求結構:如何組成正確的請求、依任務調整推理強度、安排提示詞以發揮快取效益,以及從 GPT-5.5 移植提示詞時會遇到哪些問題。

TL;DR

  • 每個 GPT-5.6 請求都要明確設定 reasoning_effort:在我們的 4 項任務矩陣中,省略此參數的計費是 "none" 的 1.5 倍,但答案完全相同。
  • 可接受的推理強度從 nonexhigh;在 Sol 和 Terra 上使用 "max" 都會收到 400。
  • 使用明確的快取中斷點標記固定前綴:快取讀取按輸入費率的 10% 計費,寫入則按 1.25 倍計費。因此,只標記確實會重複使用的內容,而不是看起來固定的所有內容。
  • GPT-5.5 與更舊的模型會對 prompt_cache_options 和中斷點回傳 400;上線時要依版本控管。

GPT-5.6 的請求應該長什麼樣子?

以這個結構為起點,再刪除不需要的欄位。它會明確固定兩個關鍵設定,避免沿用成本較高的預設值:

{
  "model": "gpt-5.6-terra",
  "reasoning_effort": "low",
  "prompt_cache_options": { "mode": "explicit", "ttl": "30m" },
  "prompt_cache_key": "tenant-42",
  "messages": [
    { "role": "system", "content": "…stable instructions…",
      "prompt_cache_breakpoint": { "mode": "explicit" } },
    { "role": "user", "content": "…the part that changes per request…" }
  ]
}

排序原則很簡單:所有固定內容都放在中斷點之前,每次請求都會變動的內容放在後面。動態內容,例如時間戳記、使用者名稱,以及每次呼叫都不同的檢索文件,絕不能放進標記區塊。只要變動 1 個 byte,整個區塊就會重新按 1.25 倍的寫入費率計費。prompt_cache_key 會把重複請求路由到同一份快取;每個租戶或工作階段應使用一個固定的 key,並留意文件所述的軟性上限:每個 key 每分鐘約 15 個請求。

reasoning_effort 應該怎麼設定?

每次都要明確設定;唯一該避免的做法就是不設定。根據實測,未指定 reasoning_effort 的請求,計費是明確設為 "none" 的 1.5 倍,但整個測試矩陣的答案完全相同。可接受的值包括 nonelowmediumhighxhigh;使用 "max" 會收到 400,錯誤訊息也會列出有效範圍。以下是 Luna 在單行數學題測試中,各檔位帶來的結果:

reasoning_effort推理 token答案每次呼叫成本
none0正確$0.000062
low52正確$0.000410
medium85正確$0.000608
high74正確$0.000542

在我們的 token 使用量解析研究中,GPT-5.6 是唯一能在完全關閉推理後,仍正確回答這項測試的模型系列。因此,對擷取、分類、格式化與檢索型呼叫來說,none 是合理的預設值。模型一旦啟用推理,相關 token 不會顯示給你看,卻仍會按完整輸出費率計費。在使用預設設定的數學題範例中,輸出費用有 88% 來自你看不到的思維鏈。只有在評測顯示任務確實需要時才提高檔位,不要只因預設值已經啟用推理就繼續沿用。

提示詞該如何安排,才能發揮快取效益?

依穩定程度排列並標記提示詞各層:先放系統指示,再放工具定義,接著放參考文件,每一層都以中斷點結束;容易變動的使用者訊息則放在最後一個標記之後。每個請求可使用 4 次快取寫入。在預設的隱含模式下,最新訊息會自動加入中斷點並占用其中 1 次。切換到明確模式不只能使用完整的 4 次額度,更重要的是,系統只會快取你標記的內容。

真正的效益來自部分重用,而且實測結果也證實了這一點。固定區塊 A 搭配替換後的尾段 B 時,計量只會重新對尾段收費:在共 2,431 個 token 的提示詞中,1,212 個 token 按快取費率讀取,1,210 個 token 按較高費率重新寫入,逐位數核對後與費率表完全一致。由此可得出 3 項預算原則:

  • 讀取按輸入費率的 10% 計費,因此,已暖機的分層前綴能壓低帳單中的輸入成本。
  • 寫入按 1.25 倍計費,所以標記後從未再次讀取的區塊,會比完全不使用快取多花 25%。只標記會重複使用的內容,不要標記所有看起來固定的內容。
  • 內容完全重複時,相符長度可能會縮到標記之前(某次測試寫入 2,422 個 token,只有 1,897 個 token 命中快取),因此應按折扣費率編列預算,而不是依賴精確的命中數量;各模型系列的下限請參閱我們的快取最低門檻實測

ttl: "30m" 的下限是保證的最短時間,不是上限,而且是 Claude 預設 5 分鐘的 6 倍。目前已不再提供 24 小時方案,因此,原本仰賴延長保留時間的每日批次工作負載,應重新計算損益平衡點。

從 GPT-5.5 移植提示詞時,哪些地方會出問題?

有 2 個問題會直接報錯,另 1 個則不會顯示錯誤。首先,GPT-5.5 與更舊的模型會對 prompt_cache_optionsprompt_cache_breakpoint 回傳明確的 400(prompt_cache_options is not supported on this model),因此共用的提示詞建構器必須依版本控管。其次,部分 5.5 設定使用的 "max" 推理強度也會遭到拒絕。

不會報錯的問題成本更高:GPT-5.6 預設會執行推理,但原本的 5.5 工作負載可能已關閉推理。若移植後的提示詞從未設定 reasoning_effort,在相同費率表下,就會多付省略參數所造成的 1.5 倍費用。快取遷移的情況則相反:5.5 的自動前綴偵測不需要標記,但也無法主動觸發或除錯;到了 5.6,同一份提示詞在標記前不會發揮作用。完成標記後,每次寫入都會記錄在 usage.prompt_tokens_details.cache_write_tokens。若未命中,系統會在你新增的欄位中顯示 0,而不是完全沒有資訊。

該用哪個層級執行提示詞?

三個層級都使用相同的請求結構,因此層級選擇是價格問題,不是提示詞問題:Sol 每百萬 token 為 $5/$30,Terra 是其一半,Luna 則是五分之一。前綴固定、設好 key 並完成快取暖機後,所有層級都能透過快取讀取折扣壓低輸入成本,差異主要會落在輸出價格。只要輸出品質評測允許,就盡量往較低層級調整。各層級的完整成本計算,包括寫入加價的損益平衡點,都整理在成本指南中。

常見問題

GPT-5.6 支援 reasoning_effort: “max” 嗎?

不支援。在 Sol 和 Terra 上,使用 "max" 的請求都會收到 400,錯誤訊息會列出從 nonexhigh 的有效值。需要最高檔位的工作負載應明確傳送 xhigh

快取中斷點能用於 GPT-5.5 嗎?

不能。GPT-5.5 與更舊的模型會對 prompt_cache_options 和中斷點標記回傳 400。這些模型只能使用自動前綴偵測,而且無法主動觸發、指定 key 或除錯。因此,應將其快取行為視為盡力而為,任何會輸出新欄位的提示詞建構器都必須依版本控管。

提示詞實際該使用多少個中斷點?

在額度內,有幾層內容確實會重複使用,就設幾個中斷點。每個請求有 4 次寫入額度;除非切換到明確模式,否則隱含的自動中斷點會占用其中 1 次。一般的分層提示詞通常需要 2 到 3 個中斷點,分別用於指示、工具與參考區塊。加入第 5 個標記不會報錯,但只會共用既有的寫入額度,因為較後面的標記已涵蓋前面的所有內容。

本指南的所有數字,都是透過 Synthorai 閘道在 GPT-5.6 首日模型上實測所得,並已與即時 usage.cost 計量結果核對一致;測試方法與原始探測資料請參閱成本指南快取最低門檻實測。請以自己的使用紀錄再次驗證;費率與可接受的值可能會變更。

← 返回部落格