新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

GPT-6 Astra 推理強度:max 同答案,成本是 low 的 2.3x

目錄
  1. GPT-6 Astra 的基準測試表現如何?
  2. GPT-6 Astra 接受哪些 reasoning_effort 值?
  3. none 會關閉推理嗎?disabled 呢?
  4. max 比 low 多買到什麼?
  5. GPT-6 Astra 每個答案的價格是 GPT-5.6 Sol 的 2.5x 嗎?
  6. JSON schema 或工具呼叫會增加推理成本嗎?
  7. 付費使用的推理內容能讀到嗎?
  8. GPT-5.6 的哪些行為沿用下來?
  9. Synthorai 如何處理這些設定
  10. 常見問題

GPT-6 Astra 上,reasoning_effort: "max" 的成本是 low 的 2.3x,但 11 個已驗證任務的答案完全相同。唯一會影響正確率的設定是 none,在 33 次執行中失敗 17 次(11 個任務,每個執行 3 次)。reasoning_effort 是控制模型在回答前進行多少隱藏推理的請求參數。這些推理會按輸出費率計為推理權杖,本文測量的就是從 nonemax 這組依序增加的設定。實際設定並不符合文件:API 的輸入檢查列出 7 個值,其中 minimal 在所有模型上都會被拒絕,而未列出的 disabled 卻能在 Astra 上使用,而且完全不會停用推理。這也影響 OpenAI 發表時的基準測試該怎麼解讀。官方表示成績取「所有推理強度中的最高值」,因此排行榜數字來自成本最高的那一級。

TL;DR

  • GPT-6 Astra 接受 7 種 reasoning_effort 值,包括 nonedisabled;文件只列出 5 種,還聲稱不支援 none
  • 只有 none 會讓推理權杖歸零,但它在 33 個已驗證結果中失敗 17 次;其他每一級都是 33 次全對。
  • disabled 使用 243 個推理權杖,low 則是 151 個;正確率相同,但每個正確答案的成本高出 54%。
  • 按定價表計算,GPT-6 Astra 在 low 下每個正確答案的成本是 GPT-5.6 Sol 的 1.57x,在 max 下則是 2.57x,而這些任務兩個模型都能答對。

GPT-6 Astra 的基準測試表現如何?

在代理型工作上領先,也就是由模型在迴圈中操作工具,通常是在終端機內執行;但在 Humanity’s Last Exam 和 Artificial Analysis Intelligence Index(由 10 項評測組成的獨立綜合指標)上落後 Claude Fable 5.1。所有成績都採用表現最好的推理強度。下表來自 OpenAI 的發表頁面,比較欄位也由 OpenAI 選定:

基準測試測試內容GPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5
Terminal-Bench 4.0終端機中的代理任務57.9%37.3%55.8%52.6%
Terminal-Bench Science 0.1使用程式碼的研究工作流程64.6%22.4%52.6%30.0%
FrontierMath Tier 4 (v2)研究等級數學97.6%83.0%87.8%73.2%
ARC-AGI-3解決全新的解謎環境99.9%7.8%未列出30.2%
Humanity’s Last Exam, with tools各領域專家撰寫的問題57.2%未列出65.0%63.6%
Artificial Analysis Intelligence Index v4.1.110 項評測的綜合結果61.260.965.763.1

除了領先項目,還要一併看這 3 點:

  • 在 Humanity’s Last Exam 這一列,Astra 落後 Fable 5.1 達 7.8 個百分點。這項結果只出現在表格中,正文完全沒有提到。
  • OpenAI 自己的表格顯示,Artificial Analysis 這一列的 Astra 落後 Claude Fable 5.1、Claude Opus 5 和 Claude Fable 5;目前的 v4.2 排行榜中,Fable 5.1 為 57 分,Astra 為 55 分,分居第一與第三。
  • OpenAI 表示,網路安全成績是在「未啟用正式環境防護措施」的情況下產生;實際提供的模型「會拒絕」概念驗證型攻擊任務。

表格下方有一句話直接把基準測試和帳單連在一起:「評測成績採用所有推理強度中的最高值。」Artificial Analysis 排行榜會針對每種推理強度分別列出模型,Astra 在 xhigh 得 54 分,在 max 得 55 分。本文接下來會計算取得這一分的成本。

GPT-6 Astra 接受哪些 reasoning_effort 值?

共有 7 種,但和 API 宣告的集合不同:其中一個宣告支援的值會在所有模型上被拒絕,另一個實際可用的值則從未出現在任何宣告中。模型頁面列出 lowmediumhighxhighmax,並聲稱模型「不支援 none 推理強度」。API 有兩處與文件不符,還有一處前後矛盾。

傳送無效值時,第一層檢查會在選定模型前驗證請求格式。GPT-6 AstraGPT-5.6 Sol 都會回傳相同的允許值清單:

Invalid value: '__invalid__'. Supported values are: 'none', 'minimal', 'low', 'medium', 'high', 'xhigh', and 'max'.

接著逐一傳送這些值,第二層模型專屬檢查卻會拒絕第一層宣告支援的部分值(200 代表請求成功,400 代表遭到拒絕):

是否出現在宣告清單中GPT-6 AstraGPT-5.6 Sol
none200200
minimal400,“not supported with the ‘gpt-6-astra-2026-09-03’ model”400,相同
disabled200400
lowmax200200

因此,文件聲稱不支援的 none 實際可用,API 宣告支援的 minimal 卻在所有模型上遭到拒絕,而未出現在任何清單中的 disabled 只有 Astra 接受。錯誤訊息也透露 gpt-6-astra 別名目前指向的日期版本:gpt-6-astra-2026-09-03

none 會關閉推理嗎?disabled 呢?

none 會,而且只有它會。disabled 只是名稱容易誤導的一般推理級別。我們先在自己的機器上以暴力搜尋計算 11 個任務的答案,確保答案表不會出錯。任務包括連續套用規則 40 次、含 3 項限制的計數問題、背包問題、進位轉換、7 的 222 次方除以 1000 的餘數,以及另外 6 個較短的任務。接著透過相容 OpenAI Chat Completions API 的端點,針對全部 7 種推理強度測試,每個任務和強度各執行 3 次。Sol 不接受 disabled,因此只有 6 種。以下是 GPT-6 Astra 在最難 5 個任務上的結果:

強度正確率平均推理權杖每次呼叫成本每個正確答案成本
none20%(15 次中答對 3 次)0$0.00086$0.0043
disabled100%243$0.01311$0.0131
low100%151$0.00851$0.0085
medium100%159$0.00890$0.0089
high100%203$0.01110$0.0111
xhigh100%279$0.01491$0.0149
max100%370$0.01946$0.0195

每個正確答案的成本,是某個任務與推理強度組合的總支出除以答對次數。正確率只有 20% 的設定,平均要付 5 次執行的費用才能取得 1 個正確答案。效能落差只發生在相鄰的一級之間。兩個模型從 low 往上的每一級,在全部 11 個任務中都是 33 次全對;none 在 Astra 上只答對 33 次中的 16 次,在 Sol 上則答對 21 次。迭代映射任務中,Astra 的 3 次執行甚至回傳了 3 個不同的錯誤數字。這裡沒有可供微調的漸進式退化:推理不是開啟,就是模型在猜答案。

disabled 才是陷阱。它使用的推理權杖比 lowmediumhigh 都多,正確率同樣是 100%,但每個正確答案的成本比 low 高 54%。只有 xhighmax 的每個正確答案成本,高於這個名稱看似代表關閉的設定。

GPT-6 Astra 在 5 個多步驟任務中,7 種 reasoning_effort 值的每次呼叫推理權杖長條圖:none 為 0 個權杖且正確率 20%,disabled 為 243 個權杖,標示為比 low 高 54% 的陷阱;low 為 151 個權杖,標示為最低可用級別;medium 為 159、high 為 203、xhigh 為 279、max 為 370,成本是 low 的 2.3x,但答案相同;從 low 往上的每一級正確率都是 100%

max 比 low 多買到什麼?

在這些任務上什麼也沒有,價格卻是 2.3x:每次呼叫分別為 $0.01946 和 $0.00851,正確率都是 100%。推理權杖從 low 的 151 個增加到 max 的 370 個,而且每一個都按每百萬輸出權杖 $50 計費。

這個數字應該和基準測試表格一起看。「評測成績採用所有推理強度中的最高值」代表每個分數都取自表現最佳的級別。在獨立排行榜上,Astra 表現最好的是 max,比 xhigh 高 1 分;我們的測試顯示,這一級的成本是下一級的 1.3x。若工作負載接近發表時的基準測試,額外推理強度可能值得這筆成本。若工作負載接近我們的測試,則不值得。判斷方式是先用 low 測量自己的任務。

GPT-6 Astra 每個答案的價格是 GPT-5.6 Sol 的 2.5x 嗎?

使用 low 時不是,而是 1.57x。使用 max 時則是 2.57x。定價表價格是供應商自家頁面列出的每權杖價格:Astra 每百萬輸入權杖為 $10,輸出為 $50;Sol 則是 $4 和 $20(資料來自 2026-09-07 的 OpenAI AstraSol 模型頁面),因此輸入與輸出的定價差距都是 2.5x;[GPT-5.6 Sol 與 GPT-6 Astra 的比較頁面](/compare/models/gpt-5-6-sol-vs-gpt-6-astra/)提供即時目錄價格。以下每個正確答案的成本,是依照定價表價格與全部 11 個任務的權杖數計算。兩個模型從 low 往上都取得 33 次全對:

強度GPT-6 Astra 每個正確答案GPT-5.6 Sol 每個正確答案比率
low$0.00560$0.003561.57x
medium$0.00618$0.003731.66x
high$0.00741$0.004001.85x
xhigh$0.01005$0.004432.27x
max$0.01349$0.005252.57x

在較低級別中,Astra 取得相同答案所用的推理權杖少於 Sol(全部 11 個任務在 low 下,每次呼叫為 91 個對 158 個),因此成本差距縮小。往上調整時,Astra 的推理權杖增加得更快(max 為 249 個對 242 個),此時每個答案的差距就回到完整的定價差距。

這項結論的範圍很明確:兩個模型從 low 往上的正確率都是 100%,因此這組任務無法區分能力,只能比較兩者都答對時的答案成本。單一參數就能讓成本差距從 1.6x 變成 2.6x。OpenAI 的發表頁面顯示,代理型工作上的結果正好相反:Terminal-Bench 4.0 的「每個任務預估 API 成本」比 Sol 和 Fable 5.1 分別低「約 9% 和 63%」。即使每權杖價格更高,只要模型能用更少的權杖解決更多任務,總成本仍可能更低。工作負載不同,結果就不同;兩種情況下,推理強度都會直接決定帳單。

JSON schema 或工具呼叫會增加推理成本嗎?

low 下不會,medium 則會。我們用 3 種方式傳送一個單步驟任務,也就是在 08:15 加上 2 小時 37 分鐘:直接傳送、放入嚴格的 response_format JSON schema(回覆必須是符合指定結構的 JSON),以及強制工具呼叫(將 tool_choice 固定為單一函式,模型只能透過呼叫該函式回答)。每種方式都測試 4 種推理強度,各執行 3 次。以下是 GPT-6 Astra 的平均推理權杖數、推理權杖占所有計費輸出權杖的比例,以及每次呼叫成本:

格式nonelowmediumhigh
直接傳送0,$0.000850,$0.0008418(占輸出 67%),$0.0018524(73%),$0.00217
JSON schema0,$0.001414(23%),$0.0016521(57%),$0.0025726(62%),$0.00282
強制工具呼叫0,$0.001960,$0.001975(18%),$0.0022320(47%),$0.00307

GPT-6 Astra 在一個簡單任務上的分組長條圖,任務分別以直接傳送、JSON schema 和強制工具呼叫送出,並使用 none、low、medium 與 high 推理強度:除了 schema 在 low 下使用 4 個權杖,其餘格式在 none 和 low 下都是 0 個;medium 和 high 則使用 18 到 26 個權杖,推理權杖占輸出的比例達 57% 到 73%

low 可以縮減到零:在不需要分步推理的任務上,它不使用任何推理權杖,成本和 none 相同;在前面的多步驟任務中,每個任務會使用 16 到 345 個推理權杖,而且在 none 大幅失準時仍能維持正確,因此 low 是最低可用級別。包裝格式本身不是主要成本:在 low 下,schema 或工具呼叫只增加 0 到 4 個推理權杖;但使用 medium 時,即使任務根本沒有需要推理的內容,直接傳送和 schema 中的推理權杖仍占輸出權杖的 57% 到 67%,工具呼叫則占 18%。同一個擷取任務在 schema 內使用 medium,成本是 low 的 1.6x;直接傳送時則是 2.2x。7 月的 GPT-5.6 成本指南也在該系列模型上發現相同的成本槓桿。Sol 的變化較小:直接傳送和 schema 在所有推理強度下都使用 0 個推理權杖,強制工具呼叫則從 medium 開始使用 14 到 18 個。

付費使用的推理內容能讀到嗎?

OpenAI 的兩種 API 介面中,只有一種可以。較舊的 Chat Completions 端點和較新的 Responses 端點接受相同模型,計費方式也相同。以下是同一個問題在 medium 下,於每個介面各執行 3 次的結果:

介面計費的推理權杖回傳的推理文字
/v1/chat/completions76、75、120無;訊息只有 rolecontent
使用 reasoning.summary: "auto"/v1/responses62、62、116一個含 277 到 352 個字元摘要的 reasoning 項目

兩者的權杖數差異落在雜訊範圍內,因此計費方式相同,唯一差別是能否看到付費取得的內容。輸出權杖每百萬個要價 $50,能否讀取推理內容取決於端點。文件也要求工具呼叫使用 Responses(「GPT-6 Astra 支援 Chat Completions,但工具呼叫必須使用 Responses」),所以使用工具的工作負載必須落在可讀取推理內容的介面上。

GPT-5.6 的哪些行為沿用下來?

大部分介面契約都相同。以下是實測結果:

  • 權杖化工具。 同一篇 900 字的文字,在 GPT-6 AstraGPT-5.6 SolGPT-5.6 LunaGPT-5.5GPT-5.4GPT-5.2 上都會轉成 1,017 個提示權杖。5.x 上量測的提示大小可直接沿用到 Astra,不必重新計算。
  • 參數。 temperature 在 Astra 和 Sol 上都回傳 400(「not supported with this model」),top_plogprobs 也是如此;使用嚴格 JSON schema 的 response_format 在兩個模型上都會回傳符合 schema 的輸出;max_tokens 低於 16 時,兩個模型都會拒絕。
  • Sol 上的 max 7 月時,透過 Chat Completions 對 GPT-5.6 Sol 使用 reasoning_effort: "max" 會回傳 400。現在已經可以使用,而且 Sol 在這個設定下取得 33 次全對。

以下資訊來自文件,本文沒有實測:上下文視窗為 1,050,000 個權杖,最大輸入為 922,000,最大輸出為 128,000;輸入提示超過 272K 個權杖後,輸入與快取費率會變成 2x,門檻與 GPT-5.6 系列相同,也是我們跨供應商實測過的相同機制;快取讀取的定價是每百萬權杖 $1,快取寫入則是 $12.50,新的 prompt_cache_options.ttl: "30m" 參數取代了 prompt_cache_retention。Fast mode 是付費選項,OpenAI 表示速度最高可達 2x,價格也是標準模式的 2x。

Synthorai 如何處理這些設定

閘道會原樣傳遞 reasoning_effort,包括文件未列出的值。每次請求的用量紀錄會把 reasoning_tokens 保留為獨立欄位,與 completion_tokens 和計費成本並列。上面的每一張表都是根據這些資料建立:請求使用的推理強度、消耗的推理權杖,以及實際成本。所有資訊都能逐次請求查看,不必從每月總額反推。

常見問題

GPT-6 Astra 支援 reasoning_effort none 嗎?

支援。文件聲稱不支援,但 API 在 GPT-6 AstraGPT-5.6 Sol 上都接受這個值,而且只有它會回傳零個推理權杖。不過,在已驗證的任務集中,它於 33 次執行中失敗 17 次。因此,這個設定適合查詢與轉換,不適合任何需要多步驟處理的任務。

reasoning_effort disabled 在 GPT-6 Astra 上有什麼作用?

它會進行推理。GPT-6 Astra 接受 disabledGPT-5.6 Sol 則拒絕,而且這個值沒有出現在任何文件或宣告清單中。在我們的高難度任務集中,它每次呼叫使用 243 個推理權杖,low 則是 151 個,兩者正確率完全相同。應把它視為某個中間級別的昂貴別名,而不是關閉開關。

GPT-6 Astra 的 reasoning_effort 預設應該用哪個值?

low。在 GPT-6 Astra 上,它在單步驟任務中使用零個推理權杖,在多步驟任務中則每個任務使用 16 到 345 個,並在 none 只答對 16 次時取得 33 次全對。max 的答案相同,成本卻是 2.3x。只有當你在自己的任務評測中確認更高級別能改變結果時,才提高特定呼叫位置的推理強度。每次呼叫都應明確設定,並從用量區塊讀回推理權杖數:

resp = client.chat.completions.create(
    model="gpt-6-astra",
    reasoning_effort="low",
    messages=[{"role": "user", "content": prompt}],
)
print(resp.usage.completion_tokens_details.reasoning_tokens)

量測日期為 2026-09-07,主要透過相容 OpenAI 的 Chat Completions 介面執行,推理內容可見性比較則另外使用 Responses 端點。測試包含 11 個任務,答案表以本機暴力搜尋產生;7 種推理強度;兩個模型在每個組合中各執行 3 次;提示均加入隨機鹽值(每次請求使用唯一後綴,避免直接從快取提供回覆);成本取自逐次請求的用量計費紀錄。基準測試數字來自 OpenAI 發表時的表格與 Artificial Analysis 排行榜,兩者都在同一天擷取。與 GPT-5.6 Sol 比較的每個正確答案成本,依照各模型文件中的定價與實際權杖數計算。

相關文章:13 個模型的推理控制設定GPT-5.6 成本指南Claude Opus 5 成本長上下文定價級距提示快取寫入成本

← 返回部落格