GPT-6 Astra 推理強度:max 同答案,成本是 low 的 2.3x
目錄
在 GPT-6 Astra 上,reasoning_effort: "max" 的成本是 low 的 2.3x,但 11 個已驗證任務的答案完全相同。唯一會影響正確率的設定是 none,在 33 次執行中失敗 17 次(11 個任務,每個執行 3 次)。reasoning_effort 是控制模型在回答前進行多少隱藏推理的請求參數。這些推理會按輸出費率計為推理權杖,本文測量的就是從 none 到 max 這組依序增加的設定。實際設定並不符合文件:API 的輸入檢查列出 7 個值,其中 minimal 在所有模型上都會被拒絕,而未列出的 disabled 卻能在 Astra 上使用,而且完全不會停用推理。這也影響 OpenAI 發表時的基準測試該怎麼解讀。官方表示成績取「所有推理強度中的最高值」,因此排行榜數字來自成本最高的那一級。
TL;DR
- GPT-6 Astra 接受 7 種
reasoning_effort值,包括none和disabled;文件只列出 5 種,還聲稱不支援none。 - 只有
none會讓推理權杖歸零,但它在 33 個已驗證結果中失敗 17 次;其他每一級都是 33 次全對。 disabled使用 243 個推理權杖,low則是 151 個;正確率相同,但每個正確答案的成本高出 54%。- 按定價表計算,GPT-6 Astra 在
low下每個正確答案的成本是 GPT-5.6 Sol 的 1.57x,在max下則是 2.57x,而這些任務兩個模型都能答對。
GPT-6 Astra 的基準測試表現如何?
在代理型工作上領先,也就是由模型在迴圈中操作工具,通常是在終端機內執行;但在 Humanity’s Last Exam 和 Artificial Analysis Intelligence Index(由 10 項評測組成的獨立綜合指標)上落後 Claude Fable 5.1。所有成績都採用表現最好的推理強度。下表來自 OpenAI 的發表頁面,比較欄位也由 OpenAI 選定:
| 基準測試 | 測試內容 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 終端機中的代理任務 | 57.9% | 37.3% | 55.8% | 52.6% |
| Terminal-Bench Science 0.1 | 使用程式碼的研究工作流程 | 64.6% | 22.4% | 52.6% | 30.0% |
| FrontierMath Tier 4 (v2) | 研究等級數學 | 97.6% | 83.0% | 87.8% | 73.2% |
| ARC-AGI-3 | 解決全新的解謎環境 | 99.9% | 7.8% | 未列出 | 30.2% |
| Humanity’s Last Exam, with tools | 各領域專家撰寫的問題 | 57.2% | 未列出 | 65.0% | 63.6% |
| Artificial Analysis Intelligence Index v4.1.1 | 10 項評測的綜合結果 | 61.2 | 60.9 | 65.7 | 63.1 |
除了領先項目,還要一併看這 3 點:
- 在 Humanity’s Last Exam 這一列,Astra 落後 Fable 5.1 達 7.8 個百分點。這項結果只出現在表格中,正文完全沒有提到。
- OpenAI 自己的表格顯示,Artificial Analysis 這一列的 Astra 落後 Claude Fable 5.1、Claude Opus 5 和 Claude Fable 5;目前的 v4.2 排行榜中,Fable 5.1 為 57 分,Astra 為 55 分,分居第一與第三。
- OpenAI 表示,網路安全成績是在「未啟用正式環境防護措施」的情況下產生;實際提供的模型「會拒絕」概念驗證型攻擊任務。
表格下方有一句話直接把基準測試和帳單連在一起:「評測成績採用所有推理強度中的最高值。」Artificial Analysis 排行榜會針對每種推理強度分別列出模型,Astra 在 xhigh 得 54 分,在 max 得 55 分。本文接下來會計算取得這一分的成本。
GPT-6 Astra 接受哪些 reasoning_effort 值?
共有 7 種,但和 API 宣告的集合不同:其中一個宣告支援的值會在所有模型上被拒絕,另一個實際可用的值則從未出現在任何宣告中。模型頁面列出 low、medium、high、xhigh 和 max,並聲稱模型「不支援 none 推理強度」。API 有兩處與文件不符,還有一處前後矛盾。
傳送無效值時,第一層檢查會在選定模型前驗證請求格式。GPT-6 Astra 和 GPT-5.6 Sol 都會回傳相同的允許值清單:
Invalid value: '__invalid__'. Supported values are: 'none', 'minimal', 'low', 'medium', 'high', 'xhigh', and 'max'.
接著逐一傳送這些值,第二層模型專屬檢查卻會拒絕第一層宣告支援的部分值(200 代表請求成功,400 代表遭到拒絕):
| 值 | 是否出現在宣告清單中 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|
none | 是 | 200 | 200 |
minimal | 是 | 400,“not supported with the ‘gpt-6-astra-2026-09-03’ model” | 400,相同 |
disabled | 否 | 200 | 400 |
low 到 max | 是 | 200 | 200 |
因此,文件聲稱不支援的 none 實際可用,API 宣告支援的 minimal 卻在所有模型上遭到拒絕,而未出現在任何清單中的 disabled 只有 Astra 接受。錯誤訊息也透露 gpt-6-astra 別名目前指向的日期版本:gpt-6-astra-2026-09-03。
none 會關閉推理嗎?disabled 呢?
none 會,而且只有它會。disabled 只是名稱容易誤導的一般推理級別。我們先在自己的機器上以暴力搜尋計算 11 個任務的答案,確保答案表不會出錯。任務包括連續套用規則 40 次、含 3 項限制的計數問題、背包問題、進位轉換、7 的 222 次方除以 1000 的餘數,以及另外 6 個較短的任務。接著透過相容 OpenAI Chat Completions API 的端點,針對全部 7 種推理強度測試,每個任務和強度各執行 3 次。Sol 不接受 disabled,因此只有 6 種。以下是 GPT-6 Astra 在最難 5 個任務上的結果:
| 強度 | 正確率 | 平均推理權杖 | 每次呼叫成本 | 每個正確答案成本 |
|---|---|---|---|---|
none | 20%(15 次中答對 3 次) | 0 | $0.00086 | $0.0043 |
disabled | 100% | 243 | $0.01311 | $0.0131 |
low | 100% | 151 | $0.00851 | $0.0085 |
medium | 100% | 159 | $0.00890 | $0.0089 |
high | 100% | 203 | $0.01110 | $0.0111 |
xhigh | 100% | 279 | $0.01491 | $0.0149 |
max | 100% | 370 | $0.01946 | $0.0195 |
每個正確答案的成本,是某個任務與推理強度組合的總支出除以答對次數。正確率只有 20% 的設定,平均要付 5 次執行的費用才能取得 1 個正確答案。效能落差只發生在相鄰的一級之間。兩個模型從 low 往上的每一級,在全部 11 個任務中都是 33 次全對;none 在 Astra 上只答對 33 次中的 16 次,在 Sol 上則答對 21 次。迭代映射任務中,Astra 的 3 次執行甚至回傳了 3 個不同的錯誤數字。這裡沒有可供微調的漸進式退化:推理不是開啟,就是模型在猜答案。
disabled 才是陷阱。它使用的推理權杖比 low、medium 或 high 都多,正確率同樣是 100%,但每個正確答案的成本比 low 高 54%。只有 xhigh 和 max 的每個正確答案成本,高於這個名稱看似代表關閉的設定。
max 比 low 多買到什麼?
在這些任務上什麼也沒有,價格卻是 2.3x:每次呼叫分別為 $0.01946 和 $0.00851,正確率都是 100%。推理權杖從 low 的 151 個增加到 max 的 370 個,而且每一個都按每百萬輸出權杖 $50 計費。
這個數字應該和基準測試表格一起看。「評測成績採用所有推理強度中的最高值」代表每個分數都取自表現最佳的級別。在獨立排行榜上,Astra 表現最好的是 max,比 xhigh 高 1 分;我們的測試顯示,這一級的成本是下一級的 1.3x。若工作負載接近發表時的基準測試,額外推理強度可能值得這筆成本。若工作負載接近我們的測試,則不值得。判斷方式是先用 low 測量自己的任務。
GPT-6 Astra 每個答案的價格是 GPT-5.6 Sol 的 2.5x 嗎?
使用 low 時不是,而是 1.57x。使用 max 時則是 2.57x。定價表價格是供應商自家頁面列出的每權杖價格:Astra 每百萬輸入權杖為 $10,輸出為 $50;Sol 則是 $4 和 $20(資料來自 2026-09-07 的 OpenAI Astra 與 Sol 模型頁面),因此輸入與輸出的定價差距都是 2.5x;[GPT-5.6 Sol 與 GPT-6 Astra 的比較頁面](/compare/models/gpt-5-6-sol-vs-gpt-6-astra/)提供即時目錄價格。以下每個正確答案的成本,是依照定價表價格與全部 11 個任務的權杖數計算。兩個模型從 low 往上都取得 33 次全對:
| 強度 | GPT-6 Astra 每個正確答案 | GPT-5.6 Sol 每個正確答案 | 比率 |
|---|---|---|---|
low | $0.00560 | $0.00356 | 1.57x |
medium | $0.00618 | $0.00373 | 1.66x |
high | $0.00741 | $0.00400 | 1.85x |
xhigh | $0.01005 | $0.00443 | 2.27x |
max | $0.01349 | $0.00525 | 2.57x |
在較低級別中,Astra 取得相同答案所用的推理權杖少於 Sol(全部 11 個任務在 low 下,每次呼叫為 91 個對 158 個),因此成本差距縮小。往上調整時,Astra 的推理權杖增加得更快(max 為 249 個對 242 個),此時每個答案的差距就回到完整的定價差距。
這項結論的範圍很明確:兩個模型從 low 往上的正確率都是 100%,因此這組任務無法區分能力,只能比較兩者都答對時的答案成本。單一參數就能讓成本差距從 1.6x 變成 2.6x。OpenAI 的發表頁面顯示,代理型工作上的結果正好相反:Terminal-Bench 4.0 的「每個任務預估 API 成本」比 Sol 和 Fable 5.1 分別低「約 9% 和 63%」。即使每權杖價格更高,只要模型能用更少的權杖解決更多任務,總成本仍可能更低。工作負載不同,結果就不同;兩種情況下,推理強度都會直接決定帳單。
JSON schema 或工具呼叫會增加推理成本嗎?
在 low 下不會,medium 則會。我們用 3 種方式傳送一個單步驟任務,也就是在 08:15 加上 2 小時 37 分鐘:直接傳送、放入嚴格的 response_format JSON schema(回覆必須是符合指定結構的 JSON),以及強制工具呼叫(將 tool_choice 固定為單一函式,模型只能透過呼叫該函式回答)。每種方式都測試 4 種推理強度,各執行 3 次。以下是 GPT-6 Astra 的平均推理權杖數、推理權杖占所有計費輸出權杖的比例,以及每次呼叫成本:
| 格式 | none | low | medium | high |
|---|---|---|---|---|
| 直接傳送 | 0,$0.00085 | 0,$0.00084 | 18(占輸出 67%),$0.00185 | 24(73%),$0.00217 |
| JSON schema | 0,$0.00141 | 4(23%),$0.00165 | 21(57%),$0.00257 | 26(62%),$0.00282 |
| 強制工具呼叫 | 0,$0.00196 | 0,$0.00197 | 5(18%),$0.00223 | 20(47%),$0.00307 |
low 可以縮減到零:在不需要分步推理的任務上,它不使用任何推理權杖,成本和 none 相同;在前面的多步驟任務中,每個任務會使用 16 到 345 個推理權杖,而且在 none 大幅失準時仍能維持正確,因此 low 是最低可用級別。包裝格式本身不是主要成本:在 low 下,schema 或工具呼叫只增加 0 到 4 個推理權杖;但使用 medium 時,即使任務根本沒有需要推理的內容,直接傳送和 schema 中的推理權杖仍占輸出權杖的 57% 到 67%,工具呼叫則占 18%。同一個擷取任務在 schema 內使用 medium,成本是 low 的 1.6x;直接傳送時則是 2.2x。7 月的 GPT-5.6 成本指南也在該系列模型上發現相同的成本槓桿。Sol 的變化較小:直接傳送和 schema 在所有推理強度下都使用 0 個推理權杖,強制工具呼叫則從 medium 開始使用 14 到 18 個。
付費使用的推理內容能讀到嗎?
OpenAI 的兩種 API 介面中,只有一種可以。較舊的 Chat Completions 端點和較新的 Responses 端點接受相同模型,計費方式也相同。以下是同一個問題在 medium 下,於每個介面各執行 3 次的結果:
| 介面 | 計費的推理權杖 | 回傳的推理文字 |
|---|---|---|
/v1/chat/completions | 76、75、120 | 無;訊息只有 role 和 content |
使用 reasoning.summary: "auto" 的 /v1/responses | 62、62、116 | 一個含 277 到 352 個字元摘要的 reasoning 項目 |
兩者的權杖數差異落在雜訊範圍內,因此計費方式相同,唯一差別是能否看到付費取得的內容。輸出權杖每百萬個要價 $50,能否讀取推理內容取決於端點。文件也要求工具呼叫使用 Responses(「GPT-6 Astra 支援 Chat Completions,但工具呼叫必須使用 Responses」),所以使用工具的工作負載必須落在可讀取推理內容的介面上。
GPT-5.6 的哪些行為沿用下來?
大部分介面契約都相同。以下是實測結果:
- 權杖化工具。 同一篇 900 字的文字,在 GPT-6 Astra、GPT-5.6 Sol、GPT-5.6 Luna、GPT-5.5、GPT-5.4 和 GPT-5.2 上都會轉成 1,017 個提示權杖。5.x 上量測的提示大小可直接沿用到 Astra,不必重新計算。
- 參數。
temperature在 Astra 和 Sol 上都回傳 400(「not supported with this model」),top_p和logprobs也是如此;使用嚴格 JSON schema 的response_format在兩個模型上都會回傳符合 schema 的輸出;max_tokens低於 16 時,兩個模型都會拒絕。 - Sol 上的
max。 7 月時,透過 Chat Completions 對 GPT-5.6 Sol 使用reasoning_effort: "max"會回傳 400。現在已經可以使用,而且 Sol 在這個設定下取得 33 次全對。
以下資訊來自文件,本文沒有實測:上下文視窗為 1,050,000 個權杖,最大輸入為 922,000,最大輸出為 128,000;輸入提示超過 272K 個權杖後,輸入與快取費率會變成 2x,門檻與 GPT-5.6 系列相同,也是我們跨供應商實測過的相同機制;快取讀取的定價是每百萬權杖 $1,快取寫入則是 $12.50,新的 prompt_cache_options.ttl: "30m" 參數取代了 prompt_cache_retention。Fast mode 是付費選項,OpenAI 表示速度最高可達 2x,價格也是標準模式的 2x。
Synthorai 如何處理這些設定
閘道會原樣傳遞 reasoning_effort,包括文件未列出的值。每次請求的用量紀錄會把 reasoning_tokens 保留為獨立欄位,與 completion_tokens 和計費成本並列。上面的每一張表都是根據這些資料建立:請求使用的推理強度、消耗的推理權杖,以及實際成本。所有資訊都能逐次請求查看,不必從每月總額反推。
常見問題
GPT-6 Astra 支援 reasoning_effort none 嗎?
支援。文件聲稱不支援,但 API 在 GPT-6 Astra 和 GPT-5.6 Sol 上都接受這個值,而且只有它會回傳零個推理權杖。不過,在已驗證的任務集中,它於 33 次執行中失敗 17 次。因此,這個設定適合查詢與轉換,不適合任何需要多步驟處理的任務。
reasoning_effort disabled 在 GPT-6 Astra 上有什麼作用?
它會進行推理。GPT-6 Astra 接受 disabled,GPT-5.6 Sol 則拒絕,而且這個值沒有出現在任何文件或宣告清單中。在我們的高難度任務集中,它每次呼叫使用 243 個推理權杖,low 則是 151 個,兩者正確率完全相同。應把它視為某個中間級別的昂貴別名,而不是關閉開關。
GPT-6 Astra 的 reasoning_effort 預設應該用哪個值?
low。在 GPT-6 Astra 上,它在單步驟任務中使用零個推理權杖,在多步驟任務中則每個任務使用 16 到 345 個,並在 none 只答對 16 次時取得 33 次全對。max 的答案相同,成本卻是 2.3x。只有當你在自己的任務評測中確認更高級別能改變結果時,才提高特定呼叫位置的推理強度。每次呼叫都應明確設定,並從用量區塊讀回推理權杖數:
resp = client.chat.completions.create(
model="gpt-6-astra",
reasoning_effort="low",
messages=[{"role": "user", "content": prompt}],
)
print(resp.usage.completion_tokens_details.reasoning_tokens)
量測日期為 2026-09-07,主要透過相容 OpenAI 的 Chat Completions 介面執行,推理內容可見性比較則另外使用 Responses 端點。測試包含 11 個任務,答案表以本機暴力搜尋產生;7 種推理強度;兩個模型在每個組合中各執行 3 次;提示均加入隨機鹽值(每次請求使用唯一後綴,避免直接從快取提供回覆);成本取自逐次請求的用量計費紀錄。基準測試數字來自 OpenAI 發表時的表格與 Artificial Analysis 排行榜,兩者都在同一天擷取。與 GPT-5.6 Sol 比較的每個正確答案成本,依照各模型文件中的定價與實際權杖數計算。
相關文章:13 個模型的推理控制設定、GPT-5.6 成本指南、Claude Opus 5 成本、長上下文定價級距、提示快取寫入成本。