GPT-6.1 Sol 對比 Claude Sonnet 5.5:同為 $2/$10,每項任務成本減半
目錄
GPT-6.1 Sol 和 Claude Sonnet 5.5 的標價相同:每百萬輸入 token 為 $2,每百萬輸出 token 為 $10,但每項任務的成本差很多。兩款模型都使用各自的 API 預設 effort(回答前的推理量設定)時,GPT-6.1 Sol 的成本約為一半(0.49x);在獨立評測指數拿到相同分數時,成本約為四分之一。OpenAI 指定比較的對手 Claude Opus 5.5 則是它的 0.29x。Sonnet 5.5 的額外成本換來的是獨立評測指數高出 4 到 6 分的最高分、更快的回應速度,以及在 GPT-6.1 Sol 反覆答錯一項任務時沒有答錯。
TL;DR
- 使用 API 預設設定,在 13 項任務中,GPT-6.1 Sol 的每項任務成本是 Sonnet 5.5 的 0.49x、Opus 5.5 的 0.29x。
- 在 Artificial Analysis 評測中,GPT-6.1 Sol 使用
max、Sonnet 5.5 使用xhigh都得到 52 分,每項任務成本分別為 $0.72 和 $2.74。 - GPT-6.1 Sol 在 234 次提示中全都只回傳要求的值;Sonnet 5.5 使用預設設定時,39 次中有 22 次做到。
- Sonnet 5.5 在 234 次呼叫中全數答對;GPT-6.1 Sol 在同一項任務的 18 次呼叫中答錯 7 次。
GPT-6.1 Sol 是什麼?OpenAI 對它有什麼主張?
GPT-6.1 Sol 是 OpenAI 中階模型的更新版,於 2026-09-29 推出,距離同價位的 GPT-6 Sol 發布僅七天。這一週內,開發者批評 GPT-6 Sol 回答太短,Anthropic 推出同樣標價 $2 / $10 的 Sonnet 5.5,OpenAI 則在內部測試發現欺瞞與未經授權的行為後,取消原定推出的旗艦模型 GPT-6.1 Astra,CBC 對此有所報導。
Token 價格、1,050,000 token 的上下文視窗,以及 128,000 token 的輸出上限都沒變;快取輸入現在每百萬 token 收費 $0.10,低於原本的 $0.20。會讓既有程式碼出問題的是 reasoning.effort:這個 Responses API 參數控制模型回答前進行多少隱藏推理,而這些推理會算入輸出費用。設定範圍從 low 到 max,預設是 medium,none 已移除。原本在 GPT-6 Sol 關閉推理的請求,現在要改用 low;原本只允許在 none 設定下透過 Chat Completions 執行的工具呼叫,現在則要改用 Responses API。
OpenAI 將這款模型拿來與兩款旗艦模型比較:自家的 GPT-6 Astra 和 Anthropic 的 Claude Opus 5.5。在 DeepSWE v1.1(代理式程式開發)上,它以約五分之一的成本與 Astra 同分;在 OSWorld 2.0(電腦操作)上,它落後 Astra 2.1 分,但成本約為七分之一;在 AutomationBench(企業工作流程)上,使用 medium 時比 Opus 5.5 高 2.2 分;在 Terminal-Bench Science 上,使用 max 時每項任務成本為 $5.47,Opus 5.5 則是 $23.21。這些都是 OpenAI 自行執行的測試,沒有納入 Sonnet 5.5。發布時也宣布了 Ultrafast 方案,速度最高提升 6x,價格也是 6x。
該和哪款模型比較:Opus 5.5、Sonnet 5.5,還是 GPT-6 Sol?
Sonnet 5.5 才是最適合比較的對象,因為它的標價相同,也最能看出標價相同不代表實際成本相同。下表將這三款候選模型與 GPT-6.1 Sol 並列;獨立評測結果取自各發布單位的頁面。
| GPT-6.1 Sol | Opus 5.5 | Sonnet 5.5 | GPT-6 Sol | |
|---|---|---|---|---|
| 標價,每百萬輸入/輸出 token | $2 / $10 | $4 / $20 | $2 / $10 | $2 / $10 |
| 發布日期 | 2026-09-29 | 2026-09-22 | 2026-09-28 | 2026-09-22 |
| 發布時比較的模型 | GPT-6 Astra、Opus 5.5 | Fable 5.1、Opus 5、GPT-6 Astra | Opus 5.5、GPT-6 Sol | GPT-6 Astra、Opus 5、Fable 5 |
Artificial Analysis 智慧指數,使用 max(推理、知識與程式開發評測) | 52 | 58 | 56 | 48 |
使用 max 時,每項指數任務成本 | $0.72 | $5.98 | $7.60 | $1.04 |
| Vals 指數(程式開發、法律、稅務、醫療等專業任務) | 61.2% | 67.0% | 67.0% | 57.5% |
| 每項 Vals 測試成本 | $3.24 | $32.14 | $21.34 | $7.58 |
AutomationBench 1.0.6 公開排行榜,使用 max(跨應用程式的企業工作流程) | 未列出 | 42.47%,每項任務 $1.44 | 44.75%,每項任務 $1.14 | 未列出 |
- Opus 5.5 是 OpenAI 指定的比較對象,但標價是兩倍,在兩項指數上都高出約 6 分。
- GPT-6 Sol 是同價位的前代模型。GPT-6.1 Sol 在兩項指數上都勝過它,每項任務成本也更低;這組比較只能用來判斷是否值得升級。
- Sonnet 5.5 標價相同,早一天推出,發布時同樣以 Opus 5.5 為比較對象。它的分數與 Opus 5.5 相差不到 2 分,比 GPT-6.1 Sol 高 4 到 6 分。
標價相同,不代表兩款模型划算程度相同。以分數對照成本,GPT-6.1 Sol 比兩款 Claude 模型便宜:
- 分數相同時,它的成本是 Sonnet 5.5 的五分之一到四分之一:在 Artificial Analysis,Sonnet 5.5 使用
xhigh、GPT-6.1 Sol 使用max都拿到 52 分,每項任務成本分別是 $2.74 和 $0.72。降低一個級距後,Sonnet 5.5 使用high拿到 47 分,成本 $1.08;GPT-6.1 Sol 使用medium拿到 48 分,成本 $0.21。 - 看指數的最高設定結果,Sonnet 5.5 的每項任務成本接近 Opus 5.5:Artificial Analysis 使用
max時是 $7.60 對 $5.98,Vals 則是 $21.34 對 $32.14。兩者的成本都是 GPT-6.1 Sol 的 7 到 11 倍。
相對地,Sonnet 5.5 和 Opus 5.5 在 Artificial Analysis 分別能拿到 56 和 58 分,GPT-6.1 Sol 無論使用哪種設定都達不到。
我們怎麼測試?
我們透過各模型原生的 API 執行三組任務,並全部用程式碼評分:GPT 使用 Responses,Claude 使用 Messages。
| 測試 | 內容 | 測量項目 |
|---|---|---|
| 單次作答任務 | 13 項有標準答案的任務(例如 10 件物品的背包問題:在重量上限內找出最佳物品組合),每題結尾都要求「只回覆一個整數,不要有其他內容」;每個 effort 設定重複 3 次 | 答案是否正確、是否只回覆指定值、成本、時間 |
| 商業文件 | 80 個只給目標的提示(「撰寫 Q3 區域回顧」),以及 80 個明列必要內容的提示;文件包含季度回顧、事件事後檢討、供應商比較、客服回覆 | 必要內容是否齊全、字數、成本 |
| 工具迴圈 | 針對小型合成程式碼庫的 4 道程式碼閱讀題,提供 3 個工具,各重複 3 次 | 解出的題目、工具呼叫次數、成本、時間 |
每個提示都帶有一段不重複的隨機字串,避免回應命中快取;成本依標價計算。Sonnet 5.5 和 Opus 5.5 的單次作答與工具迴圈數據,取自前一天我們對 Sonnet 5.5 的測量,使用相同任務與評分程式。只有通過 Holm 校正的差距才視為顯著;同時檢驗多組比較時,這項校正會提高顯著性門檻。只回覆指定值的比較以任務為單位計數,因為同一任務的重複測試並非獨立樣本。
GPT-6.1 Sol 的每項任務成本比 Sonnet 5.5 低嗎?
GPT-6.1 Sol 的成本約為一半:兩款模型各用自己的 API 預設設定時,每項單次作答任務成本分別是 $0.0020,以及 Sonnet 5.5 的 $0.0042,比例為 0.49(對 13 項任務重新抽樣得出的 95% 區間為 0.40 到 0.59)。在低於 max 的設定下,Sonnet 5.5 的輸出 token 數是它的 1.7 到 2.5 倍;在 max 時是 3.1 倍。Opus 5.5 的標價是兩倍,使用預設設定時每項任務成本為 $0.0070,因此 GPT-6.1 Sol 的成本是它的 0.29x。
各個 effort 設定下的比例都差不多:GPT-6.1 Sol 的成本是 Sonnet 5.5 的 0.33x 到 0.58x,也是 Opus 5.5 的 0.20x 到 0.31x。請求未指定 effort 時,GPT-6.1 Sol 和 Opus 5.5 使用 medium,Sonnet 5.5 使用 high。另外兩項測試相對於 Sonnet 5.5 也都得到 0.46x:只給目標的商業文件每份是 $0.0103 對 $0.0223,工具迴圈每次是 $0.0052 對 $0.0112。
Effort 只需設定一個請求欄位,計費 token 數會在 usage 中回傳:
from openai import OpenAI
client = OpenAI()
resp = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "low"}, # low, medium (default), high, xhigh, max; "none" is not listed for 6.1
input="Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else.",
)
print(resp.output_text)
u = resp.usage
print(u.output_tokens, u.output_tokens_details.reasoning_tokens, u.input_tokens_details.cached_tokens)
output_tokens 包含推理 token;cached_tokens 是輸入中以每百萬 token $0.10 計費的部分。
哪款模型能遵守「只回覆答案」?哪款答得對?
GPT-6.1 Sol 每次都遵守格式;Sonnet 5.5 則在 GPT-6.1 Sol 反覆答錯的一項任務上沒有出錯。GPT-6.1 Sol 在全部 234 次提示中都只回覆指定值,Opus 5.5 也是。Sonnet 5.5 使用預設設定時,39 次中有 22 次只回覆指定值;使用 low 時是 12 次,medium 是 24 次,high 是 30 次。低於 xhigh 時,它有時會略過 thinking block(Claude 回應中獨立的推理部分),直接在回覆中寫出計算過程,詳見我們的 Sonnet 5.5 文章。以任務為單位計算,使用 low 時的差距通過校正(13 項任務中,GPT-6.1 Sol 有 9 項較好,沒有較差的任務);使用預設設定時則沒有通過(6 項較好,沒有較差的任務)。若程式碼要解析單一數值,可以直接讀取 GPT-6.1 Sol 的回覆;使用 Sonnet 5.5 時,則取最後一行或改用 xhigh。
Sonnet 5.5 在 234 次呼叫中全數答對,Opus 5.5 答錯 2 次。GPT-6.1 Sol 在 18 次背包問題呼叫中有 7 次回答 72,但窮舉所有子集合確認的正確答案是 62:low 的 3 次全錯,預設設定和 medium 都是 3 次錯 1 次,xhigh 是 3 次錯 2 次,high 和 max 則沒有答錯。13 項任務中只有一項出問題,不足以證明準確率存在差距,但這顯示錯誤不容易被發現:回覆是一個格式正確的整數,提高 effort 也無法穩定避免錯誤。
GPT-6.1 Sol 改善了 GPT-6 Sol 回答太短的問題嗎?
GPT-6.1 Sol 又能寫出完整篇幅的回答。在只給文件名稱、不指定內容的提示下,它每份文件寫出 565 個英文單字,GPT-6 Sol 則是 325 個;全部 80 項都比較長,與 GPT-5.6 Sol 的 592 個相近。至於 GPT-6 Sol 會漏掉內容的抱怨,我們未能重現:在 60 份有評分的文件中,它有 58 份內容完整(涵蓋每個區域、每起事件的每個經過,以及每張客服單的回覆),與 GPT-5.6 Sol 相同。20 份供應商比較沒有評分,因為哪家供應商較合適屬於主觀判斷。
提示明列必要內容時,三款 OpenAI 模型都在 80 份文件中全數寫齊。Sonnet 5.5 在只給目標的提示下寫出最長的文件(747 個英文單字),所有有評分的文件也都完整,但在明列必要內容的提示中有 80 份中的 12 份未達要求,每次都是其中的備忘錄或建議部分比指定字數範圍的下限少 1 到 28 個英文單字。這項差距通過校正,但 12 份中有 10 份是季度回顧,因此不太能推論到其他文件類型。
回答變長後,GPT-6 Sol 每份只給目標的文件成本 $0.0078,在 GPT-6.1 Sol 上升至 $0.0103。但這仍比標價 $4 / $20 的 GPT-5.6 Sol 低 59%(該價格是截至 2026-11-21 的促銷價);即使用 $2 / $10 重新計算 GPT-5.6 Sol 的 token 費用,GPT-6.1 Sol 仍便宜 19%,因為它用較少的 token 寫出相同篇幅。
GPT-6.1 Sol 比較慢嗎?
GPT-6.1 Sol 比前代模型和 Sonnet 5.5 都慢,長篇輸出尤其明顯。以商業文件整體請求時間計算,它每秒產生約 43 個輸出 token,GPT-6 Sol 是 100 個、GPT-5.6 Sol 是 80 個、Sonnet 5.5 是 127 個。只給目標的文件耗時中位數分別是 22.4 秒、7.2 秒、13.9 秒和 17.2 秒。較短的單次作答任務差距比較小:使用預設設定時,GPT-6.1 Sol 是 5.7 秒,Sonnet 5.5 是 3.9 秒,Opus 5.5 是 5.5 秒。實際速度會受服務端與時段影響;Artificial Analysis 的數據也顯示,它的速度不到 Sonnet 5.5 的一半,每秒 64 個 token 對 139 個。
在工具迴圈中表現如何?
GPT-6.1 Sol 和 Sonnet 5.5 在所有設定下都完成了 12 次執行;GPT-6.1 Sol 的成本不到一半,但耗時將近兩倍。工具迴圈的流程是模型要求呼叫工具,呼叫端程式碼執行後把結果傳回模型,反覆進行直到模型作答。我們在小型合成程式碼庫上提供了三個工具:列出檔案、讀取檔案、搜尋。使用預設設定時,每次執行的成本分別為 GPT-6.1 Sol 的 $0.0052、Sonnet 5.5 的 $0.0112,以及 Opus 5.5 的 $0.0332;耗時中位數分別為 12.2、6.7 和 25.3 秒。使用 max 時,GPT-6.1 Sol 的成本升至 $0.0086,Sonnet 5.5 升至 $0.0422,每次執行的工具呼叫次數分別是 6.4 和 14.7 次。
我們的結果和其他已發布測試一致嗎?
我們的結果與已發布測試的趨勢一致。差距幅度不同,是因為我們的任務較短,而且多數使用 API 預設設定;公開評測指數則以 max 執行較長的任務。
| 問題 | 其他已發布結果 | 我們的測量 | 判斷 |
|---|---|---|---|
| GPT-6.1 Sol 相對於 Sonnet 5.5 的成本 | Artificial Analysis:使用 max 時,每項指數任務 $0.72 對 $7.60,相差約 11x | 預設設定下是 0.49x,max 下是 0.33x | 趨勢相同;使用 max 時,任務越長差距越大:單次作答是 0.33x,我們的工具迴圈是 0.20x,指數任務是 0.09x |
| 速度 | Artificial Analysis:每秒 64 對 139 個輸出 token;Vals AI:代理式任務的耗時是 GPT-6 Sol 的 2 到 3 倍 | 每秒 43 對 127 個 token;每份文件耗時 22.4 秒,GPT-6 Sol 則是 7.2 秒 | 一致 |
| 相對於 Sonnet 5.5 的品質 | Artificial Analysis 是 52 對 56;Vals 是 61.2% 對 67.0% | Sonnet 5.5 在 234 次中全數答對;GPT-6.1 Sol 在同一項任務的 18 次中答錯 7 次 | 趨勢相同;我們的結果只來自一項任務 |
| GPT-6 Sol 回答太短或漏掉內容 | 開發者的抱怨,例如 Hacker News 發布討論串 | 每份文件 325 個英文單字,GPT-5.6 Sol 是 592 個;60 份中有 58 份內容完整,與 GPT-5.6 Sol 相同 | 確認回答較短;未能重現漏掉內容 |
| Sonnet 5.5 不遵守「只回覆答案」 | 未找到已發布報告 | 預設設定下 39 次中有 22 次只回覆指定值,low 下是 39 次中有 12 次 | 僅有我們的數據 |
我們觀察到什麼?該選哪款?
相較於 Sonnet 5.5 和 Opus 5.5,GPT-6.1 Sol 更划算;如果延遲或最後 4 到 6 分的品質差距很重要,就選 Sonnet 5.5。依據有四點:
- 以達到的品質來看,GPT-6.1 Sol 比兩款 Claude 模型便宜。相較於 Sonnet 5.5,短任務每項成本約為一半,同分的指數任務約為四分之一,指數最高設定結果約為七分之一到十分之一。相較於 Opus 5.5,短任務每項成本為 0.29x,指數任務約為八分之一到十分之一。
- 它更能遵守輸出格式。所有要求只回覆答案的提示,以及所有明列必要內容的文件提示,它都照要求輸出。
- 回答不再太短,但速度變慢。回答長度回到 GPT-5.6 Sol 的水準,每份文件耗時則是 GPT-6 Sol 的三倍。
- 它的錯誤不容易察覺。7 次錯誤出現在
low、medium和xhigh,每次都回覆了格式正確的整數。
| 工作負載 | 建議選擇 | 數據 |
|---|---|---|
| 由程式碼解析輸出的擷取、分類、單一數值任務 | 使用 medium 或 high 的 GPT-6.1 Sol | 234 / 234 次只回覆指定值;使用 medium 時每項任務 $0.0021 |
| 答錯代價高的多步驟數學或邏輯任務 | Sonnet 5.5,或使用 GPT-6.1 Sol 並驗證結果 | Sonnet 5.5 在 234 / 234 次中全數答對;GPT-6.1 Sol 在同一項任務的 18 次呼叫中答錯 7 次 |
| 重視延遲的聊天與互動式工具 | 使用預設設定的 Sonnet 5.5 | 短任務每項耗時 3.9 秒對 5.7 秒;文件每份 17.2 秒對 22.4 秒 |
| 每次執行成本比延遲更重要的代理迴圈 | 使用預設設定的 GPT-6.1 Sol | 每次執行 $0.0052 對 $0.0112;耗時 12.2 秒對 6.7 秒 |
| 有必備章節的文件 | GPT-6.1 Sol,或為 Sonnet 5.5 指定較寬鬆的長度要求 | 80 / 80 份符合要求,對手是 68 / 80;未達標的文件比下限少 1 到 28 個英文單字 |
| 最高分很重要的高難度開放式任務 | 使用 max 的 Sonnet 5.5 或 Opus 5.5 | 公開指數分數為 56 和 58,GPT-6.1 Sol 是 52;每項任務成本是 7 到 11 倍 |
無論使用哪款模型,只要程式會依據某個值採取動作,就要驗證那個值。
常見問題
GPT-6.1 Sol 比 Claude Sonnet 5.5 便宜嗎?
GPT-6.1 Sol 和 Sonnet 5.5 的標價同為 $2 / $10,但 GPT-6.1 Sol 的每項任務成本較低:在我們的測試中,兩款模型各用預設設定時,單次作答任務是 0.49x,工具迴圈每次執行是 0.46x;Artificial Analysis 同為 52 分時,成本是 $0.72 對 $2.74。Sonnet 5.5 速度較快,使用 max 時分數也較高。
GPT-6.1 Sol 和 Claude Opus 5.5 一樣好嗎? GPT-6.1 Sol 在 Artificial Analysis 智慧指數比 Opus 5.5 低約 6 分(52 對 58),Vals 指數也是如此(61.2% 對 67.0%),但每項任務成本約為八分之一到十分之一;在我們的測試中,短任務成本是 0.29x。OpenAI 自行執行的 AutomationBench 測試則顯示,它高出 Opus 5.5 達 2.2 分。
GPT-6.1 Sol 還能關閉推理嗎?
GPT-6.1 Sol 列出的最低 effort 是 low;GPT-6 Sol 原本接受的 none 已移除。請改用 low,在我們的測試中,每項單次作答任務成本為 $0.0018。
相關測量:Claude Sonnet 5.5 與 Sonnet 5 比較、GPT-6 Astra 的 effort 級距,以及降低 GPT-5.6 成本的方法。
測量日期為 2026-09-30,距 GPT-6.1 Sol 發布一天。我們透過閘道存取 OpenAI Responses API 和 Anthropic Messages API,執行了 GPT-6.1 Sol 的 234 次單次作答呼叫(13 項任務、重複 3 次、6 種設定)、800 次商業文件呼叫(80 個只給目標的項目,涵蓋 6 種模型與 effort 設定;80 個明列必要內容的項目,涵蓋 4 種設定),以及 36 次工具迴圈執行。Sonnet 5.5 和 Opus 5.5 的單次作答與工具迴圈數據,來自 2026-09-29 執行的相同任務。公開評測數據取自 2026-10-01 各發布單位的頁面。