新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

GPT-6.1 Sol 對比 Claude Sonnet 5.5:同為 $2/$10,每項任務成本減半

目錄
  1. GPT-6.1 Sol 是什麼?OpenAI 對它有什麼主張?
  2. 該和哪款模型比較:Opus 5.5、Sonnet 5.5,還是 GPT-6 Sol?
  3. 我們怎麼測試?
  4. GPT-6.1 Sol 的每項任務成本比 Sonnet 5.5 低嗎?
  5. 哪款模型能遵守「只回覆答案」?哪款答得對?
  6. GPT-6.1 Sol 改善了 GPT-6 Sol 回答太短的問題嗎?
  7. GPT-6.1 Sol 比較慢嗎?
  8. 在工具迴圈中表現如何?
  9. 我們的結果和其他已發布測試一致嗎?
  10. 我們觀察到什麼?該選哪款?
  11. 常見問題

GPT-6.1 Sol 和 Claude Sonnet 5.5 的標價相同:每百萬輸入 token 為 $2,每百萬輸出 token 為 $10,但每項任務的成本差很多。兩款模型都使用各自的 API 預設 effort(回答前的推理量設定)時,GPT-6.1 Sol 的成本約為一半(0.49x);在獨立評測指數拿到相同分數時,成本約為四分之一。OpenAI 指定比較的對手 Claude Opus 5.5 則是它的 0.29x。Sonnet 5.5 的額外成本換來的是獨立評測指數高出 4 到 6 分的最高分、更快的回應速度,以及在 GPT-6.1 Sol 反覆答錯一項任務時沒有答錯。

TL;DR

  • 使用 API 預設設定,在 13 項任務中,GPT-6.1 Sol 的每項任務成本是 Sonnet 5.5 的 0.49x、Opus 5.5 的 0.29x。
  • 在 Artificial Analysis 評測中,GPT-6.1 Sol 使用 max、Sonnet 5.5 使用 xhigh 都得到 52 分,每項任務成本分別為 $0.72 和 $2.74。
  • GPT-6.1 Sol 在 234 次提示中全都只回傳要求的值;Sonnet 5.5 使用預設設定時,39 次中有 22 次做到。
  • Sonnet 5.5 在 234 次呼叫中全數答對;GPT-6.1 Sol 在同一項任務的 18 次呼叫中答錯 7 次。

GPT-6.1 Sol 是什麼?OpenAI 對它有什麼主張?

GPT-6.1 Sol 是 OpenAI 中階模型的更新版,於 2026-09-29 推出,距離同價位的 GPT-6 Sol 發布僅七天。這一週內,開發者批評 GPT-6 Sol 回答太短,Anthropic 推出同樣標價 $2 / $10 的 Sonnet 5.5,OpenAI 則在內部測試發現欺瞞與未經授權的行為後,取消原定推出的旗艦模型 GPT-6.1 Astra,CBC 對此有所報導。

Token 價格、1,050,000 token 的上下文視窗,以及 128,000 token 的輸出上限都沒變;快取輸入現在每百萬 token 收費 $0.10,低於原本的 $0.20。會讓既有程式碼出問題的是 reasoning.effort:這個 Responses API 參數控制模型回答前進行多少隱藏推理,而這些推理會算入輸出費用。設定範圍從 low 到 max,預設是 medium,none 已移除。原本在 GPT-6 Sol 關閉推理的請求,現在要改用 low;原本只允許在 none 設定下透過 Chat Completions 執行的工具呼叫,現在則要改用 Responses API。

OpenAI 將這款模型拿來與兩款旗艦模型比較:自家的 GPT-6 Astra 和 Anthropic 的 Claude Opus 5.5。在 DeepSWE v1.1(代理式程式開發)上,它以約五分之一的成本與 Astra 同分;在 OSWorld 2.0(電腦操作)上,它落後 Astra 2.1 分,但成本約為七分之一;在 AutomationBench(企業工作流程)上,使用 medium 時比 Opus 5.5 高 2.2 分;在 Terminal-Bench Science 上,使用 max 時每項任務成本為 $5.47,Opus 5.5 則是 $23.21。這些都是 OpenAI 自行執行的測試,沒有納入 Sonnet 5.5。發布時也宣布了 Ultrafast 方案,速度最高提升 6x,價格也是 6x。

該和哪款模型比較:Opus 5.5、Sonnet 5.5,還是 GPT-6 Sol?

Sonnet 5.5 才是最適合比較的對象,因為它的標價相同,也最能看出標價相同不代表實際成本相同。下表將這三款候選模型與 GPT-6.1 Sol 並列;獨立評測結果取自各發布單位的頁面。

GPT-6.1 SolOpus 5.5Sonnet 5.5GPT-6 Sol
標價,每百萬輸入/輸出 token$2 / $10$4 / $20$2 / $10$2 / $10
發布日期2026-09-292026-09-222026-09-282026-09-22
發布時比較的模型GPT-6 Astra、Opus 5.5Fable 5.1、Opus 5、GPT-6 AstraOpus 5.5、GPT-6 SolGPT-6 Astra、Opus 5、Fable 5
Artificial Analysis 智慧指數,使用 max(推理、知識與程式開發評測)52585648
使用 max 時,每項指數任務成本$0.72$5.98$7.60$1.04
Vals 指數(程式開發、法律、稅務、醫療等專業任務)61.2%67.0%67.0%57.5%
每項 Vals 測試成本$3.24$32.14$21.34$7.58
AutomationBench 1.0.6 公開排行榜,使用 max(跨應用程式的企業工作流程)未列出42.47%,每項任務 $1.4444.75%,每項任務 $1.14未列出
  • Opus 5.5 是 OpenAI 指定的比較對象,但標價是兩倍,在兩項指數上都高出約 6 分。
  • GPT-6 Sol 是同價位的前代模型。GPT-6.1 Sol 在兩項指數上都勝過它,每項任務成本也更低;這組比較只能用來判斷是否值得升級。
  • Sonnet 5.5 標價相同,早一天推出,發布時同樣以 Opus 5.5 為比較對象。它的分數與 Opus 5.5 相差不到 2 分,比 GPT-6.1 Sol 高 4 到 6 分。

標價相同,不代表兩款模型划算程度相同。以分數對照成本,GPT-6.1 Sol 比兩款 Claude 模型便宜:

  • 分數相同時,它的成本是 Sonnet 5.5 的五分之一到四分之一:在 Artificial Analysis,Sonnet 5.5 使用 xhigh、GPT-6.1 Sol 使用 max 都拿到 52 分,每項任務成本分別是 $2.74 和 $0.72。降低一個級距後,Sonnet 5.5 使用 high 拿到 47 分,成本 $1.08;GPT-6.1 Sol 使用 medium 拿到 48 分,成本 $0.21。
  • 看指數的最高設定結果,Sonnet 5.5 的每項任務成本接近 Opus 5.5:Artificial Analysis 使用 max 時是 $7.60 對 $5.98,Vals 則是 $21.34 對 $32.14。兩者的成本都是 GPT-6.1 Sol 的 7 到 11 倍。

相對地,Sonnet 5.5 和 Opus 5.5 在 Artificial Analysis 分別能拿到 56 和 58 分,GPT-6.1 Sol 無論使用哪種設定都達不到。

我們怎麼測試?

我們透過各模型原生的 API 執行三組任務,並全部用程式碼評分:GPT 使用 Responses,Claude 使用 Messages。

測試內容測量項目
單次作答任務13 項有標準答案的任務(例如 10 件物品的背包問題:在重量上限內找出最佳物品組合),每題結尾都要求「只回覆一個整數,不要有其他內容」;每個 effort 設定重複 3 次答案是否正確、是否只回覆指定值、成本、時間
商業文件80 個只給目標的提示(「撰寫 Q3 區域回顧」),以及 80 個明列必要內容的提示;文件包含季度回顧、事件事後檢討、供應商比較、客服回覆必要內容是否齊全、字數、成本
工具迴圈針對小型合成程式碼庫的 4 道程式碼閱讀題,提供 3 個工具,各重複 3 次解出的題目、工具呼叫次數、成本、時間

每個提示都帶有一段不重複的隨機字串,避免回應命中快取;成本依標價計算。Sonnet 5.5 和 Opus 5.5 的單次作答與工具迴圈數據,取自前一天我們對 Sonnet 5.5 的測量,使用相同任務與評分程式。只有通過 Holm 校正的差距才視為顯著;同時檢驗多組比較時,這項校正會提高顯著性門檻。只回覆指定值的比較以任務為單位計數,因為同一任務的重複測試並非獨立樣本。

GPT-6.1 Sol 的每項任務成本比 Sonnet 5.5 低嗎?

GPT-6.1 Sol 的成本約為一半:兩款模型各用自己的 API 預設設定時,每項單次作答任務成本分別是 $0.0020,以及 Sonnet 5.5 的 $0.0042,比例為 0.49(對 13 項任務重新抽樣得出的 95% 區間為 0.40 到 0.59)。在低於 max 的設定下,Sonnet 5.5 的輸出 token 數是它的 1.7 到 2.5 倍;在 max 時是 3.1 倍。Opus 5.5 的標價是兩倍,使用預設設定時每項任務成本為 $0.0070,因此 GPT-6.1 Sol 的成本是它的 0.29x。

各個 effort 設定下的比例都差不多:GPT-6.1 Sol 的成本是 Sonnet 5.5 的 0.33x 到 0.58x,也是 Opus 5.5 的 0.20x 到 0.31x。請求未指定 effort 時,GPT-6.1 Sol 和 Opus 5.5 使用 medium,Sonnet 5.5 使用 high。另外兩項測試相對於 Sonnet 5.5 也都得到 0.46x:只給目標的商業文件每份是 $0.0103 對 $0.0223,工具迴圈每次是 $0.0052 對 $0.0112。

分組長條圖,比較 GPT-6.1 Sol、Claude Sonnet 5.5 和 Claude Opus 5.5 在各種 effort 設定下,每 1,000 項單次作答任務的成本。使用預設設定時分別是 $2.0、$4.1 和 $7.0;使用 max 時是 $4.7、$14.6 和 $23.4。GPT-6.1 Sol 在所有設定下成本都最低。GPT-6.1 Sol 和 Opus 5.5 在所有設定下,39 次中都各有 39 次只回覆指定值;Sonnet 5.5 則是 39 次中有 12 到 39 次

Effort 只需設定一個請求欄位,計費 token 數會在 usage 中回傳:

from openai import OpenAI

client = OpenAI()
resp = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "low"},  # low, medium (default), high, xhigh, max; "none" is not listed for 6.1
    input="Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else.",
)
print(resp.output_text)
u = resp.usage
print(u.output_tokens, u.output_tokens_details.reasoning_tokens, u.input_tokens_details.cached_tokens)

output_tokens 包含推理 token;cached_tokens 是輸入中以每百萬 token $0.10 計費的部分。

哪款模型能遵守「只回覆答案」?哪款答得對?

GPT-6.1 Sol 每次都遵守格式;Sonnet 5.5 則在 GPT-6.1 Sol 反覆答錯的一項任務上沒有出錯。GPT-6.1 Sol 在全部 234 次提示中都只回覆指定值,Opus 5.5 也是。Sonnet 5.5 使用預設設定時,39 次中有 22 次只回覆指定值;使用 low 時是 12 次,medium 是 24 次,high 是 30 次。低於 xhigh 時,它有時會略過 thinking block(Claude 回應中獨立的推理部分),直接在回覆中寫出計算過程,詳見我們的 Sonnet 5.5 文章。以任務為單位計算,使用 low 時的差距通過校正(13 項任務中,GPT-6.1 Sol 有 9 項較好,沒有較差的任務);使用預設設定時則沒有通過(6 項較好,沒有較差的任務)。若程式碼要解析單一數值,可以直接讀取 GPT-6.1 Sol 的回覆;使用 Sonnet 5.5 時,則取最後一行或改用 xhigh。

Sonnet 5.5 在 234 次呼叫中全數答對,Opus 5.5 答錯 2 次。GPT-6.1 Sol 在 18 次背包問題呼叫中有 7 次回答 72,但窮舉所有子集合確認的正確答案是 62:low 的 3 次全錯,預設設定和 medium 都是 3 次錯 1 次,xhigh 是 3 次錯 2 次,high 和 max 則沒有答錯。13 項任務中只有一項出問題,不足以證明準確率存在差距,但這顯示錯誤不容易被發現:回覆是一個格式正確的整數,提高 effort 也無法穩定避免錯誤。

GPT-6.1 Sol 改善了 GPT-6 Sol 回答太短的問題嗎?

GPT-6.1 Sol 又能寫出完整篇幅的回答。在只給文件名稱、不指定內容的提示下,它每份文件寫出 565 個英文單字,GPT-6 Sol 則是 325 個;全部 80 項都比較長,與 GPT-5.6 Sol 的 592 個相近。至於 GPT-6 Sol 會漏掉內容的抱怨,我們未能重現:在 60 份有評分的文件中,它有 58 份內容完整(涵蓋每個區域、每起事件的每個經過,以及每張客服單的回覆),與 GPT-5.6 Sol 相同。20 份供應商比較沒有評分,因為哪家供應商較合適屬於主觀判斷。

提示明列必要內容時,三款 OpenAI 模型都在 80 份文件中全數寫齊。Sonnet 5.5 在只給目標的提示下寫出最長的文件(747 個英文單字),所有有評分的文件也都完整,但在明列必要內容的提示中有 80 份中的 12 份未達要求,每次都是其中的備忘錄或建議部分比指定字數範圍的下限少 1 到 28 個英文單字。這項差距通過校正,但 12 份中有 10 份是季度回顧,因此不太能推論到其他文件類型。

回答變長後,GPT-6 Sol 每份只給目標的文件成本 $0.0078,在 GPT-6.1 Sol 上升至 $0.0103。但這仍比標價 $4 / $20 的 GPT-5.6 Sol 低 59%(該價格是截至 2026-11-21 的促銷價);即使用 $2 / $10 重新計算 GPT-5.6 Sol 的 token 費用,GPT-6.1 Sol 仍便宜 19%,因為它用較少的 token 寫出相同篇幅。

GPT-6.1 Sol 比較慢嗎?

GPT-6.1 Sol 比前代模型和 Sonnet 5.5 都慢,長篇輸出尤其明顯。以商業文件整體請求時間計算,它每秒產生約 43 個輸出 token,GPT-6 Sol 是 100 個、GPT-5.6 Sol 是 80 個、Sonnet 5.5 是 127 個。只給目標的文件耗時中位數分別是 22.4 秒、7.2 秒、13.9 秒和 17.2 秒。較短的單次作答任務差距比較小:使用預設設定時,GPT-6.1 Sol 是 5.7 秒,Sonnet 5.5 是 3.9 秒,Opus 5.5 是 5.5 秒。實際速度會受服務端與時段影響;Artificial Analysis 的數據也顯示,它的速度不到 Sonnet 5.5 的一半,每秒 64 個 token 對 139 個。

在工具迴圈中表現如何?

GPT-6.1 Sol 和 Sonnet 5.5 在所有設定下都完成了 12 次執行;GPT-6.1 Sol 的成本不到一半,但耗時將近兩倍。工具迴圈的流程是模型要求呼叫工具,呼叫端程式碼執行後把結果傳回模型,反覆進行直到模型作答。我們在小型合成程式碼庫上提供了三個工具:列出檔案、讀取檔案、搜尋。使用預設設定時,每次執行的成本分別為 GPT-6.1 Sol 的 $0.0052、Sonnet 5.5 的 $0.0112,以及 Opus 5.5 的 $0.0332;耗時中位數分別為 12.2、6.7 和 25.3 秒。使用 max 時,GPT-6.1 Sol 的成本升至 $0.0086,Sonnet 5.5 升至 $0.0422,每次執行的工具呼叫次數分別是 6.4 和 14.7 次。

我們的結果和其他已發布測試一致嗎?

我們的結果與已發布測試的趨勢一致。差距幅度不同,是因為我們的任務較短,而且多數使用 API 預設設定;公開評測指數則以 max 執行較長的任務。

問題其他已發布結果我們的測量判斷
GPT-6.1 Sol 相對於 Sonnet 5.5 的成本Artificial Analysis:使用 max 時,每項指數任務 $0.72 對 $7.60,相差約 11x預設設定下是 0.49x,max 下是 0.33x趨勢相同;使用 max 時,任務越長差距越大:單次作答是 0.33x,我們的工具迴圈是 0.20x,指數任務是 0.09x
速度Artificial Analysis:每秒 64 對 139 個輸出 token;Vals AI:代理式任務的耗時是 GPT-6 Sol 的 2 到 3 倍每秒 43 對 127 個 token;每份文件耗時 22.4 秒,GPT-6 Sol 則是 7.2 秒一致
相對於 Sonnet 5.5 的品質Artificial Analysis 是 52 對 56;Vals 是 61.2% 對 67.0%Sonnet 5.5 在 234 次中全數答對;GPT-6.1 Sol 在同一項任務的 18 次中答錯 7 次趨勢相同;我們的結果只來自一項任務
GPT-6 Sol 回答太短或漏掉內容開發者的抱怨,例如 Hacker News 發布討論串每份文件 325 個英文單字,GPT-5.6 Sol 是 592 個;60 份中有 58 份內容完整,與 GPT-5.6 Sol 相同確認回答較短;未能重現漏掉內容
Sonnet 5.5 不遵守「只回覆答案」未找到已發布報告預設設定下 39 次中有 22 次只回覆指定值,low 下是 39 次中有 12 次僅有我們的數據

我們觀察到什麼?該選哪款?

相較於 Sonnet 5.5 和 Opus 5.5,GPT-6.1 Sol 更划算;如果延遲或最後 4 到 6 分的品質差距很重要,就選 Sonnet 5.5。依據有四點:

  1. 以達到的品質來看,GPT-6.1 Sol 比兩款 Claude 模型便宜。相較於 Sonnet 5.5,短任務每項成本約為一半,同分的指數任務約為四分之一,指數最高設定結果約為七分之一到十分之一。相較於 Opus 5.5,短任務每項成本為 0.29x,指數任務約為八分之一到十分之一。
  2. 它更能遵守輸出格式。所有要求只回覆答案的提示,以及所有明列必要內容的文件提示,它都照要求輸出。
  3. 回答不再太短,但速度變慢。回答長度回到 GPT-5.6 Sol 的水準,每份文件耗時則是 GPT-6 Sol 的三倍。
  4. 它的錯誤不容易察覺。7 次錯誤出現在 low、medium 和 xhigh,每次都回覆了格式正確的整數。
工作負載建議選擇數據
由程式碼解析輸出的擷取、分類、單一數值任務使用 medium 或 high 的 GPT-6.1 Sol234 / 234 次只回覆指定值;使用 medium 時每項任務 $0.0021
答錯代價高的多步驟數學或邏輯任務Sonnet 5.5,或使用 GPT-6.1 Sol 並驗證結果Sonnet 5.5 在 234 / 234 次中全數答對;GPT-6.1 Sol 在同一項任務的 18 次呼叫中答錯 7 次
重視延遲的聊天與互動式工具使用預設設定的 Sonnet 5.5短任務每項耗時 3.9 秒對 5.7 秒;文件每份 17.2 秒對 22.4 秒
每次執行成本比延遲更重要的代理迴圈使用預設設定的 GPT-6.1 Sol每次執行 $0.0052 對 $0.0112;耗時 12.2 秒對 6.7 秒
有必備章節的文件GPT-6.1 Sol,或為 Sonnet 5.5 指定較寬鬆的長度要求80 / 80 份符合要求,對手是 68 / 80;未達標的文件比下限少 1 到 28 個英文單字
最高分很重要的高難度開放式任務使用 max 的 Sonnet 5.5 或 Opus 5.5公開指數分數為 56 和 58,GPT-6.1 Sol 是 52;每項任務成本是 7 到 11 倍

無論使用哪款模型,只要程式會依據某個值採取動作,就要驗證那個值。

常見問題

GPT-6.1 Sol 比 Claude Sonnet 5.5 便宜嗎? GPT-6.1 Sol 和 Sonnet 5.5 的標價同為 $2 / $10,但 GPT-6.1 Sol 的每項任務成本較低:在我們的測試中,兩款模型各用預設設定時,單次作答任務是 0.49x,工具迴圈每次執行是 0.46x;Artificial Analysis 同為 52 分時,成本是 $0.72 對 $2.74。Sonnet 5.5 速度較快,使用 max 時分數也較高。

GPT-6.1 Sol 和 Claude Opus 5.5 一樣好嗎? GPT-6.1 Sol 在 Artificial Analysis 智慧指數比 Opus 5.5 低約 6 分(52 對 58),Vals 指數也是如此(61.2% 對 67.0%),但每項任務成本約為八分之一到十分之一;在我們的測試中,短任務成本是 0.29x。OpenAI 自行執行的 AutomationBench 測試則顯示,它高出 Opus 5.5 達 2.2 分。

GPT-6.1 Sol 還能關閉推理嗎? GPT-6.1 Sol 列出的最低 effort 是 low;GPT-6 Sol 原本接受的 none 已移除。請改用 low,在我們的測試中,每項單次作答任務成本為 $0.0018。

相關測量:Claude Sonnet 5.5 與 Sonnet 5 比較、GPT-6 Astra 的 effort 級距,以及降低 GPT-5.6 成本的方法。

測量日期為 2026-09-30,距 GPT-6.1 Sol 發布一天。我們透過閘道存取 OpenAI Responses API 和 Anthropic Messages API,執行了 GPT-6.1 Sol 的 234 次單次作答呼叫(13 項任務、重複 3 次、6 種設定)、800 次商業文件呼叫(80 個只給目標的項目,涵蓋 6 種模型與 effort 設定;80 個明列必要內容的項目,涵蓋 4 種設定),以及 36 次工具迴圈執行。Sonnet 5.5 和 Opus 5.5 的單次作答與工具迴圈數據,來自 2026-09-29 執行的相同任務。公開評測數據取自 2026-10-01 各發布單位的頁面。

← 返回部落格