GPT-6 Luna 對比 GPT-5.6 Luna:價格減半,字數也減半
目錄
在公開基準測試中,GPT-6 Luna 與 GPT-5.6 Luna 表現相近(Artificial Analysis Intelligence Index 分別為 38 和 37),但每項任務的成本約為一半。差別在產出的內容:提示只交代目標(例如「撰寫 Q3 回顧」)時,GPT-6 Luna 在 80 份商業文件中的字數只有 GPT-5.6 Luna 的 0.55 倍。明確要求的項目並沒有被漏掉。提示列出必要項目後,兩個模型的文件完整度相當;只給目標時,GPT-6 Luna 比較常漏掉的細節只有事件持續時間。
TL;DR
- 在
maxeffort 下,Artificial Analysis 給 GPT-6 Luna 38 分、GPT-5.6 Luna 37 分;每項任務成本分別是 $0.07 和 $0.18。 - 提示只給目標時,GPT-6 Luna 每份文件寫 384 字,GPT-5.6 Luna 則寫 703 字。
- 在 20 份只給目標的事件檢討報告中,GPT-6 Luna 有 9 份沒寫事件持續時間,GPT-5.6 Luna 有 2 份。
- 提示列出必要項目後,GPT-6 Luna 的 80 份文件中有 74 份完整,GPT-5.6 Luna 有 69 份;每 1,000 份成本分別是 $0.81 和 $1.61。
GPT-6 Luna 和 GPT-5.6 Luna 的基準測試表現如何?
在一般基準測試中,GPT-6 Luna 的表現與 GPT-5.6 Luna 相當,每項任務的成本低 48% 到 61%。兩者只有在依評分規準(評分檢查表)評估的文件任務上拉開差距。分數對應特定的推理強度,也就是 API 中控制模型回答前推理量的設定(從 none 到 max,預設為 medium)。以下數據取自發布方於 2026-10-02 的頁面。
| GPT-6 Luna | GPT-5.6 Luna | |
|---|---|---|
| 發布日期 | 2026-09-22 | 2026-07-09 |
| 定價,每 1M tokens 的輸入/輸出費用 | $0.10 / $0.50 | $0.20 / $1.20 |
| Artificial Analysis Intelligence Index v4.3.2,max(10 項評測:知識、推理、程式開發、代理任務與商業文件任務) | 38 | 37 |
| 每項指數任務成本 | $0.07 | $0.18 |
| Vals Index(程式開發、法律、稅務、財務及其他專業任務) | 51.2% | 51.7% |
| 每項 Vals 測試成本 | $0.43 | $0.82 |
| GDPval-AA v2.1 Elo,max(依隱藏評分規準評估的商業文件;Elo 根據一對一比較計算,越高越好) | 1438 | 1463 |
| GDPval-AA v2.1 Elo,medium | 1262 | 1133 |
| 輸出速度,每秒 tokens | 131 | 124 |
對 GPT-6 Luna 的質疑始於 GDPval-AA。Artificial Analysis 的發布分析指出,GPT-6 Luna 在 GDPval-AA 比 GPT-5.6 Luna 低約 75 個 Elo 點,在另一項文件基準測試 AA-Briefcase v1.1 低約 45 點;原因被歸為「呈現品質下降,交付文件漏掉評分規準中的項目」,評測人員稱之為「格式成本」。目前排行榜顯示,max 下的差距縮為 25 點;在 medium 下,GPT-6 Luna 則領先 129 點。
與其他廠商相比,GPT-6 Luna 的對手是低價、高速的 flash 級模型。在同一指數中,DeepSeek V4.1 Flash 於 max 取得 39 分,每項任務 $0.27;Gemini 3.8 Flash 於 high 取得 41 分,每項任務 $1.24。GPT-6 Luna 少 1 到 3 分,但每項任務成本低 4 到 18 倍。兩款競品的生成速度都更快,分別為每秒 209 和 249 個 token。
除了價格,還有什麼變化?
GPT-6 Luna 沿用 GPT-5.6 Luna 的限制與設定;變動的只有快取價格和知識截止日期。兩者的上下文視窗都是 1,050,000 個 token,輸出上限都是 128,000 個 token。提示一旦超過 272K tokens,整筆請求的輸入按 2 倍、輸出按 1.5 倍計費。快取輸入每百萬個 token 的價格從 $0.02 降至 $0.01,知識截止日期則從 2026 年 2 月 16 日推進到 5 月 18 日。在 Responses API 中,推理強度透過 reasoning.effort 設定(none、low、medium、high、xhigh、max);推理內容不會顯示,但會按輸出 token 計費。
發布一週後,OpenAI 推出高一級的 GPT-6.1 Sol,接替 GPT-6 Sol;我們對 GPT-6.1 Sol 的測量發現,它的回答長度已回到先前水準。Luna 沒有更新,因此我們測量 GPT-6 Luna 哪些內容寫得較短、漏了什麼,以及如何讓內容恢復完整。
我們怎麼測試?
我們設計了能用程式碼檢查要求是否達成的文件任務,不使用評審模型。每項任務都提供一組合成資料,要求模型據此產出文件:
| 文件 | 資料 | 讀者預期看到的內容 |
|---|---|---|
| 季度回顧 | 6 到 12 個區域的營收 | 涵蓋每個區域,指出下滑最多的區域 |
| 事件檢討報告 | 7 到 10 筆有時間戳記的事件 | 涵蓋每筆事件,寫出事件持續時間 |
| 供應商比較 | 5 到 8 份託管服務報價 | 涵蓋每家供應商 |
| 客戶回覆 | 6 到 14 張客服工單 | 回覆每張工單,並以姓名稱呼客戶 |
每項任務使用相同資料,搭配兩種提示方式。只給目標 的提示只說明要寫什麼文件,不指定內容項目(例如「為管理團隊撰寫 Q3 各區域回顧」);評分只檢查表中所列項目。列出必要項目 的提示會指定段落、數量和字數範圍,評分也會檢查所有這些要求。只要有必要項目缺漏、字數不足或數量未達標,文件就不算完整。只給目標的供應商比較僅計入長度,因為哪家供應商最合適需要主觀判斷。
我們在 2026-10-02 以五種推理強度,讓兩個模型各自執行 80 項只給目標的任務;另以一種詳略度設定測試 GPT-6 Luna。列出必要項目的 80 項任務則由兩個模型以預設推理強度執行,總計 1,040 次 Responses API 呼叫。每個提示都帶有不重複的隨機字串,避免回應來自快取;成本按 OpenAI 定價計算。兩個模型回答相同題目,因此我們使用精確 McNemar 檢定(針對兩模型結果不同的題目進行配對檢定),並以 Holm 校正調整多重比較的門檻。只有通過校正的差距,我們才視為差異。
GPT-6 Luna 寫得比 GPT-5.6 Luna 少嗎?
在預設推理強度、只給目標的提示下,GPT-6 Luna 的字數是 GPT-5.6 Luna 的 0.55 倍:每份文件平均 384 字,對方為 703 字;80 題中每一題都較短。所有文件類型都是如此,差距最大的是事件檢討報告(441 字對 981 字),最小的是客戶回覆(576 字對 767 字)。
列出必要項目後,字數差距就消失了:738 字對 724 字。
回答較短並非 Luna 獨有。在相同題目上,GPT-6 Sol 寫 325 字,GPT-5.6 Sol 寫 592 字;GPT-6.1 Sol 則回升到 565 字。
GPT-6 Luna 會漏掉內容嗎?
只給目標時,GPT-6 Luna 比 GPT-5.6 Luna 更常漏掉的項目只有一個:事件檢討報告中的事件持續時間。它通常會寫出時間區間(「事件時間:18:00-18:39 UTC」),但讓讀者自己計算經過多久。其他項目在所有推理強度下都齊全:每個區域及下滑最嚴重者、每筆事件,以及每張工單都有以姓名稱呼客戶的回覆;只有 none 下出現一次例外。
| 只給目標的提示 | GPT-6 Luna 完整份數 | GPT-6 Luna 未寫持續時間的事件檢討報告 | GPT-5.6 Luna 完整份數 | GPT-5.6 Luna 未寫持續時間的事件檢討報告 |
|---|---|---|---|---|
none | 44 / 60 | 15 / 20 | 57 / 60 | 3 / 20 |
low | 47 / 60 | 13 / 20 | 54 / 60 | 6 / 20 |
medium | 51 / 60 | 9 / 20 | 58 / 60 | 2 / 20 |
high | 53 / 60 | 7 / 20 | 57 / 60 | 3 / 20 |
max | 59 / 60 | 1 / 20 | 60 / 60 | 0 / 20 |
none 下的差距(44 對 57)通過校正後仍成立。medium 下的差距(51 對 58)只在校正前達顯著,因此只能視為趨勢;max 下兩者相當。差距全來自同一種文件,顯示 GPT-6 Luna 在事件檢討報告中會略過推算出的數值,而不是普遍漏寫內容。
列出必要項目後,GPT-6 Luna 的 80 份文件中有 74 份完整,GPT-5.6 Luna 有 69 份,兩者相當。兩個模型所有未達標的文件,都是備忘錄或影響評估段落未達指定字數:GPT-6 Luna 有 6 份,GPT-5.6 Luna 有 11 份。
怎麼讓篇幅和細節恢復完整?
在提示中列出必要項目有效,兩個請求參數則無效。在相同推理強度下,只要提示明確要求,GPT-6 Luna 就從 384 字增加到 738 字,並在每份事件檢討報告中寫出持續時間。像這樣的請求就夠了:
Write the postmortem with these sections: Timeline (a table with every event),
Impact (120-200 words, state the total duration in minutes), Root Cause,
Action Items (5, each ending "Owner: <team>"), Lessons Learned (at least 3 bullets).
text.verbosity 是 Responses API 控制可見回答長度與細節的參數(low、medium、high)。設為 high 後,GPT-6 Luna 在只給目標任務中的文件多寫了 7%(410 字),完整度則幾乎不變:60 份中有 52 份完整,原本是 51 份。
提高 reasoning.effort 對模型思考量的影響,大於對輸出字數的影響。從 none 提高到 max,GPT-6 Luna 的文件從 370 字增加到 436 字,每份回答的推理 token 則從 0 增加到 4,192 個。max 確實讓持續時間不再常被漏掉(20 份中只漏 1 份),但成本是 medium 的 4.5 倍。
透過 OpenAI Python SDK 設定這兩個參數:
from openai import OpenAI
client = OpenAI()
prompt = "Write the postmortem with these sections: ..." # data and required parts
resp = client.responses.create(
model="gpt-6-luna",
reasoning={"effort": "medium"}, # none, low, medium (default), high, xhigh, max
text={"verbosity": "high"}, # 7% longer in our runs; did not change completeness
input=prompt,
)
print(resp.output_text)
usage = resp.usage
print(usage.output_tokens, usage.output_tokens_details.reasoning_tokens)
output_tokens 包含推理 token,因此可見回答的 token 數是這兩個數字的差。
GPT-6 Luna 比 GPT-5.6 Luna 省多少?
產出相同文件時,GPT-6 Luna 比 GPT-5.6 Luna 便宜 49%:提示列出必要項目時,每 1,000 份文件分別是 $0.81 和 $1.61。光是降價,節省幅度原本還會更大。若把 GPT-5.6 Luna 的 token 用 GPT-6 Luna 的費率重算,成本會是 $0.68,低 58%;GPT-6 Luna 的實際回答成本又比這個數字高 20%,因為它的推理量是兩倍(每份回答 537 個推理 token,對方為 271 個),總輸出也從 1,284 增加到 1,558 個 token。
只給目標時,帳面成本更低:每 1,000 份文件為 $0.54 對 $1.66,少 68%。但額外省下的錢主要來自 GPT-6 Luna 只寫了一半;前提是省略的那一半本來就不需要。
速度大致相同。以整筆請求耗時換算,GPT-6 Luna 每秒產出 115 個輸出 token,GPT-5.6 Luna 為 125 個;只給目標的文件中位耗時分別是 8.1 秒與 11.1 秒,因為前者寫得較少。
我們的結果和其他公開測試一致嗎?
在可比較的部分,我們的結果與公開基準測試一致;我們另外量出內容縮短在哪裡、漏了什麼,以及如何補回來。
| 問題 | 其他公開結果 | 我們的測量 | 判斷 |
|---|---|---|---|
| 一般能力:GPT-6 Luna 對比 GPT-5.6 Luna | Artificial Analysis 為 38 對 37;Vals 為 51.2% 對 51.7% | 列出必要項目後,80 份中完整的分別有 74 和 69 份,兩者相當 | 一致:表現相近 |
| 文件品質 | GDPval-AA v2.1 Elo:max 下低 25 點,medium 下高 129 點 | medium 下,只給目標時字數為 0.55 倍;20 份事件檢討報告中,未寫持續時間的分別有 9 份和 2 份 | 結果不一:兩者都未顯示預設推理強度下有明確退步;我們量出了預設篇幅較短,以及因此漏掉的一項內容 |
| 輸出 token | max 下,每項指數任務為 51K 對 41K,多 24% | medium 下,每份文件為 1,558 對 1,284,多 21% | 一致 |
| 成本 | 每項指數任務低 61%;每項 Vals 測試低 48% | 列出必要項目後低 49%;只給目標時低 68% | 一致 |
我們觀察到什麼?該選哪個模型?
只要能控制提示,就用 GPT-6 Luna,並列出需要的項目。只有在提示無法修改、讀者又預期拿到長篇文件時,才保留 GPT-5.6 Luna。理由有三個:
- GPT-6 Luna 會依提示決定篇幅。只給目標會得到短文件;列出必要項目後,文件會完整,篇幅也與 GPT-5.6 Luna 相當。
- 漏掉的內容範圍很小。四種文件中,唯一更常缺少的預期項目是事件持續時間。
- 節省來自降價。產出相同文件時,它多用 21% 的輸出 token,因此實際省下 49%,低於單看定價原本可省的 58%。
| 工作負載 | 建議 | 數據 |
|---|---|---|
| 由程式讀取的輸出:分類、擷取、路由 | GPT-6 Luna,使用準確度允許的最低推理強度 | 輸入與輸出的定價分別低 50% 和 58%;由程式讀取時,回答長度不重要 |
| 由範本或自行撰寫的提示產生文件 | GPT-6 Luna,在提示中列出段落、數量與長度 | 80 份中完整的分別有 74 和 69 份;每 1,000 份為 $0.81 對 $1.61 |
| 由無法編輯的終端使用者提示產生文件 | 若能在請求中補上預期項目,選 GPT-6 Luna;否則選 GPT-5.6 Luna | 只給目標:384 字對 703 字;20 份事件檢討報告中,漏掉持續時間的有 9 份對 2 份 |
| 依評分規準評估的交付文件 | 把評分規準寫進提示,不要依賴 text.verbosity | 詳略度設為 high:60 份中完整的有 52 份,原本為 51 份;字數多 7% |
交付給客戶的文件,不論由哪個模型撰寫,送出前都應以程式檢查必要項目。
常見問題
GPT-6 Luna 比 GPT-5.6 Luna 差嗎? 提示列出必要項目時,GPT-6 Luna 與 GPT-5.6 Luna 的完整度相當(80 份中有 74 份對 69 份完整),成本則約為一半。提示只給目標時,它寫的字數約為一半,也更常在事件檢討報告中漏掉事件持續時間。
text.verbosity: "high" 能讓 GPT-6 Luna 寫得跟 GPT-5.6 Luna 一樣長嗎?
在我們的測試中,text.verbosity: "high" 讓 GPT-6 Luna 多寫 7%,長度仍只有 GPT-5.6 Luna 的約 58%,完整度也沒有改變。在提示中列出必要項目,才能讓篇幅回到相同水準。
GPT-6.1 修正了 GPT-6 Luna 回答較短的問題嗎? OpenAI 的 6.1 更新只涵蓋 Sol 級:GPT-6.1 Sol 的篇幅已回到 GPT-5.6 Sol 的水準;GPT-6 Luna 自 2026-09-22 發布以來沒有更新。
相關測量:GPT-6.1 Sol 對比 Claude Sonnet 5.5、flash 級 LLM 比較及 GPT-5.6 成本調整方式】【。