GPT-6 Luna 对比 GPT-5.6 Luna:价格减半,篇幅也减半
目录
GPT-6 Luna 与 GPT-5.6 Luna 在公开基准测试中的表现接近(Artificial Analysis Intelligence Index 得分分别为 38 和 37),但每项任务的成本约为后者的一半。区别在于生成内容:当 prompt 只给出目标(如“撰写 Q3 回顾”)时,在 80 篇业务文档中,GPT-6 Luna 写出的词数是 GPT-5.6 Luna 的 0.55 倍。明确要求的部分并没有被跳过。列明必需部分后,两者的文档完整度相当;仅给出目标时,GPT-6 Luna 更常遗漏的细节只有事故持续时间。
TL;DR
- 在
max推理强度下,Artificial Analysis 给 GPT-6 Luna 和 GPT-5.6 Luna 的评分分别为 38 和 37,每项任务成本分别为 $0.07 和 $0.18。 - 仅给出目标时,GPT-6 Luna 每篇文档平均写 384 词,GPT-5.6 Luna 为 703 词。
- 仅给出目标的 20 篇事故复盘中,GPT-6 Luna 有 9 篇未写事故持续时间,GPT-5.6 Luna 有 2 篇。
- 列明必需部分后,GPT-6 Luna 在 80 篇文档中有 74 篇完整,GPT-5.6 Luna 有 69 篇;每 1,000 篇成本分别为 $0.81 和 $1.61。
GPT-6 Luna 与 GPT-5.6 Luna 的基准测试成绩如何?
GPT-6 Luna 在通用基准测试中与 GPT-5.6 Luna 表现接近,每项任务成本低 48% 至 61%。两者的差异只出现在按评分清单评估文档的测试中。下表分数均对应特定的推理强度,即 API 中控制模型回答前推理量的设置(从 none 到 max,默认 medium)。数据取自发布方截至 2026-10-02 的页面。
| GPT-6 Luna | GPT-5.6 Luna | |
|---|---|---|
| 发布日期 | 2026-09-22 | 2026-07-09 |
| 标价,每 1M token 的输入 / 输出价格 | $0.10 / $0.50 | $0.20 / $1.20 |
Artificial Analysis Intelligence Index v4.3.2,max 推理强度(10 项评测,涵盖知识、推理、编程、Agent 任务和业务文档任务) | 38 | 37 |
| Index 每项任务成本 | $0.07 | $0.18 |
| Vals Index(编程、法律、税务、金融及其他专业任务) | 51.2% | 51.7% |
| Vals 每项测试成本 | $0.43 | $0.82 |
GDPval-AA v2.1,max 推理强度下的 Elo(按未公开的评分清单评估业务文档;Elo 来自两两对比,越高越好) | 1438 | 1463 |
GDPval-AA v2.1,medium 推理强度下的 Elo | 1262 | 1133 |
| 输出速度,每秒 token 数 | 131 | 124 |
关于 GPT-6 Luna 的争议始于 GDPval-AA。Artificial Analysis 的发布分析指出,GPT-6 Luna 在 GDPval-AA 上比 GPT-5.6 Luna 低约 75 个 Elo 点,在另一项文档基准测试 AA-Briefcase v1.1 上低约 45 个 Elo 点,并将原因归为“呈现质量下降,以及交付文档遗漏评分项”;评测人员称之为“格式税”。目前排行榜上,max 推理强度下的差距是 25 分,而在 medium 下,GPT-6 Luna 领先 129 分。
与其他厂商的模型相比,GPT-6 Luna 面向的是 flash 档,也就是低价、高速模型。在同一 Index 上,DeepSeek V4.1 Flash 使用 max 时得 39 分,每项任务成本 $0.27;Gemini 3.8 Flash 使用 high 时得 41 分,每项任务成本 $1.24。GPT-6 Luna 少 1 至 3 分,但每项任务成本只有它们的 1/4 到 1/18。后两者生成速度更快,分别为每秒 209 和 249 个 token。
除价格外,还有哪些变化?
GPT-6 Luna 沿用 GPT-5.6 Luna 的限制和设置;变化的只有缓存价格和知识截止日期。两者的上下文窗口都是 1,050,000 个 token,输出上限都是 128,000 个 token。prompt 超过 272K 个 token 后,整次请求的输入按 2 倍、输出按 1.5 倍计费。缓存输入价格从每百万 token $0.02 降至 $0.01,知识截止日期从 2026 年 2 月 16 日推至 2026 年 5 月 18 日。在 Responses API 中,可通过 reasoning.effort 设置推理强度(none、low、medium、high、xhigh、max);推理内容不可见,但按输出 token 计费。
发布一周后,OpenAI 推出 GPT-6.1 Sol,接替更高档位的 GPT-6 Sol;我们对 GPT-6.1 Sol 的测试发现,其回答长度回到了之前的水平。Luna 没有更新,因此我们测了 GPT-6 Luna 哪些内容写得更短、遗漏了什么,以及怎样让这些内容重新出现。
我们如何测试?
我们设计了能用代码检查要求是否满足的文档任务,不使用评判模型。每项任务都给模型一组模拟数据,要求据此撰写文档:
| 文档 | 数据 | 读者期望看到的内容 |
|---|---|---|
| 季度回顾 | 6 至 12 个地区的营收数据 | 覆盖每个地区,指出降幅最大的地区 |
| 事故复盘 | 7 至 10 个带时间戳的事件 | 写出每个事件和事故持续时间 |
| 供应商对比 | 5 至 8 份托管服务报价 | 覆盖每家供应商 |
| 客户回复 | 6 至 14 张支持工单 | 回复每张工单,并称呼客户姓名 |
每项任务都基于同一组数据使用两种 prompt。仅给出目标 的 prompt 只说明要写什么文档,不指定组成部分(如“为管理团队撰写 Q3 地区回顾”),只按表中项目评分。列明必需部分 的 prompt 会列出章节、数量和词数范围,并按所有要求评分。只要没有缺少必需内容、篇幅不足或数量不足,文档就算完整。仅给出目标的供应商对比只统计篇幅,因为哪家供应商最合适需要主观判断。
2026-10-02,我们让两个模型在五档推理强度下分别处理 80 个仅给出目标的任务,并让 GPT-6 Luna 额外在一档详略程度设置下处理这些任务;两个模型还在默认推理强度下分别处理 80 个列明必需部分的任务,共调用 Responses API 1,040 次。每条 prompt 都带有唯一的随机字符串,避免从缓存取得响应;成本按 OpenAI 标价计算。两个模型处理的是同一批任务,因此我们用精确 McNemar 检验比较结果。这是一种针对两个模型结果不同的任务所做的配对检验;同时使用 Holm 校正,在进行多项比较时收紧显著性门槛。只有通过校正的差距,我们才称为差异。
GPT-6 Luna 写得比 GPT-5.6 Luna 少吗?
在默认推理强度下,仅给出目标时,GPT-6 Luna 的词数是 GPT-5.6 Luna 的 0.55 倍:每篇平均 384 词,对比 703 词;80 项任务中每一项都更短。所有文档类型都是如此,事故复盘差距最大(441 词对 981 词),客户回复差距最小(576 词对 767 词)。
列明必需部分后,差距消失:738 词对 724 词。
默认写得更短并非 Luna 独有。在同一批任务中,GPT-6 Sol 写了 325 词,GPT-5.6 Sol 写了 592 词;GPT-6.1 Sol 则回升到 565 词。
GPT-6 Luna 会遗漏内容吗?
仅给出目标时,GPT-6 Luna 比 GPT-5.6 Luna 更常遗漏的只有一项:事故复盘中的持续时间。它通常会给出时间窗口(如“事故时间:18:00-18:39 UTC”),但让读者自己计算时长。其他内容在所有推理强度下都齐全:每个地区及表现最差的地区、每个事件,以及对每张工单按姓名称呼客户的回复;只有在 none 下出现一次例外。
| 仅给出目标的 prompt | GPT-6 Luna 完整文档数 | GPT-6 Luna 未写持续时间的事故复盘数 | GPT-5.6 Luna 完整文档数 | GPT-5.6 Luna 未写持续时间的事故复盘数 |
|---|---|---|---|---|
none | 44 / 60 | 15 / 20 | 57 / 60 | 3 / 20 |
low | 47 / 60 | 13 / 20 | 54 / 60 | 6 / 20 |
medium | 51 / 60 | 9 / 20 | 58 / 60 | 2 / 20 |
high | 53 / 60 | 7 / 20 | 57 / 60 | 3 / 20 |
max | 59 / 60 | 1 / 20 | 60 / 60 | 0 / 20 |
none 下的差距(44 对 57)通过了校正。medium 下的差距(51 对 58)只在校正前显著,因此只能看作一种趋势;max 下两者持平。所有差距都来自同一种文档,说明 GPT-6 Luna 在事故复盘中会跳过一项需要计算得出的数字,而不是普遍遗漏内容。
列明必需部分后,GPT-6 Luna 在 80 篇文档中有 74 篇完整,GPT-5.6 Luna 有 69 篇,差异不显著。两个模型未达标的文档,都是备忘录或影响段落低于要求的词数范围:GPT-6 Luna 有 6 篇,GPT-5.6 Luna 有 11 篇。
怎样让篇幅和细节恢复?
在 prompt 中列明必需部分有效,两个请求参数则无效。推理强度不变时,只要 prompt 明确要求,GPT-6 Luna 的篇幅就从 384 词增加到 738 词,而且每篇事故复盘都会写出持续时间。像这样写就够了:
Write the postmortem with these sections: Timeline (a table with every event),
Impact (120-200 words, state the total duration in minutes), Root Cause,
Action Items (5, each ending "Owner: <team>"), Lessons Learned (at least 3 bullets).
text.verbosity 是 Responses API 中控制可见回答长度和详细程度的参数(low、medium、high)。设为 high 后,GPT-6 Luna 仅给出目标时的文档长了 7%(410 词),但完整文档数基本不变,为 60 篇中的 52 篇,对比原来的 51 篇。
提高 reasoning.effort 对模型思考量的影响大于对篇幅的影响。从 none 提高到 max,GPT-6 Luna 的文档从 370 词增至 436 词,而每次回答的推理 token 从 0 增至 4,192 个。max 确实补回了持续时间(20 篇中只有 1 篇遗漏),但成本是 medium 的 4.5 倍。
使用 OpenAI Python SDK 设置这两个参数:
from openai import OpenAI
client = OpenAI()
prompt = "Write the postmortem with these sections: ..." # data and required parts
resp = client.responses.create(
model="gpt-6-luna",
reasoning={"effort": "medium"}, # none, low, medium (default), high, xhigh, max
text={"verbosity": "high"}, # 7% longer in our runs; did not change completeness
input=prompt,
)
print(resp.output_text)
usage = resp.usage
print(usage.output_tokens, usage.output_tokens_details.reasoning_tokens)
output_tokens 包含推理 token,因此用它减去推理 token 数,才是可见回答的 token 数。
GPT-6 Luna 比 GPT-5.6 Luna 省多少钱?
对于同一篇文档,GPT-6 Luna 比 GPT-5.6 Luna 便宜 49%:列明必需部分时,每 1,000 篇分别为 $0.81 和 $1.61。如果只考虑降价,节省比例还会更高。把 GPT-5.6 Luna 的 token 用 GPT-6 Luna 的价格重新计算,成本为 $0.68,低 58%;GPT-6 Luna 的实际回答成本比这个数高 20%,因为它使用的推理 token 是两倍(每次回答 537 个,对比 271 个),总输出也从 1,284 个 token 增至 1,558 个。
仅给出目标时,账面成本更低,每 1,000 篇为 $0.54 对 $1.66(低 68%)。但多省下的钱主要来自 GPT-6 Luna 只写了一半;只有另一半内容确实不需要,这才算节省。
速度大致相同。按整次请求耗时计算,GPT-6 Luna 每秒生成 115 个输出 token,GPT-5.6 Luna 为 125 个。仅给出目标的文档,中位耗时分别为 8.1 秒和 11.1 秒,因为前者写得更少。
我们的结果与其他公开测试一致吗?
在可对比的部分,我们的结果与公开基准测试一致;另外还测出了哪里更短、遗漏了什么,以及如何补回。
| 问题 | 其他公开测试 | 我们的测量结果 | 结论 |
|---|---|---|---|
| 通用能力:GPT-6 Luna 对比 GPT-5.6 Luna | Artificial Analysis:38 对 37;Vals:51.2% 对 51.7% | 列明必需部分后,80 篇中分别有 74 篇和 69 篇完整,差异不显著 | 一致:表现接近 |
| 文档质量 | GDPval-AA v2.1 Elo:max 下低 25 分,medium 下高 129 分 | medium 下,仅给出目标时词数为 0.55 倍;20 篇事故复盘中分别有 9 篇和 2 篇未写持续时间 | 结果不完全一致:两者都未显示默认推理强度下有明确的质量下降;我们的测试指出了默认篇幅变短,以及因此遗漏的一项内容 |
| 输出 token | max 下,每项 Index 任务为 51K 对 41K,多 24% | medium 下,每篇文档为 1,558 对 1,284,多 21% | 一致 |
| 成本 | 每项 Index 任务低 61%;每项 Vals 测试低 48% | 列明必需部分时低 49%,仅给出目标时低 68% | 一致 |
我们观察到什么,该选哪个模型?
如果你能控制 prompt,就用 GPT-6 Luna,并明确列出需要的部分。只有在 prompt 无法修改、读者又期望长文档时,才保留 GPT-5.6 Luna。依据有三点:
- GPT-6 Luna 会按要求控制篇幅。只给目标,它写短文档;列出必需部分,它就写出与 GPT-5.6 Luna 篇幅相当的完整文档。
- 遗漏范围很窄。四种文档中,唯一更常缺少的预期内容是事故持续时间。
- 成本节省来自降价。对于同一篇文档,它多用 21% 的输出 token,因此实际省下的 49%,低于单看标价可省的 58%。
| 工作负载 | 选择 | 数据依据 |
|---|---|---|
| 程序读取的输出:分类、提取、路由 | GPT-6 Luna,使用准确率允许的最低推理强度 | 输入和输出标价分别低 50% 和 58%;由程序读取时,回答篇幅不重要 |
| 由模板或你编写的 prompt 生成文档 | GPT-6 Luna,在 prompt 中列明章节、数量和篇幅 | 80 篇中分别有 74 篇和 69 篇完整;每 1,000 篇为 $0.81 对 $1.61 |
| 由无法修改的终端用户 prompt 生成文档 | 如果能在请求中补上预期部分,就用 GPT-6 Luna;否则用 GPT-5.6 Luna | 仅给出目标时:384 词对 703 词;20 篇事故复盘中分别有 9 篇和 2 篇未写持续时间 |
| 按评分清单评估的交付文档 | 把评分清单写进 prompt,不要依赖 text.verbosity | 详略程度设为 high:完整文档数为 60 篇中的 52 篇,对比原来的 51 篇;词数多 7% |
无论用哪个模型,发给客户前都应在代码中检查必需内容是否齐全。
常见问题
GPT-6 Luna 比 GPT-5.6 Luna 差吗? prompt 列明必需部分时,GPT-6 Luna 和 GPT-5.6 Luna 的文档完整度相当(80 篇中分别为 74 篇和 69 篇,差异不显著),成本则约为一半。prompt 只给目标时,它写的词数约为后者的一半,事故复盘也更常遗漏持续时间。
text.verbosity: "high" 能让 GPT-6 Luna 写得和 GPT-5.6 Luna 一样多吗?
在我们的测试中,text.verbosity: "high" 让 GPT-6 Luna 多写了 7%,篇幅仍只有 GPT-5.6 Luna 的约 58%,完整度也没有变化。在 prompt 中列明必需部分,才能让篇幅达到相同水平。
GPT-6.1 修复了 GPT-6 Luna 回答过短的问题吗? OpenAI 的 6.1 更新只覆盖 Sol 档:GPT-6.1 Sol 的篇幅重新达到 GPT-5.6 Sol 的水平;GPT-6 Luna 自 2026-09-22 发布以来没有变化。
相关测试:GPT-6.1 Sol 与 Claude Sonnet 5.5 对比、flash 档 LLM 对比和 GPT-5.6 成本优化方法。