新人 免费注册,送 10 次调用,最高 $1,无需绑卡。

GPT-6 Luna 对比 GPT-5.6 Luna:价格减半,篇幅也减半

目录
  1. GPT-6 Luna 与 GPT-5.6 Luna 的基准测试成绩如何?
  2. 除价格外,还有哪些变化?
  3. 我们如何测试?
  4. GPT-6 Luna 写得比 GPT-5.6 Luna 少吗?
  5. GPT-6 Luna 会遗漏内容吗?
  6. 怎样让篇幅和细节恢复?
  7. GPT-6 Luna 比 GPT-5.6 Luna 省多少钱?
  8. 我们的结果与其他公开测试一致吗?
  9. 我们观察到什么,该选哪个模型?
  10. 常见问题

GPT-6 Luna 与 GPT-5.6 Luna 在公开基准测试中的表现接近(Artificial Analysis Intelligence Index 得分分别为 38 和 37),但每项任务的成本约为后者的一半。区别在于生成内容:当 prompt 只给出目标(如“撰写 Q3 回顾”)时,在 80 篇业务文档中,GPT-6 Luna 写出的词数是 GPT-5.6 Luna 的 0.55 倍。明确要求的部分并没有被跳过。列明必需部分后,两者的文档完整度相当;仅给出目标时,GPT-6 Luna 更常遗漏的细节只有事故持续时间。

TL;DR

  • 在 max 推理强度下,Artificial Analysis 给 GPT-6 Luna 和 GPT-5.6 Luna 的评分分别为 38 和 37,每项任务成本分别为 $0.07 和 $0.18。
  • 仅给出目标时,GPT-6 Luna 每篇文档平均写 384 词,GPT-5.6 Luna 为 703 词。
  • 仅给出目标的 20 篇事故复盘中,GPT-6 Luna 有 9 篇未写事故持续时间,GPT-5.6 Luna 有 2 篇。
  • 列明必需部分后,GPT-6 Luna 在 80 篇文档中有 74 篇完整,GPT-5.6 Luna 有 69 篇;每 1,000 篇成本分别为 $0.81 和 $1.61。

GPT-6 Luna 与 GPT-5.6 Luna 的基准测试成绩如何?

GPT-6 Luna 在通用基准测试中与 GPT-5.6 Luna 表现接近,每项任务成本低 48% 至 61%。两者的差异只出现在按评分清单评估文档的测试中。下表分数均对应特定的推理强度,即 API 中控制模型回答前推理量的设置(从 none 到 max,默认 medium)。数据取自发布方截至 2026-10-02 的页面。

GPT-6 LunaGPT-5.6 Luna
发布日期2026-09-222026-07-09
标价,每 1M token 的输入 / 输出价格$0.10 / $0.50$0.20 / $1.20
Artificial Analysis Intelligence Index v4.3.2,max 推理强度(10 项评测,涵盖知识、推理、编程、Agent 任务和业务文档任务)3837
Index 每项任务成本$0.07$0.18
Vals Index(编程、法律、税务、金融及其他专业任务)51.2%51.7%
Vals 每项测试成本$0.43$0.82
GDPval-AA v2.1,max 推理强度下的 Elo(按未公开的评分清单评估业务文档;Elo 来自两两对比,越高越好)14381463
GDPval-AA v2.1,medium 推理强度下的 Elo12621133
输出速度,每秒 token 数131124

关于 GPT-6 Luna 的争议始于 GDPval-AA。Artificial Analysis 的发布分析指出,GPT-6 Luna 在 GDPval-AA 上比 GPT-5.6 Luna 低约 75 个 Elo 点,在另一项文档基准测试 AA-Briefcase v1.1 上低约 45 个 Elo 点,并将原因归为“呈现质量下降,以及交付文档遗漏评分项”;评测人员称之为“格式税”。目前排行榜上,max 推理强度下的差距是 25 分,而在 medium 下,GPT-6 Luna 领先 129 分。

与其他厂商的模型相比,GPT-6 Luna 面向的是 flash 档,也就是低价、高速模型。在同一 Index 上,DeepSeek V4.1 Flash 使用 max 时得 39 分,每项任务成本 $0.27;Gemini 3.8 Flash 使用 high 时得 41 分,每项任务成本 $1.24。GPT-6 Luna 少 1 至 3 分,但每项任务成本只有它们的 1/4 到 1/18。后两者生成速度更快,分别为每秒 209 和 249 个 token。

除价格外,还有哪些变化?

GPT-6 Luna 沿用 GPT-5.6 Luna 的限制和设置;变化的只有缓存价格和知识截止日期。两者的上下文窗口都是 1,050,000 个 token,输出上限都是 128,000 个 token。prompt 超过 272K 个 token 后,整次请求的输入按 2 倍、输出按 1.5 倍计费。缓存输入价格从每百万 token $0.02 降至 $0.01,知识截止日期从 2026 年 2 月 16 日推至 2026 年 5 月 18 日。在 Responses API 中,可通过 reasoning.effort 设置推理强度(none、low、medium、high、xhigh、max);推理内容不可见,但按输出 token 计费。

发布一周后,OpenAI 推出 GPT-6.1 Sol,接替更高档位的 GPT-6 Sol;我们对 GPT-6.1 Sol 的测试发现,其回答长度回到了之前的水平。Luna 没有更新,因此我们测了 GPT-6 Luna 哪些内容写得更短、遗漏了什么,以及怎样让这些内容重新出现。

我们如何测试?

我们设计了能用代码检查要求是否满足的文档任务,不使用评判模型。每项任务都给模型一组模拟数据,要求据此撰写文档:

文档数据读者期望看到的内容
季度回顾6 至 12 个地区的营收数据覆盖每个地区,指出降幅最大的地区
事故复盘7 至 10 个带时间戳的事件写出每个事件和事故持续时间
供应商对比5 至 8 份托管服务报价覆盖每家供应商
客户回复6 至 14 张支持工单回复每张工单,并称呼客户姓名

每项任务都基于同一组数据使用两种 prompt。仅给出目标 的 prompt 只说明要写什么文档,不指定组成部分(如“为管理团队撰写 Q3 地区回顾”),只按表中项目评分。列明必需部分 的 prompt 会列出章节、数量和词数范围,并按所有要求评分。只要没有缺少必需内容、篇幅不足或数量不足,文档就算完整。仅给出目标的供应商对比只统计篇幅,因为哪家供应商最合适需要主观判断。

2026-10-02,我们让两个模型在五档推理强度下分别处理 80 个仅给出目标的任务,并让 GPT-6 Luna 额外在一档详略程度设置下处理这些任务;两个模型还在默认推理强度下分别处理 80 个列明必需部分的任务,共调用 Responses API 1,040 次。每条 prompt 都带有唯一的随机字符串,避免从缓存取得响应;成本按 OpenAI 标价计算。两个模型处理的是同一批任务,因此我们用精确 McNemar 检验比较结果。这是一种针对两个模型结果不同的任务所做的配对检验;同时使用 Holm 校正,在进行多项比较时收紧显著性门槛。只有通过校正的差距,我们才称为差异。

GPT-6 Luna 写得比 GPT-5.6 Luna 少吗?

在默认推理强度下,仅给出目标时,GPT-6 Luna 的词数是 GPT-5.6 Luna 的 0.55 倍:每篇平均 384 词,对比 703 词;80 项任务中每一项都更短。所有文档类型都是如此,事故复盘差距最大(441 词对 981 词),客户回复差距最小(576 词对 767 词)。

列明必需部分后,差距消失:738 词对 724 词。

横向条形图,对比 GPT-6 Luna 和 GPT-5.6 Luna 每次回答的词数。仅给出目标时,不同推理强度下 GPT-6 Luna 写 365 至 436 词,GPT-5.6 Luna 写 656 至 727 词;在 medium 下分别为 384 词和 703 词,60 篇中分别有 51 篇和 58 篇完整。列明必需部分后,分别为 738 词和 724 词,80 篇中分别有 74 篇和 69 篇完整

默认写得更短并非 Luna 独有。在同一批任务中,GPT-6 Sol 写了 325 词,GPT-5.6 Sol 写了 592 词;GPT-6.1 Sol 则回升到 565 词。

GPT-6 Luna 会遗漏内容吗?

仅给出目标时,GPT-6 Luna 比 GPT-5.6 Luna 更常遗漏的只有一项:事故复盘中的持续时间。它通常会给出时间窗口(如“事故时间:18:00-18:39 UTC”),但让读者自己计算时长。其他内容在所有推理强度下都齐全:每个地区及表现最差的地区、每个事件,以及对每张工单按姓名称呼客户的回复;只有在 none 下出现一次例外。

仅给出目标的 promptGPT-6 Luna 完整文档数GPT-6 Luna 未写持续时间的事故复盘数GPT-5.6 Luna 完整文档数GPT-5.6 Luna 未写持续时间的事故复盘数
none44 / 6015 / 2057 / 603 / 20
low47 / 6013 / 2054 / 606 / 20
medium51 / 609 / 2058 / 602 / 20
high53 / 607 / 2057 / 603 / 20
max59 / 601 / 2060 / 600 / 20

none 下的差距(44 对 57)通过了校正。medium 下的差距(51 对 58)只在校正前显著,因此只能看作一种趋势;max 下两者持平。所有差距都来自同一种文档,说明 GPT-6 Luna 在事故复盘中会跳过一项需要计算得出的数字,而不是普遍遗漏内容。

列明必需部分后,GPT-6 Luna 在 80 篇文档中有 74 篇完整,GPT-5.6 Luna 有 69 篇,差异不显著。两个模型未达标的文档,都是备忘录或影响段落低于要求的词数范围:GPT-6 Luna 有 6 篇,GPT-5.6 Luna 有 11 篇。

怎样让篇幅和细节恢复?

在 prompt 中列明必需部分有效,两个请求参数则无效。推理强度不变时,只要 prompt 明确要求,GPT-6 Luna 的篇幅就从 384 词增加到 738 词,而且每篇事故复盘都会写出持续时间。像这样写就够了:

Write the postmortem with these sections: Timeline (a table with every event),
Impact (120-200 words, state the total duration in minutes), Root Cause,
Action Items (5, each ending "Owner: <team>"), Lessons Learned (at least 3 bullets).

text.verbosity 是 Responses API 中控制可见回答长度和详细程度的参数(low、medium、high)。设为 high 后,GPT-6 Luna 仅给出目标时的文档长了 7%(410 词),但完整文档数基本不变,为 60 篇中的 52 篇,对比原来的 51 篇。

提高 reasoning.effort 对模型思考量的影响大于对篇幅的影响。从 none 提高到 max,GPT-6 Luna 的文档从 370 词增至 436 词,而每次回答的推理 token 从 0 增至 4,192 个。max 确实补回了持续时间(20 篇中只有 1 篇遗漏),但成本是 medium 的 4.5 倍。

使用 OpenAI Python SDK 设置这两个参数:

from openai import OpenAI

client = OpenAI()
prompt = "Write the postmortem with these sections: ..."  # data and required parts
resp = client.responses.create(
    model="gpt-6-luna",
    reasoning={"effort": "medium"},   # none, low, medium (default), high, xhigh, max
    text={"verbosity": "high"},       # 7% longer in our runs; did not change completeness
    input=prompt,
)
print(resp.output_text)
usage = resp.usage
print(usage.output_tokens, usage.output_tokens_details.reasoning_tokens)

output_tokens 包含推理 token,因此用它减去推理 token 数,才是可见回答的 token 数。

GPT-6 Luna 比 GPT-5.6 Luna 省多少钱?

对于同一篇文档,GPT-6 Luna 比 GPT-5.6 Luna 便宜 49%:列明必需部分时,每 1,000 篇分别为 $0.81 和 $1.61。如果只考虑降价,节省比例还会更高。把 GPT-5.6 Luna 的 token 用 GPT-6 Luna 的价格重新计算,成本为 $0.68,低 58%;GPT-6 Luna 的实际回答成本比这个数高 20%,因为它使用的推理 token 是两倍(每次回答 537 个,对比 271 个),总输出也从 1,284 个 token 增至 1,558 个。

仅给出目标时,账面成本更低,每 1,000 篇为 $0.54 对 $1.66(低 68%)。但多省下的钱主要来自 GPT-6 Luna 只写了一半;只有另一半内容确实不需要,这才算节省。

速度大致相同。按整次请求耗时计算,GPT-6 Luna 每秒生成 115 个输出 token,GPT-5.6 Luna 为 125 个。仅给出目标的文档,中位耗时分别为 8.1 秒和 11.1 秒,因为前者写得更少。

我们的结果与其他公开测试一致吗?

在可对比的部分,我们的结果与公开基准测试一致;另外还测出了哪里更短、遗漏了什么,以及如何补回。

问题其他公开测试我们的测量结果结论
通用能力:GPT-6 Luna 对比 GPT-5.6 LunaArtificial Analysis:38 对 37;Vals:51.2% 对 51.7%列明必需部分后,80 篇中分别有 74 篇和 69 篇完整,差异不显著一致:表现接近
文档质量GDPval-AA v2.1 Elo:max 下低 25 分,medium 下高 129 分medium 下,仅给出目标时词数为 0.55 倍;20 篇事故复盘中分别有 9 篇和 2 篇未写持续时间结果不完全一致:两者都未显示默认推理强度下有明确的质量下降;我们的测试指出了默认篇幅变短,以及因此遗漏的一项内容
输出 tokenmax 下,每项 Index 任务为 51K 对 41K,多 24%medium 下,每篇文档为 1,558 对 1,284,多 21%一致
成本每项 Index 任务低 61%;每项 Vals 测试低 48%列明必需部分时低 49%,仅给出目标时低 68%一致

我们观察到什么,该选哪个模型?

如果你能控制 prompt,就用 GPT-6 Luna,并明确列出需要的部分。只有在 prompt 无法修改、读者又期望长文档时,才保留 GPT-5.6 Luna。依据有三点:

  1. GPT-6 Luna 会按要求控制篇幅。只给目标,它写短文档;列出必需部分,它就写出与 GPT-5.6 Luna 篇幅相当的完整文档。
  2. 遗漏范围很窄。四种文档中,唯一更常缺少的预期内容是事故持续时间。
  3. 成本节省来自降价。对于同一篇文档,它多用 21% 的输出 token,因此实际省下的 49%,低于单看标价可省的 58%。
工作负载选择数据依据
程序读取的输出:分类、提取、路由GPT-6 Luna,使用准确率允许的最低推理强度输入和输出标价分别低 50% 和 58%;由程序读取时,回答篇幅不重要
由模板或你编写的 prompt 生成文档GPT-6 Luna,在 prompt 中列明章节、数量和篇幅80 篇中分别有 74 篇和 69 篇完整;每 1,000 篇为 $0.81 对 $1.61
由无法修改的终端用户 prompt 生成文档如果能在请求中补上预期部分,就用 GPT-6 Luna;否则用 GPT-5.6 Luna仅给出目标时:384 词对 703 词;20 篇事故复盘中分别有 9 篇和 2 篇未写持续时间
按评分清单评估的交付文档把评分清单写进 prompt,不要依赖 text.verbosity详略程度设为 high:完整文档数为 60 篇中的 52 篇,对比原来的 51 篇;词数多 7%

无论用哪个模型,发给客户前都应在代码中检查必需内容是否齐全。

常见问题

GPT-6 Luna 比 GPT-5.6 Luna 差吗? prompt 列明必需部分时,GPT-6 Luna 和 GPT-5.6 Luna 的文档完整度相当(80 篇中分别为 74 篇和 69 篇,差异不显著),成本则约为一半。prompt 只给目标时,它写的词数约为后者的一半,事故复盘也更常遗漏持续时间。

text.verbosity: "high" 能让 GPT-6 Luna 写得和 GPT-5.6 Luna 一样多吗? 在我们的测试中,text.verbosity: "high" 让 GPT-6 Luna 多写了 7%,篇幅仍只有 GPT-5.6 Luna 的约 58%,完整度也没有变化。在 prompt 中列明必需部分,才能让篇幅达到相同水平。

GPT-6.1 修复了 GPT-6 Luna 回答过短的问题吗? OpenAI 的 6.1 更新只覆盖 Sol 档:GPT-6.1 Sol 的篇幅重新达到 GPT-5.6 Sol 的水平;GPT-6 Luna 自 2026-09-22 发布以来没有变化。

相关测试:GPT-6.1 Sol 与 Claude Sonnet 5.5 对比、flash 档 LLM 对比和 GPT-5.6 成本优化方法。

← 返回博客