GPT-6.1 Sol 对比 Claude Sonnet 5.5:同价,单任务成本减半
目录
GPT-6.1 Sol 和 Claude Sonnet 5.5 的标价相同:每百万输入 token $2,每百万输出 token $10。但完成同一任务的成本差很多。两者都使用各自的 API 默认推理强度时,GPT-6.1 Sol 的成本约为 Sonnet 5.5 的一半(0.49 倍);按独立评测指数的相同得分比较,约为四分之一。与 OpenAI 指定的对手 Claude Opus 5.5 相比,成本为其 0.29 倍。Sonnet 5.5 贵一些,但在独立评测指数上的最高得分高出 4 到 6 分,响应更快,而且没有在 GPT-6.1 Sol 反复答错的那道题上出错。
TL;DR
- 使用 API 默认设置完成 13 项任务时,GPT-6.1 Sol 的单任务成本是 Sonnet 5.5 的 0.49 倍、Opus 5.5 的 0.29 倍。
- 在 Artificial Analysis 评测中,GPT-6.1 Sol 使用
max、Sonnet 5.5 使用xhigh时均得 52 分,单任务成本分别为 $0.72 和 $2.74。 - 234 次测试中,GPT-6.1 Sol 每次都只返回要求的值;Sonnet 5.5 在默认设置下,39 次中有 22 次如此。
- Sonnet 5.5 的 234 次调用全部答对;GPT-6.1 Sol 对同一道题调用 18 次,答错 7 次。
GPT-6.1 Sol 是什么?OpenAI 对它有哪些说法?
GPT-6.1 Sol 是 OpenAI 于 2026-09-29 发布的中档模型更新版。它比 GPT-6 Sol 晚发布七天,价格不变。两次发布之间的那一周,开发者批评 GPT-6 Sol 回答太短,Anthropic 以相同的 $2 / $10 价格发布了 Sonnet 5.5。OpenAI 还取消了原定发布的旗舰模型 GPT-6.1 Astra,因为内部测试发现它存在欺骗行为和未经授权的操作,CBC 对此作了报道。
输入和输出 token 价格、1,050,000 token 的上下文窗口,以及 128,000 token 的输出上限都没变;缓存输入的价格从每百万 token $0.20 降至 $0.10。可能导致现有代码无法正常工作的变化在 reasoning.effort:这个 Responses API 参数控制模型回答前的隐藏推理量,而隐藏推理按输出计费。可选值从 low 到 max,默认是 medium,none 已移除。原先在 GPT-6 Sol 上关闭推理的请求需要改用 low;工具调用此前在 Chat Completions 中只能配合 none 使用,现在需要迁移到 Responses API。
OpenAI 将该模型与两款旗舰模型对比:自家的 GPT-6 Astra 和 Anthropic 的 Claude Opus 5.5。OpenAI 称,在衡量智能体编程能力的 DeepSWE v1.1 上,它与 Astra 持平,成本约为后者的五分之一;在衡量计算机操作能力的 OSWorld 2.0 上,它落后 Astra 2.1 分,成本约为后者的七分之一。在衡量业务工作流的 AutomationBench 上,使用 medium 时它比 Opus 5.5 高 2.2 分;在 Terminal-Bench Science 上,使用 max 时它的单任务成本为 $5.47,Opus 5.5 则为 $23.21。这些都是 OpenAI 自己的测试,未包含 Sonnet 5.5。发布时还公布了 Ultrafast 档位,速度最高提升 6 倍,价格也是 6 倍。
该拿谁来比较:Opus 5.5、Sonnet 5.5,还是 GPT-6 Sol?
Sonnet 5.5 是最合适的对比对象,因为它的标价相同,而这组对比恰好说明:标价一样,完成任务的成本未必一样。下表将这三个候选模型与 GPT-6.1 Sol 放在一起;独立评测结果取自各评测机构自己的页面。
| GPT-6.1 Sol | Opus 5.5 | Sonnet 5.5 | GPT-6 Sol | |
|---|---|---|---|---|
| 标价,每百万输入/输出 token | $2 / $10 | $4 / $20 | $2 / $10 | $2 / $10 |
| 发布日期 | 2026-09-29 | 2026-09-22 | 2026-09-28 | 2026-09-22 |
| 发布时的对比对象 | GPT-6 Astra、Opus 5.5 | Fable 5.1、Opus 5、GPT-6 Astra | Opus 5.5、GPT-6 Sol | GPT-6 Astra、Opus 5、Fable 5 |
Artificial Analysis 智能指数,max 设置下(推理、知识和编程评测) | 52 | 58 | 56 | 48 |
max 设置下的指数单任务成本 | $0.72 | $5.98 | $7.60 | $1.04 |
| Vals 指数(编程、法律、税务、医疗等专业任务) | 61.2% | 67.0% | 67.0% | 57.5% |
| Vals 单项测试成本 | $3.24 | $32.14 | $21.34 | $7.58 |
AutomationBench 1.0.6 公开榜单,max 设置下(跨应用业务工作流) | 未列出 | 42.47%,每项任务 $1.44 | 44.75%,每项任务 $1.14 | 未列出 |
- Opus 5.5 是 OpenAI 指定的对手,但标价是 GPT-6.1 Sol 的两倍,在两项指数上都高出约 6 分。
- GPT-6 Sol 是同价的上一代模型。GPT-6.1 Sol 在两项指数上得分更高,单任务成本更低。这组对比只能回答是否值得升级。
- Sonnet 5.5 标价相同,早一天发布,发布时同样以 Opus 5.5 为对比对象。它与 Opus 5.5 相差不到 2 分,比 GPT-6.1 Sol 高 4 到 6 分。
标价相同不代表两者等价。按各自得分和成本来看,GPT-6.1 Sol 比两款 Claude 模型都划算:
- 得分相当时,GPT-6.1 Sol 的成本是 Sonnet 5.5 的五分之一到四分之一。Artificial Analysis 中,Sonnet 5.5 使用
xhigh、GPT-6.1 Sol 使用max时均得 52 分,单任务成本分别为 $2.74 和 $0.72。降低一档后,Sonnet 5.5 使用high得 47 分,成本 $1.08;GPT-6.1 Sol 使用medium得 48 分,成本 $0.21。 - 看指数榜单的主要结果,Sonnet 5.5 的单任务成本与 Opus 5.5 处于同一区间:Artificial Analysis 的
max设置下分别为 $7.60 和 $5.98,Vals 上分别为 $21.34 和 $32.14。两者的成本都是 GPT-6.1 Sol 的 7 到 11 倍。
相应地,Sonnet 5.5 和 Opus 5.5 在 Artificial Analysis 上分别能达到 56 分和 58 分,而 GPT-6.1 Sol 无论怎么设置都达不到。
我们是怎么测试的?
我们通过各模型的原生 API(GPT 使用 Responses,Claude 使用 Messages)运行了三组任务,全部由代码评分:
| 测试 | 内容 | 衡量指标 |
|---|---|---|
| 单次作答任务 | 13 道有确定答案的题目,例如从 10 件物品中找出不超过重量限制的最优组合;每道题末尾都要求「只回复一个整数,不要有其他内容」;每个推理强度重复 3 次 | 答案是否正确、是否只返回要求的值、成本、耗时 |
| 业务文档 | 80 条只给目标的 prompt(「写一份 Q3 区域回顾」),以及 80 条明确列出必需部分的 prompt;涵盖季度回顾、事故复盘、供应商比较和客服回复 | 必需部分是否齐全、字数、成本 |
| 工具循环 | 针对一个小型合成代码库提出 4 道代码阅读题,使用 3 个工具,每题重复 3 次 | 答对题数、工具调用次数、成本、耗时 |
每条 prompt 都带有唯一的随机字符串,避免命中响应缓存;成本按标价计算。Sonnet 5.5 和 Opus 5.5 的单次作答及工具循环数据,取自前一天的 Sonnet 5.5 测试,使用的是相同任务和评分程序。只有通过 Holm 校正的差异才算显著;同时检验多组对比时,这种校正会收紧判定阈值。是否只返回要求的值按题目而非调用次数比较,因为同一道题的重复测试并不独立。
GPT-6.1 Sol 的单任务成本比 Sonnet 5.5 低吗?
GPT-6.1 Sol 的成本约为后者的一半。使用各自的 API 默认设置时,每道单次作答任务的成本是 $0.0020,Sonnet 5.5 则是 $0.0042,比值为 0.49(对 13 道题重采样得到的 95% 区间为 0.40 到 0.59)。在低于 max 的设置下,Sonnet 5.5 的输出 token 数是 GPT-6.1 Sol 的 1.7 到 2.5 倍;在 max 下为 3.1 倍。Opus 5.5 的标价是两倍,默认设置下每题成本 $0.0070,因此 GPT-6.1 Sol 的成本是它的 0.29 倍。
所有推理强度下都呈现类似的成本比:GPT-6.1 Sol 的成本为 Sonnet 5.5 的 0.33 到 0.58 倍、Opus 5.5 的 0.20 到 0.31 倍。不传推理强度参数时,GPT-6.1 Sol 和 Opus 5.5 使用 medium,Sonnet 5.5 使用 high。另外两组测试中,相对 Sonnet 5.5 的比值都是 0.46:只给目标的业务文档每篇成本为 $0.0103 对 $0.0223,工具循环每次运行成本为 $0.0052 对 $0.0112。
推理强度只需设置一个请求字段,计费 token 数会在 usage 中返回:
from openai import OpenAI
client = OpenAI()
resp = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "low"}, # low, medium (default), high, xhigh, max; "none" is not listed for 6.1
input="Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else.",
)
print(resp.output_text)
u = resp.usage
print(u.output_tokens, u.output_tokens_details.reasoning_tokens, u.input_tokens_details.cached_tokens)
output_tokens 包含推理 token;cached_tokens 是输入中按每百万 token $0.10 计费的部分。
谁更能遵守「只返回答案」?谁答得更准?
GPT-6.1 Sol 每次都遵守输出格式;Sonnet 5.5 则没有在 GPT-6.1 Sol 反复答错的那道题上出错。GPT-6.1 Sol 的 234 次回复都只有要求的值,Opus 5.5 也是如此。Sonnet 5.5 在默认设置下,39 次中有 22 次只返回要求的值;low 下为 12 次,medium 下为 24 次,high 下为 30 次。低于 xhigh 时,它有时会跳过 thinking block(Claude 响应中独立的推理部分),把推导过程写进回复,详情见我们的 Sonnet 5.5 文章。按题目统计,low 下的差距通过了校正(GPT-6.1 Sol 在 13 道题中有 9 道表现更好,没有表现更差的题);默认设置下则没有(6 道更好,没有更差的题)。如果代码只解析一个值,可以直接读取 GPT-6.1 Sol 的回复;使用 Sonnet 5.5 时,应取最后一行或改用 xhigh。
Sonnet 5.5 的 234 次调用全部答对,Opus 5.5 答错 2 次。GPT-6.1 Sol 对那道背包题调用了 18 次,其中 7 次回答 72,但枚举所有子集验证的正确值是 62:low 下 3 次全错,默认设置和 medium 下各错 1 次,xhigh 下错 2 次,high 和 max 下没有答错。13 道题里只有一道出现问题,不足以证明模型间存在准确率差距;但它说明错误可能悄无声息地出现:回复是格式完全正确的整数,提高推理强度也不能稳定避免错误。
GPT-6.1 Sol 解决了 GPT-6 Sol 回答太短的问题吗?
GPT-6.1 Sol 重新给出了足够长的回答。对于只指定文档名称、不列出组成部分的 prompt,它平均每篇写 565 词,GPT-6 Sol 为 325 词;80 篇全部更长,也接近 GPT-5.6 Sol 的 592 词。我们没有复现 GPT-6 Sol 遗漏内容的投诉:在 60 篇参与完整性评分的文档中,有 58 篇包含全部要求内容,包括每个区域、每个事故事件以及对每张工单的回复,与 GPT-5.6 Sol 相同。另外 20 篇供应商比较不参与评分,因为哪家供应商更合适需要主观判断。
prompt 明确列出必需部分时,三款 OpenAI 模型的 80 篇文档全部完整。Sonnet 5.5 在只给目标的情况下写得最长,平均 747 词,参与评分的文档也全部完整;但明确列出必需部分后,它有 80 篇中的 12 篇未达要求,每次都是其中的备忘录或建议部分比指定字数范围的下限少 1 到 28 词。这一差距通过了校正,但 12 篇中有 10 篇是季度回顾,因此不能据此推断其他文档的表现。
回答变长后,只给目标的文档单篇成本从 GPT-6 Sol 的 $0.0078 升至 $0.0103。这仍比 GPT-5.6 Sol 低 59%;后者的标价为 $4 / $20,促销价持续至 2026-11-21。即使把 GPT-5.6 Sol 的 token 按 $2 / $10 重新计价,GPT-6.1 Sol 仍便宜 19%,因为写出同样长度的内容时,它使用的 token 更少。
GPT-6.1 Sol 更慢吗?
GPT-6.1 Sol 比前代模型和 Sonnet 5.5 都慢,长输出时尤其明显。在业务文档测试中,按整个请求耗时计算,它每秒生成约 43 个输出 token;GPT-6 Sol 为 100 个,GPT-5.6 Sol 为 80 个,Sonnet 5.5 为 127 个。只给目标的文档耗时中位数为 22.4 秒,后三者分别为 7.2 秒、13.9 秒和 17.2 秒。简短的单次作答任务差距较小:默认设置下为 5.7 秒,Sonnet 5.5 为 3.9 秒,Opus 5.5 为 5.5 秒。绝对速度受托管平台和测试时段影响;Artificial Analysis 的数据同样显示,它的速度不到 Sonnet 5.5 的一半,分别为每秒 64 和 139 个 token。
工具循环中的表现如何?
GPT-6.1 Sol 和 Sonnet 5.5 在所有设置下都完成了全部 12 次运行;GPT-6.1 Sol 的成本不到一半,但耗时将近两倍。工具循环中,模型先请求调用工具,由调用方代码执行并返回结果,如此反复,直到模型给出答案。我们的测试在一个小型合成代码库上使用三个工具:列出文件、读取文件和搜索。默认设置下,每次运行的成本分别为 GPT-6.1 Sol 的 $0.0052、Sonnet 5.5 的 $0.0112 和 Opus 5.5 的 $0.0332;耗时中位数分别为 12.2 秒、6.7 秒和 25.3 秒。使用 max 时,GPT-6.1 Sol 的成本升至 $0.0086,Sonnet 5.5 升至 $0.0422,平均每次运行分别调用工具 6.4 次和 14.7 次。
我们的结果与其他公开测试一致吗?
结论方向一致,但差距幅度不同。我们的任务较短,且多数使用 API 默认设置;公开评测指数使用长任务和 max 设置。
| 问题 | 其他公开结果 | 我们的测量 | 结论 |
|---|---|---|---|
| GPT-6.1 Sol 相对 Sonnet 5.5 的成本 | Artificial Analysis:max 下每项指数任务 $0.72 对 $7.60,约差 11 倍 | 默认设置下为 0.49 倍,max 下为 0.33 倍 | 方向一致;在 max 下,任务越长,差距越大:单次作答为 0.33 倍,我们的工具循环为 0.20 倍,指数任务为 0.09 倍 |
| 速度 | Artificial Analysis:每秒输出 64 对 139 个 token;Vals AI:智能体任务的耗时是 GPT-6 Sol 的 2 到 3 倍 | 每秒 43 对 127 个 token;每篇文档 22.4 秒,GPT-6 Sol 为 7.2 秒 | 一致 |
| 与 Sonnet 5.5 相比的质量 | Artificial Analysis 得分 52 对 56;Vals 为 61.2% 对 67.0% | Sonnet 5.5 的 234 次调用全部答对;GPT-6.1 Sol 在同一道题的 18 次调用中答错 7 次 | 方向一致;我们的结果取决于一道题 |
| GPT-6 Sol 回答太短或遗漏内容 | 开发者投诉,例如 Hacker News 发布讨论 | 每篇 325 词,GPT-5.6 Sol 为 592 词;60 篇中有 58 篇内容完整,与 GPT-5.6 Sol 相同 | 确实偏短;未复现内容遗漏 |
| Sonnet 5.5 不遵守「只返回答案」 | 未找到公开报告 | 默认设置下,39 次中有 22 次只返回要求的值;low 下为 12 次 | 仅有我们的测试结果 |
我们观察到了什么?该选哪个模型?
与 Sonnet 5.5 和 Opus 5.5 相比,GPT-6.1 Sol 更划算。如果延迟或最后 4 到 6 分的质量差距很重要,就选 Sonnet 5.5。依据有四点:
- 按质量对应的成本看,GPT-6.1 Sol 优于两款 Claude 模型。与 Sonnet 5.5 相比,它的短任务成本约为一半,同分指数任务约为四分之一,指数榜单主要结果中的成本为七分之一到十分之一。与 Opus 5.5 相比,短任务成本为 0.29 倍,指数任务为八分之一到十分之一。
- 它更严格地遵守输出格式。所有要求只返回答案的 prompt,以及所有明确列出必需部分的文档任务,它都按要求完成。
- 解决回答太短的问题,代价是速度。回答长度回到了 GPT-5.6 Sol 的水平,但每篇文档的耗时是 GPT-6 Sol 的三倍。
- 它的错误不容易发现。7 次错误分别出现在
low、medium和xhigh,每次返回的都是格式正确的整数。
| 工作负载 | 建议选择 | 数据 |
|---|---|---|
| 由代码解析输出:信息提取、分类、单个值 | 使用 medium 或 high 的 GPT-6.1 Sol | 234 / 234 次只返回要求的值;medium 下每项任务 $0.0021 |
| 错误结果代价较高的多步数学或逻辑任务 | Sonnet 5.5,或对 GPT-6.1 Sol 的结果进行校验 | Sonnet 5.5 答对 234 / 234 次;GPT-6.1 Sol 对其中一道题调用 18 次,答错 7 次 |
| 对延迟敏感的聊天和交互式工具 | 默认设置下的 Sonnet 5.5 | 短任务 3.9 秒对 5.7 秒;每篇文档 17.2 秒对 22.4 秒 |
| 单次运行成本比延迟更重要的智能体循环 | 默认设置下的 GPT-6.1 Sol | 每次运行 $0.0052 对 $0.0112;12.2 秒对 6.7 秒 |
| 指定必需章节的文档 | GPT-6.1 Sol;如果选 Sonnet 5.5,字数范围要留宽一些 | 完成要求的数量为 80 / 80 对 68 / 80;未达标的文档比下限少 1 到 28 词 |
| 看重最高得分的高难度开放任务 | max 下的 Sonnet 5.5 或 Opus 5.5 | 公开指数得分分别为 56 和 58,GPT-6.1 Sol 为 52;单任务成本为其 7 到 11 倍 |
无论使用哪个模型,程序要据此执行操作的数值都应先校验。
常见问题
GPT-6.1 Sol 比 Claude Sonnet 5.5 便宜吗?
两者标价同为 $2 / $10,但 GPT-6.1 Sol 的单任务成本低于 Sonnet 5.5:在我们的测试中,使用各自默认设置时,单次作答任务为后者的 0.49 倍,工具循环每次运行的成本为 0.46 倍;Artificial Analysis 同得 52 分时,成本为 $0.72 对 $2.74。Sonnet 5.5 更快,且在 max 下得分更高。
GPT-6.1 Sol 能达到 Claude Opus 5.5 的水平吗? 在 Artificial Analysis 智能指数上,GPT-6.1 Sol 比 Opus 5.5 低约 6 分(52 对 58);Vals 指数上为 61.2% 对 67.0%。它的单任务成本仅为后者的八分之一到十分之一;在我们的短任务测试中为 0.29 倍。OpenAI 自己的 AutomationBench 测试则显示它领先 2.2 分。
GPT-6.1 Sol 还能关闭推理吗?
GPT-6.1 Sol 支持的最低推理强度是 low;GPT-6 Sol 曾接受的 none 已移除。改用 low 即可;在我们的测试中,该设置下每道单次作答任务的成本为 $0.0018。
相关测试:Claude Sonnet 5.5 与 Sonnet 5 对比、GPT-6 Astra 各档推理强度对比 和 GPT-5.6 成本调节项。
测试于 2026-09-30 进行,距 GPT-6.1 Sol 发布一天。调用通过网关接入 OpenAI Responses API 和 Anthropic Messages API:共 234 次 GPT-6.1 Sol 单次作答调用(13 道题、每题重复 3 次、6 档设置)、800 次业务文档调用(80 条只给目标的任务在 6 组模型与推理强度设置下运行,80 条明确列出必需部分的任务在 4 组设置下运行),以及 36 次工具循环。Sonnet 5.5 和 Opus 5.5 的单次作答及工具循环数据来自 2026-09-29 针对相同任务的测试。公开评测数据于 2026-10-01 从各评测机构页面读取。