新人 免费注册,送 10 次调用,最高 $1,免绑卡。

Gemini 3.6 Flash:思考档位让成本相差 30 倍(实测)

目录
  1. 默认设置下,Gemini 3.6 Flash 每个任务要花多少钱?
  2. 思考档位究竟有什么作用?
  3. “输出 token 减少 17%”的说法成立吗?
  4. 1M 上下文窗口真的可用吗?
  5. Gemini 3.5 Flash-Lite 适合什么场景?
  6. 常见问题

Gemini 3.6 Flash 除了答案 token,还会对思考 token 收费。每次请求花多少 token 思考,可以通过参数控制。在同一个 120 词写作任务中,默认设置的费用是 $0.03316,minimal 设置则是 $0.00110,相差 30 倍,但读者看不出输出质量有什么区别。这个档位是使用该模型时最重要的成本控制手段,同时也有一个明显的风险。Gemini 3.6 Flash 于 2026-07-21 正式发布,输入价格为每百万 token $1.50,输出价格为每百万 token $7.50,低于 3.5 Flash 的 $9 输出价格。同期发布的还有 Gemini 3.5 Flash-Lite 和针对安全场景调优的 3.5 Flash Cyber;本文实测两个通用档位:3.6 Flash 和 Flash-Lite。

TL;DR

  • 与默认设置相比,reasoning_effort: "minimal" 可将单次调用成本降低 91-97%(在 120 词任务中相差 30 倍)。对单步任务、结构化输出和工具调用,它几乎没有质量代价,但多步数学题的正确率从 3/3 降到 0/3。
  • Google 所说的“输出 token 减少 17%”取决于工作负载:我们的重推理任务少用了 19%(成本降低 32%),Agent 测试套件反而多用了 9%(成本降低 6%)。
  • 1M 上下文窗口确实可用(放在 972K token 位置的信息仍能正确召回),prompt caching 也完全符合 Google 公布的 4,096 token 下限。与部分实际容量低于宣传值的“1M 上下文”模型不同,这两项规格都没有缩水。

以下数据均于 2026-07-24 通过 Synthorai gateway 测得。重复 prompt 均加入随机盐值以绕过缓存,每个数字都有原始 usage 记录支持。

默认设置下,Gemini 3.6 Flash 每个任务要花多少钱?

输出费用主要来自推理,无论你是否能看到这些内容,都会计费。使用默认 effort 时,模型用于思考的 token 远多于回答本身,且这些推理 token 按完整的 $7.50/M 输出价格收费:

任务答案 token推理 token(计费)单次调用成本
单句事实问答269$0.00056
简单算术3167$0.00131
小型代码函数29379$0.00312
多步应用题4472$0.00368
120 词段落1394,274$0.03316

需要记住的规律是:只有两个 token 的事实回答,仍带有 69 个推理 token;写一段 120 词的文字时,模型用于思考的 token 是实际写作的 30 倍。推理 token 会列在 completion_tokens_details.reasoning_tokens 中,因此可以看到数量,但永远看不到内容。Gemini 不返回任何思考摘要或轨迹。在我们的 token 用量解析 研究中,它属于最封闭的一端;Kimi K3 会返回完整思维链,GPT-5.6 则返回摘要。下一节介绍如何降低这部分开销。

思考档位究竟有什么作用?

这是一个真正有效、单调变化的成本控制项。对大多数任务来说,降档几乎相当于白捡成本收益。将 reasoning_effort(或原生参数 thinking_config.thinking_level)设为 minimal 后,推理 token 降为零,各类任务的成本降低了 91-97%:

任务默认成本minimal 成本差距正确率:默认 → minimal
单句事实问答$0.00056$0.0000512x3/3 → 3/3
简单算术$0.00131$0.0000622x3/3 → 3/3
小型代码函数$0.00312$0.0002811x
多步应用题$0.00368$0.0001426x3/3 → 0/3
120 词段落$0.03316$0.0011030x

这个档位确实有效,支持的值为 minimallowmedium(默认值)和 high。我们的探测结果中,每升一档,推理量都会单调增加(minimal 为 0 个 token,low 约 180 个,medium 约 530 个,high 约 650 个)。minimal 唯一做不到的就是思考,而多步算术恰恰需要这个过程。在被要求简短回答铅笔和袋子的应用题时,模型三次全部答错,而且错误答案各不相同,并非某个固定环节出了问题。对于检索、分类、格式转换和单步问题,minimal 能保持正确率,同时将费用降低一个数量级。

实际使用原则与我们在 Kimi K3 上的发现相同:对于信息抽取、查询和格式转换,minimal 可以作为合理的默认值;对于任何需要中间步骤的任务,它都很危险。应该按路由设置,而不是全局启用。将其用于重推理任务前,先在自己的任务上验证正确率。

两类高流量生产场景最能说明这一点:结构化输出和函数调用在默认设置下都会消耗推理 token,但都可以安全地使用 minimal。一次受 schema 约束的抽取任务(使用带 JSON schema 的 response_format)在默认设置下产生了 337 个推理 token,并返回有效 JSON;改成 minimal 后,推理 token 为零,返回结果仍符合 schema,成本降低 9 倍。函数调用的表现相同:默认设置产生 74 个推理 token,并正确调用 get_weather(city)minimal 不产生推理 token,调用结果同样正确,成本降低 4 倍。这些只是披着“结构化”外衣的单步任务。模型不需要经过推理才能填写明确指定的字段。如果流量主要来自信息抽取或工具路由,使用 minimal 几乎只有收益。

“输出 token 减少 17%”的说法成立吗?

这取决于工作负载,两组结果的差异很有参考价值。Google 在发布 3.6 Flash 时表示,与 3.5 Flash 相比,它在 Artificial Analysis Index 上的输出 token 大约减少 17%(在个别 Agent 评测中最高减少 65%)。我们用自己的两套测试分别运行两个模型,得出了方向相反的结果:

测试集3.6 与 3.5 的输出 token 对比3.6 与 3.5 的成本对比
任务矩阵(五个重推理短任务)−19%−32%
Agent 套件(工具循环、RAG、批处理、长对话)+9%−6%

在重推理短任务中,我们不仅复现了这个结果,降幅还超过了宣传值:总输出 token 减少 19%,接近 Google 所说的 17%,而减少的几乎全是思考过程,不是答案。对两个模型进行成对复测并拆分输出 token 后,发现可见答案只缩短了 4%,推理 token 则减少了 19%。差异主要集中在数学和写作任务上,3.6 用更少的思考就能得到相同结果。这正是基准测试结果背后的原因:对于高度依赖思考预算的任务,3.6 在答案相同的情况下确实更高效。

在 Agent 和多轮流量中,结果正好相反:整套测试中,3.6 的输出 token 比 3.5 多了约 9%。效率提升主要发生在推理阶段,而 Agent 循环的预算中,推理所占比例较低,可以节省的空间更小,最终被 3.6 略长的单轮输出抵消。无论哪种情况,费用都下降了,只是原因不同:重推理任务同时受益于 token 减少和 $9→$7.50 的价格下调,成本降低 32%;Agent 流量则只受益于降价,成本降低 6%。准确的结论是:当思考占输出的大头时,“输出 token 减少 17%”确实成立;否则结果可能反转。不要直接套用宣传数字,应按自己的流量构成实测。上一节的思考档位对成本的影响,远大于这次版本升级。

1M 上下文窗口真的可用吗?

可以,而且超限时会明确报错,不会静默截断。我们把待召回信息放在不同长度 prompt 的开头。在输入达到 972K token 时,模型仍能正确召回;超过上限后,则返回明确的 400 input token count exceeds the maximum,而不是悄悄丢弃内容。市面上并非所有标称“1M 上下文”的模型都能提供宣传的窗口大小,因此这一点有必要说明。如果要复现实验,请使用内容多样、句子形式的填充文本。我们发现,如果用同一个 token 反复填充 prompt,模型在远未达到长度上限时就会退化为胡言乱语。

Prompt caching 会自动工作,关键数值也与规格完全一致。Google 文档规定 Flash 模型的上下文缓存下限为 4,096 个 token,我们的扫描结果恰好落在这个位置:前缀不超过约 2.1K token 时从不命中缓存,约 4.1K token 时开始命中。预热需要调用 5 到 8 次,每次命中后,末尾仍有约 2.1K token 不会缓存。缓存输入的读取价格为 $0.15/M,相比 $1.50 的新输入价格便宜 10 倍。这里可以直接下结论:我们测过的一些模型,接口实际提供的能力低于宣传规格,而 Gemini 3.6 Flash 的缓存下限和 1M 窗口都与文档一致。缓存只对真正长且稳定的前缀有经济价值。Flash 系列仅支持自动(隐式)缓存,不支持显式 cached-content API,因此无法手动固定一个大文档,并在未达到下限时复用。

Gemini 3.5 Flash-Lite 适合什么场景?

Flash-Lite 是成本更可预测的档位。它不会在不可见处消耗推理 token,因此费用与可见输出一一对应。在同一个多步数学问题上,Flash-Lite 的费用是 $0.00057,而 3.6 Flash 默认设置的费用为 $0.00368,前者大约便宜 6 倍。Flash-Lite 还会直接展示解题过程,而不是把它放在隐藏的推理字段中。其输入价格为 $0.30/M,输出价格为 $2.50/M,适合用作高流量、延迟敏感、单步任务的默认模型;只有任务确实需要额外推理时,再升级到 3.6 Flash 并提高思考档位。Tokenizer 不仅在这三个新模型之间保持不变,甚至可以追溯到 Gemini 2.5 Flash:在我们测试的所有代际中,英语、中文、日语、韩语和 Python 的 token 数都完全一致。因此,为 2.5 制定的各语言预算可以直接沿用到 3.6,无需重新建立基线。

常见问题

Gemini 3.6 Flash 能完全关闭推理吗?

在我们的探测中,reasoning_effort: "minimal"(或 thinking_level: "minimal")会将推理 token 降为零,这也是思考档位的下限。支持的档位包括 minimal、low、medium 和 high。它没有单独的“禁用”状态,尝试强制关闭推理会被上游拒绝,因此 minimal 已经是最低值。对于单步任务,这已经足够低。

为什么我的 Gemini 账单比可见答案对应的费用高?

因为推理 token 按完整的输出价格收费,但不会包含在返回文本中。只有两个 token 的答案,也可能附带几十到几千个计费推理 token。可以查看 completion_tokens_details.reasoning_tokens,或通过 total_tokens − prompt − completion 对账,确认实际输出费用。在任务允许的情况下,应降低思考档位。

该选 Gemini 3.6 Flash 还是 Claude Haiku 4.5?

两者都处于相近价位的高速档位,选择取决于工作负载,并不存在适用于所有场景的唯一赢家。从成本角度看,3.6 Flash 的主要差异在于思考档位:对单步流量使用 minimal,成本可以降低一个数量级;而默认设置会产生额外推理费用,Haiku 4.5 的价格为 $1/$5,没有这部分开销。公开基准测试显示,Haiku 4.5 在代码深度方面更强,3.6 Flash 则在数学和 token 单价上领先。应根据流量类型选择,并在决定前用自己的任务实测两个模型。

Gemini 3.6 Flash 比 3.5 Flash 便宜吗?

是的。在我们测试的所有工作负载中,3.6 都更便宜,但降幅取决于任务形态。输出价格从 $9/M 降至 $7.50/M;对于重推理短任务,3.6 还使用了更少的输出 token,因此成本下降约 32%;对于 Agent 流量,它使用的 token 略多,节省主要来自价格下调,约为 6%。无论哪种情况都更便宜。迁移后,应按自己的流量构成重新测量。要查看不同模型系列的 token 成本拆分,请参阅我们的 token 用量解析 研究。

数据于 2026-07-24 通过 Synthorai gateway 在 gemini-3.6-flashgemini-3.5-flashgemini-3.5-flash-lite 上测得;任务矩阵和 Agent 套件的 token 数来自逐次调用的 usage 记录;思考档位结果来自加入随机盐值的五任务消融实验(每个单元 n=3);上下文和缓存结果来自信息召回与前缀扫描。正确率仅统计具有唯一可验证答案的任务。价格和行为可能变化,请以自己的 usage 记录为准。

← 返回博客