实测 Gemini 3.7 Flash API 成本:同任务比 3.6 便宜 2.5-8 倍
目录
Gemini 3.7 Flash 处理相同任务时,费用比 Gemini 3.6 Flash 低 2.5 到 8 倍,其中只有一半来自官方宣传的降价。推广期内,每百万输入和输出 token 的价格分别为 $0.75 和 $3.75,比 3.6 低 50%;在我们的计费数据中,同一个包含 6.9K token 的 prompt,费用也恰好减半($0.00529 对 $0.01057)。另一半差距不太显眼:在相同的 4 项实测任务中,gemini-3.7-flash 消耗的思考 token 比 3.6 少 26% 到 77%。模型发布后的第二天,我们测试了它的定价条款、思考档位(其中一个档位已被移除)、Google 文档明确说明和轻描淡写的兼容性问题,以及缓存、上下文和 tokenizer 的延续性。
TL;DR
- 推广价 $0.75/$3.75 持续到 2026 年 12 月 31 日,之后调整为 $1.50/$7.50;相同 prompt 在我们的计费数据中费用恰好是 3.6 的一半。
- 默认思考量比 3.6 少 26-77%(5 步任务中为 144 对 384 个 token),因此单任务账单降低 2.5-8 倍,而不只是 2 倍。
- 关闭开关已被移除:所有表示关闭的写法都会返回 400(“Thinking level is unsupported”);现在最低只能设为
low。 - 在两轮工具调用中,3.7 处理工具结果时的思考量减半(32 对 61 个 token);拒答一个无法回答的问题时,两款模型都消耗了约 500 个思考 token。
Gemini 3.7 Flash 实际要花多少钱?
在 2026 年 12 月 31 日前,费率是 3.6 的一半;我们测过的每项任务,token 消耗也不到 3.6 的一半。Google 公布的首发价格是每百万输入 token $0.75、每百万输出 token $3.75;从 2027 年 1 月 1 日起恢复为 $1.50/$7.50,与 3.6 的价目表完全一致。缓存读取为每百万 token $0.075,是推广期输入价格的 10%。实测计费与价目表一致:同一个包含 6.9K token 的 prompt,在 3.7 上花费 $0.0052875,在 3.6 上花费 $0.0105675,正好减半。
影响更大的是模型不再消耗的部分。我们对完全相同且加入随机盐值的任务分别运行 3 次,以下是思考 token 的中位数和对应的输出费用:
| 任务 | 3.7 思考 token | 3.6 思考 token | 3.7 输出费用 | 3.6 输出费用 | 单任务费用比例 |
|---|---|---|---|---|---|
| 简单查询 | 73 | 98 | $0.0003 | $0.0008 | 便宜 2.7 倍 |
| 两跳文字题 | 62 | 266 | $0.0002 | $0.0020 | 便宜 8.4 倍 |
| 5 步算术 | 144 | 384 | $0.0006 | $0.0029 | 便宜 5.3 倍 |
| JSON 提取 | 251 | 340 | $0.0011 | $0.0027 | 便宜 2.5 倍 |
Google 在发布时称 3.7 “思考得更细致”;在我们的任务中,“更细致”意味着 token 更少,而不是更多。两款模型在所有准确性测试中都保持 3/3。费率减半,再叠加思考量减半或降得更多,实际升级后的单任务账单可减少 61-88%,这还没有算缓存。唯一需要注意的是时间:预算应按 1 月 1 日恢复后的价格计算,模式与 Sonnet 5 的推广定价相同。
有一种任务没有延续这个趋势,而且几乎没人会为它预留预算:拒答。我们询问了 5 个虚构实体,分别是一家公司、一家研究所、一份城镇宪章、一种合金和一个奖项。两款模型都拒绝回答全部 5 个问题,而且思考消耗高于我们测过的其他任何任务:3.7 的思考 token 中位数为 511,3.6 为 494。回答“没有相关记录”所用的思考量,是求解 5 步算术链的 3.5 倍。经常遇到数据缺失的检索增强流水线,每次未命中都要承担这笔成本;这也是 3.7 效率优势唯一消失的场景。这个结果也为发布首周的一项担忧提供了实测依据:评测者指出 3.7 的幻觉率更高,但面对虚构实体问题时,它 5 次都给出了保留性回答,与 3.6 完全一致。
3.7 还保留了哪些思考控制项?
保留了 3 个档位,不能关闭,与文档一致:low、medium(默认)和 high。文档没有明确说明的是,3.6 的关闭方式已经全部失效。我们发送的所有关闭写法,包括 reasoning_effort: "none"、"minimal"、thinking_budget: 0、thinking: {"type": "disabled"}、enable_thinking: false,都返回相同的上游 400:“Thinking level is unsupported: THINKING_LEVEL_MINIMAL”。第二条独立请求路径给出的说法更直接:“Reasoning is mandatory for this endpoint and cannot be disabled”。因此,这是模型本身的限制,不是某个客户端转换层的问题。在同一批次实测的 3.6-flash 上,none 和 minimal 仍能将消耗降为零。Flash 系列已经采用与 Pro 档一致的策略:思考无法关闭,3.6 也因此成为最后一个支持关闭思考的 Flash 版本。
在 5 步任务中,仍可用的档位表现如下(3 次运行的中位数,准确率均为 3/3):
| 档位 | 3.7 思考 token | 3.6 思考 token |
|---|---|---|
| low | 133 | 138 |
| medium(默认) | 147 | 284 |
| high | 291 | 409 |
还有两点实测结论。第一,默认档位确实是 medium:档位矩阵中,未配置时消耗 154 个 token,与显式设置 medium 时的 147 个基本没有差别。第二,thinking_budget 确实已经弃用:我们发送的所有非零值(16 到 1,024)都被接受,但消耗始终维持在 135-138 个 token,相当于空操作;而 3.6 仍会把较小的预算映射为关闭,并把较大的预算用作上限。如果 3.6 集成通过预算控制成本,迁移到 3.7 后只需选择档位,这就是完整的控制接口。不同供应商的控制档位究竟是否生效,可参考我们的思考控制矩阵。
Agent 场景中,每一步要花多少钱?
工具选择与 3.6 相同,变便宜的是步骤之间的思考过程。我们针对两个函数运行了两轮循环:先查询事故,再重启查询结果中指定的服务。每款模型各运行 3 次:
| 循环步骤 | 3.7 思考/输出 token | 3.6 思考/输出 token |
|---|---|---|
| 第 1 轮:选择工具 | 85 / 110 | 85 / 110 |
| 第 2 轮:根据工具结果执行操作 | 32 / 58 | 61 / 87 |
两款模型都先选择 get_incident,随后选择 restart_service,3 次均正确,prompt token 也完全相同。差距出现在第二轮:3.7 在确定下一次调用前,思考量大约只有 3.6 的一半。这正是 agent 会反复执行的步骤:按这些中位数计算,20 步循环在 3.7 上的输出费用约为 $0.0043,在 3.6 上则为 $0.0131。即使 1 月恢复原价,这个比例也不会变化,因为差距来自 token 数量,而不是费率。Google 将 agent 基准测试的提升包装成成本优势,背后的机制正是每一跳消耗更少的思考 token,再乘上大量重复步骤。
与竞品相比,模型表现取决于具体基准。在把编码 agent 切换过去之前,值得先查看这些结果:独立汇总显示,3.7 Flash 在 FrontierCode 上领先(43.6%,Sonnet 5 为 42.7%),在 AutomationBench 上的成绩接近 Sonnet 5 的 3 倍;但根据同一份汇总和发布首周的报道,GPT-5.6 Terra 在 Terminal-bench 上领先,Sonnet 5 则在桌面任务测试中领先。3.7 唯一没有争议的是成本下限。
从 3.6 升级后,哪些功能会出问题?
有两类请求会明确返回 400,另有几项行为比文档描述得更隐蔽。Google 的迁移说明要求移除 temperature、top_p、top_k、candidate_count 和预填充的模型轮次。实测结果如下:
| 变更 | 文档说明 | 实际行为 |
|---|---|---|
| 预填充 assistant 轮次 | 必须移除 | 400:“Requests ending with a model turn are not supported”(3.6 也会拒绝,只是文档现在明确写出来了) |
n > 1 | 必须移除 | 在我们测试的接口上返回 400 |
temperature / top_p / top_k | 必须移除 | 静默接受,3.7 和 3.6 都一样 |
max_tokens 超过 64K 输出上限 | 上限为 64K | 在我们测试的两条请求路径中,最高传到 200,000 仍返回 200;实际生成时会静默应用上限 |
thinking_budget | 已由档位替代 | 接受但不生效(无论传什么值,都固定消耗 135 个 token) |
这里存在明显的不对称:思考档位会严格校验,传入不支持的值时返回清晰的 400,并指出具体值;采样参数和输出上限则会吞掉任何输入。如果客户端库默认设置 temperature,目前不会出问题;如果它通过预填充 assistant 轮次引导输出,那么在升级前就已经无法使用。
缓存、上下文和 tokenizer 能否直接沿用?
可以,但缓存构建变慢了。隐式缓存的命中形态与 3.6 相同:对同一个包含 6,905 个 token 的 prompt 发起第二次调用时,其中 4,076 个 token 命中缓存,使该次调用成本降低 52%;缓存读取价格是推广期输入价格的 10%。不过构建延迟增加了:3.6 在预热调用后 4 秒即可命中;3.7 在 4 秒时没有命中,30 秒时才成功。短时间内连续到达的重复流量可能赶在缓存就绪前;除此之外,写入侧的成本模型没有变化。
一次调用可接受 708,912 个输入 token,并能正确回答其中的大海捞针式检索问题,符合 1M 上下文的官方说明,价目表也没有单独的长上下文费率。4 代模型的文本 tokenizer 按字节完全一致:gemini-3.1-pro-preview、3.5-flash、3.6 和 3.7 对同一份中英混合并包含代码的语料,计数都是 50 个 token,因此 token 预算可以直接沿用。图像输入仍按 1,089 个 token 的固定值计费,不受尺寸影响,与我们在 Gemini 系列上的既有测量结果一致。两代模型都不会返回思考文本:每次调用中的 reasoning_content 都为空,因此用户看不到自己付费购买的思考内容,这也是发布首周讨论中持续出现的抱怨。结构化输出保持正常:严格 json_schema 在 3/3 次运行中都返回了正确有效的 JSON;设置 reasoning_effort: "low" 后,提取任务的思考量降为零,仍属于我们的档位矩阵在各模型中都发现的单步安全区。
常见问题
Gemini 3.7 Flash API 的价格是多少?
推广期持续到 2026 年 12 月 31 日,每百万输入 token $0.75,每百万输出 token $3.75;从 2027 年 1 月 1 日起恢复为 $1.50/$7.50,与 Gemini 3.6 Flash 的价目表相同。缓存读取为每百万 token $0.075。对相同 prompt 的实测计费显示,3.7 的费用恰好是 3.6 的一半。
Gemini 3.7 Flash 可以关闭思考吗?
不可以。所有关闭写法都会返回 400(“Thinking level is unsupported”);可用档位为 low、medium(默认)和 high。即使设为 low,在我们的 5 步任务中仍消耗了 133 个思考 token。Gemini 3.6 Flash 仍是最新一款支持 reasoning_effort: "none" 的 Flash 模型,其价格与 3.7 推广期结束后的价格相同。
Gemini 3.7 Flash 每次请求真的比 3.6 便宜吗?
实际降幅高于宣传的 50%:在相同任务上,它的思考量还减少了 26-77%,因此我们实测的单任务账单下降 61-88%(两跳文字题从 $0.0020 降到 $0.0002)。12 月 31 日之后,费率会恢复到与 3.6 相同,届时只剩思考量带来的成本优势。
为 Gemini 3.6 Flash 编写的代码能直接用于 3.7 吗?
大部分可以。尽管文档要求移除采样参数(temperature、top_p、top_k),它们仍会被接受;过大的 max_tokens 也只会被静默限制。真正会导致请求失败的有两项:预填充 assistant 轮次会返回 400(3.6 也已经如此),所有关闭思考的写法现在也都会返回 400,因此成本控制必须从 thinking_budget 迁移到 3 个思考档位。
测试于 2026-08-15 通过 Synthorai gateway 完成,当时距模型发布两天。测试范围包括:档位与关闭开关矩阵(7 个 effort 值、5 个 budget 值、2 个关闭参数,n=3;每项对比都在同一批次重新运行 gemini-3.6-flash)、4 项任务的思考成本扫描、严格 JSON 结构化输出、弃用参数探测、输出上限与 708K 上下文接受测试、两种等待时长下的隐式缓存配对测试、4 代 Gemini 模型的固定语料 tokenizer 对比、两轮函数调用循环(每款模型 n=3),以及包含 5 个虚构实体问题的拒答测试。任务费用按各模型当前输出费率和实测 completion token 计算。另有两项结论通过第二条独立请求路径交叉验证:接受超大 max_tokens,以及不存在关闭档位。推广价格和日期来自 Google 公布的条款;随着发布逐步稳定,模型行为可能发生变化。