🎁 新人 免费注册,送 10 次调用,最高 $1,免绑卡。
实测 Gemini 3.7 Flash API 成本:同任务比 3.6 便宜 2.5-8 倍

实测 Gemini 3.7 Flash API 成本:同任务比 3.6 便宜 2.5-8 倍

目录
  1. Gemini 3.7 Flash 实际要花多少钱?
  2. 3.7 还保留了哪些思考控制项?
  3. Agent 场景中,每一步要花多少钱?
  4. 从 3.6 升级后,哪些功能会出问题?
  5. 缓存、上下文和 tokenizer 能否直接沿用?
  6. 常见问题

Gemini 3.7 Flash 处理相同任务时,费用比 Gemini 3.6 Flash 低 2.5 到 8 倍,其中只有一半来自官方宣传的降价。推广期内,每百万输入和输出 token 的价格分别为 $0.75 和 $3.75,比 3.6 低 50%;在我们的计费数据中,同一个包含 6.9K token 的 prompt,费用也恰好减半($0.00529 对 $0.01057)。另一半差距不太显眼:在相同的 4 项实测任务中,gemini-3.7-flash 消耗的思考 token 比 3.6 少 26% 到 77%。模型发布后的第二天,我们测试了它的定价条款、思考档位(其中一个档位已被移除)、Google 文档明确说明和轻描淡写的兼容性问题,以及缓存、上下文和 tokenizer 的延续性。

TL;DR

  • 推广价 $0.75/$3.75 持续到 2026 年 12 月 31 日,之后调整为 $1.50/$7.50;相同 prompt 在我们的计费数据中费用恰好是 3.6 的一半。
  • 默认思考量比 3.6 少 26-77%(5 步任务中为 144 对 384 个 token),因此单任务账单降低 2.5-8 倍,而不只是 2 倍。
  • 关闭开关已被移除:所有表示关闭的写法都会返回 400(“Thinking level is unsupported”);现在最低只能设为 low
  • 在两轮工具调用中,3.7 处理工具结果时的思考量减半(32 对 61 个 token);拒答一个无法回答的问题时,两款模型都消耗了约 500 个思考 token。

Gemini 3.7 Flash 实际要花多少钱?

在 2026 年 12 月 31 日前,费率是 3.6 的一半;我们测过的每项任务,token 消耗也不到 3.6 的一半。Google 公布的首发价格是每百万输入 token $0.75、每百万输出 token $3.75;从 2027 年 1 月 1 日起恢复为 $1.50/$7.50,与 3.6 的价目表完全一致。缓存读取为每百万 token $0.075,是推广期输入价格的 10%。实测计费与价目表一致:同一个包含 6.9K token 的 prompt,在 3.7 上花费 $0.0052875,在 3.6 上花费 $0.0105675,正好减半。

影响更大的是模型不再消耗的部分。我们对完全相同且加入随机盐值的任务分别运行 3 次,以下是思考 token 的中位数和对应的输出费用:

任务3.7 思考 token3.6 思考 token3.7 输出费用3.6 输出费用单任务费用比例
简单查询7398$0.0003$0.0008便宜 2.7 倍
两跳文字题62266$0.0002$0.0020便宜 8.4 倍
5 步算术144384$0.0006$0.0029便宜 5.3 倍
JSON 提取251340$0.0011$0.0027便宜 2.5 倍

Google 在发布时称 3.7 “思考得更细致”;在我们的任务中,“更细致”意味着 token 更少,而不是更多。两款模型在所有准确性测试中都保持 3/3。费率减半,再叠加思考量减半或降得更多,实际升级后的单任务账单可减少 61-88%,这还没有算缓存。唯一需要注意的是时间:预算应按 1 月 1 日恢复后的价格计算,模式与 Sonnet 5 的推广定价相同。

有一种任务没有延续这个趋势,而且几乎没人会为它预留预算:拒答。我们询问了 5 个虚构实体,分别是一家公司、一家研究所、一份城镇宪章、一种合金和一个奖项。两款模型都拒绝回答全部 5 个问题,而且思考消耗高于我们测过的其他任何任务:3.7 的思考 token 中位数为 511,3.6 为 494。回答“没有相关记录”所用的思考量,是求解 5 步算术链的 3.5 倍。经常遇到数据缺失的检索增强流水线,每次未命中都要承担这笔成本;这也是 3.7 效率优势唯一消失的场景。这个结果也为发布首周的一项担忧提供了实测依据:评测者指出 3.7 的幻觉率更高,但面对虚构实体问题时,它 5 次都给出了保留性回答,与 3.6 完全一致。

3.7 还保留了哪些思考控制项?

保留了 3 个档位,不能关闭,与文档一致:lowmedium(默认)和 high。文档没有明确说明的是,3.6 的关闭方式已经全部失效。我们发送的所有关闭写法,包括 reasoning_effort: "none""minimal"thinking_budget: 0thinking: {"type": "disabled"}enable_thinking: false,都返回相同的上游 400:“Thinking level is unsupported: THINKING_LEVEL_MINIMAL”。第二条独立请求路径给出的说法更直接:“Reasoning is mandatory for this endpoint and cannot be disabled”。因此,这是模型本身的限制,不是某个客户端转换层的问题。在同一批次实测的 3.6-flash 上,noneminimal 仍能将消耗降为零。Flash 系列已经采用与 Pro 档一致的策略:思考无法关闭,3.6 也因此成为最后一个支持关闭思考的 Flash 版本。

在 5 步任务中,仍可用的档位表现如下(3 次运行的中位数,准确率均为 3/3):

档位3.7 思考 token3.6 思考 token
low133138
medium(默认)147284
high291409

还有两点实测结论。第一,默认档位确实是 medium:档位矩阵中,未配置时消耗 154 个 token,与显式设置 medium 时的 147 个基本没有差别。第二,thinking_budget 确实已经弃用:我们发送的所有非零值(16 到 1,024)都被接受,但消耗始终维持在 135-138 个 token,相当于空操作;而 3.6 仍会把较小的预算映射为关闭,并把较大的预算用作上限。如果 3.6 集成通过预算控制成本,迁移到 3.7 后只需选择档位,这就是完整的控制接口。不同供应商的控制档位究竟是否生效,可参考我们的思考控制矩阵

Agent 场景中,每一步要花多少钱?

工具选择与 3.6 相同,变便宜的是步骤之间的思考过程。我们针对两个函数运行了两轮循环:先查询事故,再重启查询结果中指定的服务。每款模型各运行 3 次:

循环步骤3.7 思考/输出 token3.6 思考/输出 token
第 1 轮:选择工具85 / 11085 / 110
第 2 轮:根据工具结果执行操作32 / 5861 / 87

两款模型都先选择 get_incident,随后选择 restart_service,3 次均正确,prompt token 也完全相同。差距出现在第二轮:3.7 在确定下一次调用前,思考量大约只有 3.6 的一半。这正是 agent 会反复执行的步骤:按这些中位数计算,20 步循环在 3.7 上的输出费用约为 $0.0043,在 3.6 上则为 $0.0131。即使 1 月恢复原价,这个比例也不会变化,因为差距来自 token 数量,而不是费率。Google 将 agent 基准测试的提升包装成成本优势,背后的机制正是每一跳消耗更少的思考 token,再乘上大量重复步骤。

与竞品相比,模型表现取决于具体基准。在把编码 agent 切换过去之前,值得先查看这些结果:独立汇总显示,3.7 Flash 在 FrontierCode 上领先(43.6%,Sonnet 5 为 42.7%),在 AutomationBench 上的成绩接近 Sonnet 5 的 3 倍;但根据同一份汇总和发布首周的报道,GPT-5.6 Terra 在 Terminal-bench 上领先,Sonnet 5 则在桌面任务测试中领先。3.7 唯一没有争议的是成本下限。

从 3.6 升级后,哪些功能会出问题?

有两类请求会明确返回 400,另有几项行为比文档描述得更隐蔽。Google 的迁移说明要求移除 temperaturetop_ptop_kcandidate_count 和预填充的模型轮次。实测结果如下:

变更文档说明实际行为
预填充 assistant 轮次必须移除400:“Requests ending with a model turn are not supported”(3.6 也会拒绝,只是文档现在明确写出来了)
n > 1必须移除在我们测试的接口上返回 400
temperature / top_p / top_k必须移除静默接受,3.7 和 3.6 都一样
max_tokens 超过 64K 输出上限上限为 64K在我们测试的两条请求路径中,最高传到 200,000 仍返回 200;实际生成时会静默应用上限
thinking_budget已由档位替代接受但不生效(无论传什么值,都固定消耗 135 个 token)

这里存在明显的不对称:思考档位会严格校验,传入不支持的值时返回清晰的 400,并指出具体值;采样参数和输出上限则会吞掉任何输入。如果客户端库默认设置 temperature,目前不会出问题;如果它通过预填充 assistant 轮次引导输出,那么在升级前就已经无法使用。

缓存、上下文和 tokenizer 能否直接沿用?

可以,但缓存构建变慢了。隐式缓存的命中形态与 3.6 相同:对同一个包含 6,905 个 token 的 prompt 发起第二次调用时,其中 4,076 个 token 命中缓存,使该次调用成本降低 52%;缓存读取价格是推广期输入价格的 10%。不过构建延迟增加了:3.6 在预热调用后 4 秒即可命中;3.7 在 4 秒时没有命中,30 秒时才成功。短时间内连续到达的重复流量可能赶在缓存就绪前;除此之外,写入侧的成本模型没有变化。

一次调用可接受 708,912 个输入 token,并能正确回答其中的大海捞针式检索问题,符合 1M 上下文的官方说明,价目表也没有单独的长上下文费率。4 代模型的文本 tokenizer 按字节完全一致:gemini-3.1-pro-preview3.5-flash、3.6 和 3.7 对同一份中英混合并包含代码的语料,计数都是 50 个 token,因此 token 预算可以直接沿用。图像输入仍按 1,089 个 token 的固定值计费,不受尺寸影响,与我们在 Gemini 系列上的既有测量结果一致。两代模型都不会返回思考文本:每次调用中的 reasoning_content 都为空,因此用户看不到自己付费购买的思考内容,这也是发布首周讨论中持续出现的抱怨。结构化输出保持正常:严格 json_schema 在 3/3 次运行中都返回了正确有效的 JSON;设置 reasoning_effort: "low" 后,提取任务的思考量降为零,仍属于我们的档位矩阵在各模型中都发现的单步安全区

常见问题

Gemini 3.7 Flash API 的价格是多少?

推广期持续到 2026 年 12 月 31 日,每百万输入 token $0.75,每百万输出 token $3.75;从 2027 年 1 月 1 日起恢复为 $1.50/$7.50,与 Gemini 3.6 Flash 的价目表相同。缓存读取为每百万 token $0.075。对相同 prompt 的实测计费显示,3.7 的费用恰好是 3.6 的一半。

Gemini 3.7 Flash 可以关闭思考吗?

不可以。所有关闭写法都会返回 400(“Thinking level is unsupported”);可用档位为 lowmedium(默认)和 high。即使设为 low,在我们的 5 步任务中仍消耗了 133 个思考 token。Gemini 3.6 Flash 仍是最新一款支持 reasoning_effort: "none" 的 Flash 模型,其价格与 3.7 推广期结束后的价格相同。

Gemini 3.7 Flash 每次请求真的比 3.6 便宜吗?

实际降幅高于宣传的 50%:在相同任务上,它的思考量还减少了 26-77%,因此我们实测的单任务账单下降 61-88%(两跳文字题从 $0.0020 降到 $0.0002)。12 月 31 日之后,费率会恢复到与 3.6 相同,届时只剩思考量带来的成本优势。

为 Gemini 3.6 Flash 编写的代码能直接用于 3.7 吗?

大部分可以。尽管文档要求移除采样参数(temperaturetop_ptop_k),它们仍会被接受;过大的 max_tokens 也只会被静默限制。真正会导致请求失败的有两项:预填充 assistant 轮次会返回 400(3.6 也已经如此),所有关闭思考的写法现在也都会返回 400,因此成本控制必须从 thinking_budget 迁移到 3 个思考档位。

测试于 2026-08-15 通过 Synthorai gateway 完成,当时距模型发布两天。测试范围包括:档位与关闭开关矩阵(7 个 effort 值、5 个 budget 值、2 个关闭参数,n=3;每项对比都在同一批次重新运行 gemini-3.6-flash)、4 项任务的思考成本扫描、严格 JSON 结构化输出、弃用参数探测、输出上限与 708K 上下文接受测试、两种等待时长下的隐式缓存配对测试、4 代 Gemini 模型的固定语料 tokenizer 对比、两轮函数调用循环(每款模型 n=3),以及包含 5 个虚构实体问题的拒答测试。任务费用按各模型当前输出费率和实测 completion token 计算。另有两项结论通过第二条独立请求路径交叉验证:接受超大 max_tokens,以及不存在关闭档位。推广价格和日期来自 Google 公布的条款;随着发布逐步稳定,模型行为可能发生变化。

← 返回博客