Gemini 3.7 Flash API 實測:任務成本比 3.6 低 2.5-8 倍
目錄
Gemini 3.7 Flash 執行相同任務時,費用比 Gemini 3.6 Flash 低 2.5 倍到 8 倍,其中只有一半來自官方宣傳的降價。上市優惠期間,每百萬個輸入權杖為 $0.75、輸出權杖為 $3.75,比 3.6 便宜 50%;根據我們的計費紀錄,同一段 6.9K 權杖的提示詞,費用也剛好減半($0.00529 對 $0.01057)。另一半則沒那麼明顯:在實測的四個相同任務中,gemini-3.7-flash 使用的思考權杖比 3.6 少 26% 到 77%。我們在模型發布後第二天進行測試,涵蓋價格條款、思考控制(其中一個檔位已失效)、Google 文件提到及輕描淡寫帶過的相容性中斷,以及快取、上下文與 tokenizer 的延續性。
TL;DR
- 優惠價 $0.75/$3.75 持續至 2026 年 12 月 31 日,之後調回 $1.50/$7.50;同一提示詞在我們的計費紀錄中,費用剛好是 3.6 的一半。
- 預設思考量比 3.6 少 26-77%(五步驟任務為 144 對 384 個權杖),因此每項任務的費用降低 2.5-8 倍,不只是 2 倍。
- 關閉選項已移除:所有表示關閉的寫法都會回傳 400(「Thinking level is unsupported」);目前最低只能設為
low。 - 在兩輪工具呼叫流程中,3.7 處理工具結果那一輪的推理量減半(32 對 61 個權杖);拒答無法回答的問題時,兩個模型都花了約 500 個權杖。
Gemini 3.7 Flash 實際費用是多少?
在 2026 年 12 月 31 日前,費率是 3.6 的一半;而我們測量的每個任務中,其權杖用量也不到 3.6 的一半。Google 公布的上市價格為每百萬個輸入權杖 $0.75、輸出權杖 $3.75;自 2027 年 1 月 1 日起,將調回 $1.50/$7.50,與 3.6 的定價完全相同。快取讀取費用為每百萬個權杖 $0.075,是優惠輸入價格的 10%。實際計費也與價目表一致:相同的 6.9K 權杖提示詞,在 3.7 上花費 $0.0052875,在 3.6 上則為 $0.0105675,剛好減半。
影響更大的是模型少用了多少權杖。我們對加鹽後的相同任務各執行三次,以下為推理權杖中位數及對應的輸出費用:
| 任務 | 3.7 推理權杖 | 3.6 推理權杖 | 3.7 輸出費用 | 3.6 輸出費用 | 任務費用比 |
|---|---|---|---|---|---|
| 簡單查詢 | 73 | 98 | $0.0003 | $0.0008 | 便宜 2.7 倍 |
| 兩跳文字題 | 62 | 266 | $0.0002 | $0.0020 | 便宜 8.4 倍 |
| 五步驟算術 | 144 | 384 | $0.0006 | $0.0029 | 便宜 5.3 倍 |
| JSON 擷取 | 251 | 340 | $0.0011 | $0.0027 | 便宜 2.5 倍 |
Google 在發布時表示 3.7 「思考得更縝密」;在我們的任務中,縝密代表使用更少權杖,而不是更多。兩個模型所有準確度測試都是 3/3。把減半的費率乘上減半甚至更低的思考量,在不計快取的情況下,實際升級後每項任務的費用可減少 61-88%。但要留意日期:預算應按 1 月 1 日恢復原價後估算,這與 Sonnet 5 的優惠定價模式相同。
有一類任務不符合這個趨勢,而且通常不會被納入預算:拒答。我們詢問五個捏造的實體(一家公司、一間研究機構、一份城鎮章程、一種合金和一個獎項),兩個模型都拒絕回答全部五題,也都比其他受測任務花更多時間思考。3.7 的推理權杖中位數為 511,3.6 則為 494。回答「查無相關紀錄」所需的思考量,是解五步驟算術題的 3.5 倍。經常遇到資料缺漏的檢索增強流程,每次查無資料都要付出這項成本,這也是唯一看不到 3.7 效率優勢的情況。這項結果也為上市首週的疑慮提供實測基準:評測者指出 3.7 的幻覺率較高,但面對捏造實體的問題時,3.7 五題都採取保留態度,與 3.6 完全相同。
3.7 還支援哪些思考控制?
共有三個檔位,不能關閉,與文件所述完全一致:low、medium(預設)、high。文件沒有明說的是,3.6 原本可繞過思考的設定已全部失效。我們嘗試的每種關閉寫法,包括 reasoning_effort: "none"、"minimal"、thinking_budget: 0、thinking: {"type": "disabled"}、enable_thinking: false,都收到相同的上游 400:「Thinking level is unsupported: THINKING_LEVEL_MINIMAL」。另一條獨立的請求路徑則更直接地拒絕:「Reasoning is mandatory for this endpoint and cannot be disabled」。因此,限制來自模型,而不是某個用戶端的轉譯層。同一批測試中的 3.6-flash 仍可透過 none 和 minimal 將思考量降為零。Flash 系列已跟進專業級模型的政策:思考不能關閉,而 3.6 現在是最後一個可以關閉思考的 Flash。
在五步驟任務中,仍可用的檔位結果如下(各執行三次取中位數,準確度皆為 3/3):
| 檔位 | 3.7 推理權杖 | 3.6 推理權杖 |
|---|---|---|
| low | 133 | 138 |
| medium(預設) | 147 | 284 |
| high | 291 | 409 |
有兩點實務觀察。首先,預設確實是 medium:未指定設定時,在檔位測試中使用了 154 個權杖,與明確指定 medium 的 147 個幾乎沒有差異。其次,thinking_budget 確實已棄用:我們傳入的所有非零值(16 到 1,024)都被接受,但無論設定多少,都使用相同的 135-138 個權杖,等同沒有作用。3.6 仍會把小額預算對應為關閉,較大額預算則作為上限。如果你的 3.6 整合是透過預算控制成本,升級至 3.7 後只需要選擇檔位,介面就只有這些選項。若要比較不同供應商的控制項實際效果,請參閱我們的思考控制矩陣。
代理式工作流程每一步要花多少錢?
工具選擇與 3.6 相同,真正變便宜的是步驟之間的推理。我們使用兩個函式執行兩輪流程:先查詢事件,再重新啟動事件所指定的服務。每個模型各執行三次:
| 流程步驟 | 3.7 推理/輸出權杖 | 3.6 推理/輸出權杖 |
|---|---|---|
| 第 1 輪:選擇工具 | 85 / 110 | 85 / 110 |
| 第 2 輪:根據工具結果執行動作 | 32 / 58 | 61 / 87 |
兩個模型都是先選擇 get_incident,接著選擇 restart_service,準確度皆為 3/3,提示詞權杖數也完全相同。差異出現在第二輪:3.7 在決定下一個呼叫前,思考量約為 3.6 的一半。這正是代理會不斷重複的步驟。依這些中位數估算,20 步流程在 3.7 上的輸出費用約為 $0.0043,3.6 則為 $0.0131。即使 1 月價格恢復後,這個比例仍會維持,因為差異來自權杖數,而不是費率。這也解釋了 Google 為何把代理式基準測試的提升定位成成本優勢:每一跳使用較少推理權杖,再乘上大量跳數。
與其他競爭模型相比,結果取決於基準測試。切換程式設計代理前,值得先看各項測試:獨立彙整顯示,3.7 Flash 在 FrontierCode 上領先(43.6%,Sonnet 5 為 42.7%),在 AutomationBench 上接近 Sonnet 5 的 3 倍;但同一份彙整與上市首週的報導指出,GPT-5.6 Terra 在 Terminal-bench 領先,Sonnet 5 則在桌面任務測驗中居首。3.7 唯一沒有模糊空間的優勢是成本下限。
從 3.6 升級後,哪些功能會中斷?
有兩種情況會直接回傳 400,另有幾項問題比文件描述得更不明顯。Google 的遷移說明要求移除 temperature、top_p、top_k、candidate_count,以及預填的模型回合。實測結果如下:
| 變更 | 文件說明 | 實際行為 |
|---|---|---|
| 預填 assistant 回合 | 必須移除 | 400:「Requests ending with a model turn are not supported」(3.6 也會拒絕,只是現在文件明確寫出來) |
n > 1 | 必須移除 | 在我們測量的介面上回傳 400 |
temperature / top_p / top_k | 必須移除 | 在 3.7 和 3.6 上都會直接接受 |
max_tokens 超過 64K 輸出上限 | 上限為 64K | 在我們測試的兩條請求路徑上,即使設為 200,000 仍回傳 200;上限只會在產生內容時無聲套用 |
thinking_budget | 已由檔位取代 | 接受但無作用(任何值都固定使用 135 個權杖) |
這種不對稱值得留意:思考檔位會明確驗證,不支援的值會回傳 400,並指出是哪個值;取樣參數與輸出上限則會直接吞下任何設定。如果用戶端程式庫預設會設定 temperature,目前不會出錯;如果它會預填 assistant 回合以引導輸出,那麼在升級前就已經不能用了。
快取、上下文與 tokenizer 能否沿用?
可以,但有一項變慢了。隱式快取的命中形式與 3.6 相同:對同一提示詞發出第二次呼叫時,6,905 個權杖中有 4,076 個命中快取,使該次呼叫費用降低 52%;快取讀取價格是優惠輸入價格的 10%。但建立快取需要更久:3.6 在預熱呼叫後 4 秒即可命中,3.7 等待 4 秒仍未命中,要到 30 秒才成功。短時間內密集送出的重複流量,會在快取預熱完成前抵達;除此之外,寫入端的成本結構沒有變化。
上下文可在單次呼叫中接受 708,912 個輸入權杖,並正確回答藏針問題,符合 1M 的規格,而且價目表沒有長上下文的額外費率。四代模型的文字 tokenizer 在位元組層級完全一致:gemini-3.1-pro-preview、3.5-flash、3.6 和 3.7 對同一份中英混合且含程式碼的語料,都計為 50 個權杖,因此權杖預算可以直接沿用。圖片輸入仍按 Gemini 系列各種尺寸一律固定 1,089 個權杖計費。兩代模型都不會回傳推理文字:每次呼叫的 reasoning_content 都是空的,因此兩者付費使用的思考內容都不可見,這也是上市首週討論串持續抱怨的問題。結構化輸出仍可正常運作:嚴格的 json_schema 在 3/3 次執行中都回傳有效且正確的 JSON;reasoning_effort: "low" 也讓擷取任務的思考量降為零,與我們的檔位矩陣在各模型上找到的單步驟安全區一致。
常見問題
Gemini 3.7 Flash API 的費用是多少?
上市優惠持續至 2026 年 12 月 31 日,每百萬個輸入權杖 $0.75、輸出權杖 $3.75;自 2027 年 1 月 1 日起恢復為 $1.50/$7.50,與 Gemini 3.6 Flash 相同。快取讀取費用為每百萬個權杖 $0.075。對相同提示詞進行實測時,3.7 的計費剛好是 3.6 的一半。
Gemini 3.7 Flash 可以關閉思考嗎?
不行。所有表示關閉的寫法都會回傳 400(「Thinking level is unsupported」);可用檔位只有 low、medium(預設)和 high。即使設為 low,我們的五步驟任務仍使用了 133 個推理權杖。Gemini 3.6 Flash 是最新一個仍支援 reasoning_effort: "none" 的 Flash,價格則等同 3.7 優惠結束後的費率。
Gemini 3.7 Flash 每次請求真的比 3.6 便宜嗎?
實際降幅比宣傳的 50% 更大:相同任務的思考量也少了 26-77%,因此我們測得的單項任務費用降低 61-88%(兩跳文字題從 $0.0020 降至 $0.0002)。12 月 31 日後,費率會恢復至相同水準,屆時只剩思考量帶來的節省。
為 Gemini 3.6 Flash 撰寫的程式碼可以直接用於 3.7 嗎?
大多可以。雖然文件列為應移除項目,取樣參數(temperature、top_p、top_k)仍會被接受,過大的 max_tokens 也只會被無聲限制。兩個直接中斷點是:預填的 assistant 回合會回傳 400(3.6 原本就如此),而所有關閉思考的設定現在也都會回傳 400,因此成本控制必須從 thinking_budget 改用三個檔位。
測量日期為 2026-08-15,透過 Synthorai 閘道進行,當時模型發布滿兩天。測試項目包括:檔位與關閉選項矩陣(7 個 effort 值、5 個 budget、2 個關閉參數,n=3;每項比較都在同一批次重新執行 gemini-3.6-flash)、四任務推理成本掃描、嚴格 JSON 結構化輸出、棄用參數探測、輸出上限與 708K 上下文接受度、兩種等待時間的隱式快取配對、四代 Gemini 使用固定語料的 tokenizer 比較、兩輪函式呼叫流程(每個模型 n=3),以及五題捏造實體拒答測試。任務金額依各模型目前的輸出費率,對實測完成權杖計價。其中兩項結果透過第二條獨立請求路徑交叉驗證:接受過大的 max_tokens,以及無法關閉思考。優惠價格與日期來自 Google 公布的條款;隨著部署逐步完成,行為仍可能變更。