新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

Gemini 3.6 Flash:實測思考檔位,成本相差 30 倍

目錄
  1. Gemini 3.6 Flash 使用預設設定時,每個任務要花多少錢?
  2. 思考檔位實際上會做什麼?
  3. 「輸出 token 減少 17%」的說法是否符合實測?
  4. 1M 上下文視窗確實可用嗎?
  5. Gemini 3.5 Flash-Lite 適合什麼場景?
  6. 常見問題

Gemini 3.6 Flash 除了回答本身,也會對思考 token 計費,而每次請求使用多少思考 token,都能由你控制。在同一個 120 字寫作任務中,預設設定的費用是 $0.03316,minimal 則是 $0.00110,成本相差 30 倍,但讀者看不出輸出有何差別。這個檔位是使用此模型時最重要的成本決策,也有一個明顯風險。Gemini 3.6 Flash 已於 2026-07-21 正式推出,輸入每百萬 token 為 $1.50,輸出每百萬 token 為 $7.50,低於 3.5 Flash 的 $9 輸出費率。同期推出的還有 Gemini 3.5 Flash-Lite 和針對資安調校的 3.5 Flash Cyber;本文實測的是兩個通用層級:3.6 Flash 與 Flash-Lite。

TL;DR

  • reasoning_effort: "minimal" 相較預設值可將每次呼叫成本降低 91-97%(在 120 字任務中相差 30 倍)。單步驟、結構化輸出與工具呼叫任務不受影響,但多步驟數學題的正確率從 3/3 降至 0/3。
  • Google 宣稱「輸出 token 減少 17%」,實際結果取決於工作負載:我們的重推理任務減少 19%(成本降低 32%),代理工作套件則增加 9%(成本仍降低 6%)。
  • 1M 上下文確實可用(放在 972K token 處的針能正確找回),prompt caching 也完全符合 Google 公布的 4,096-token 下限。相較某些實際容量低於宣稱值的「1M 上下文」模型,這次規格與實測一致。

以下資料皆於 2026-07-24 經由 Synthorai 閘道實測。重複 prompt 均加入隨機內容以避開快取,每個數字都有原始用量紀錄可供核對。

Gemini 3.6 Flash 使用預設設定時,每個任務要花多少錢?

輸出帳單主要由推理構成,而且無論你是否看得到,都會計費。使用預設推理強度時,模型用於思考的 token 遠多於回答,而這些推理 token 會依完整的 $7.50/M 輸出費率計費:

任務回答 token推理 token(計費)每次呼叫成本
單句事實題269$0.00056
簡單算術3167$0.00131
小型程式函式29379$0.00312
多步驟文字題4472$0.00368
120 字段落1394,274$0.03316

這個模式要記住:只有兩個 token 的事實回答,背後仍用了 69 個推理 token;120 字段落用於思考的 token,更是寫作本身的 30 倍。推理 token 會列在 completion_tokens_details.reasoning_tokens,因此可以看到數量,但永遠看不到內容。Gemini 完全不會回傳思考摘要或軌跡。在我們的 token 用量結構 研究中,這是最封閉的一端;Kimi K3 會回傳完整思維鏈,GPT-5.6 則會提供摘要。下一節說明如何降低這筆成本。

思考檔位實際上會做什麼?

這是確實有效且單調遞增的成本控制項,對大多數任務而言,幾乎等於直接省錢。將 reasoning_effort(或原生的 thinking_config.thinking_level)設為 minimal 後,推理 token 降至零,各任務成本減少 91-97%:

任務預設成本minimal 成本差距正確率:預設 → minimal
單句事實題$0.00056$0.0000512x3/3 → 3/3
簡單算術$0.00131$0.0000622x3/3 → 3/3
小型程式函式$0.00312$0.0002811x
多步驟文字題$0.00368$0.0001426x3/3 → 0/3
120 字段落$0.03316$0.0011030x

這個檔位確實有效,可接受的值為 minimallowmedium(預設值)和 high。在我們的探測中,每提高一個檔位,推理量都會單調增加(minimal 為 0 個 token、low 約 180 個、medium 約 530 個、high 約 650 個)。minimal 唯一做不到的就是思考,而多步驟算術確實需要推理。當模型被要求簡短回答鉛筆與袋子的文字題時,三次都答錯,而且錯誤答案各不相同,並非同一種系統性失誤。對於檢索、分類、格式化和單步驟問題,minimal 能維持正確率,並讓帳單降低一個數量級。

實務上的規則與我們在 Kimi K3 的發現一致:對擷取、查詢和格式化任務而言,minimal 是合理的預設值;任何需要中間步驟的任務使用它都很危險。應依路由個別設定,而不是全域套用。若任務需要大量推理,上線前務必使用自己的任務驗證正確率。

兩種高流量的正式環境工作負載很能說明問題:結構化輸出和函式呼叫在預設值下都會消耗推理 token,但兩者使用 minimal 都沒有問題。受 schema 限制的擷取任務(使用含 JSON schema 的 response_format),在預設值下計費 337 個推理 token,並回傳有效 JSON;改用 minimal 後,推理 token 為零,仍能回傳符合 schema 的有效 JSON,成本降低 9 倍。函式呼叫的結果相同:預設值使用 74 個推理 token,正確呼叫 get_weather(city)minimal 不使用推理 token,呼叫結果同樣正確,成本降低 4 倍。這些只是披著「結構化」外衣的單步驟任務。模型不需要經過思考,才能填入已明確指定的欄位。因此,如果流量主要用於擷取或工具路由,minimal 幾乎等於白省一筆。

「輸出 token 減少 17%」的說法是否符合實測?

結果取決於工作負載,而且兩組結果的差異很有參考價值。Google 在發表 3.6 Flash 時表示,相較 3.5 Flash,它在 Artificial Analysis Index 上使用的輸出 token 約少 17%(個別代理評測最多減少 65%)。我們讓兩個模型跑過自己的兩套測試環境,結果方向相反:

測試環境3.6 相較 3.5 的輸出 token3.6 相較 3.5 的成本
任務矩陣(五個重推理短任務)−19%−32%
代理工作套件(工具迴圈、RAG、批次、長對話)+9%−6%

在重推理短任務中,實測不只重現了官方結果,甚至優於宣稱值:總輸出減少 19%,接近 Google 的 17%,而且減少的幾乎全是思考,不是回答。兩個模型成對重跑後拆分輸出 token,可見回答內容只縮短 4%,推理則減少 19%。差異主要集中在數學與寫作任務,3.6 能用較少推敲得出相同結果。這就是該基準測試背後的原因:當工作負載高度依賴思考預算時,3.6 確實能以較少資源產生相同答案。

在代理式、多輪流量中,方向反了過來:整套測試中,3.6 的輸出比 3.5 多約 9%。效率提升發生在推理階段,但代理迴圈用於推理的預算占比較低,可節省的空間也較少,最後反而由 3.6 稍長的每輪輸出占上風。不過兩種情況的帳單都會下降,只是兩項效果的組合方式不同:重推理任務同時受惠於 token 減少和 $9→$7.50 的費率調降,成本降低 32%;代理流量則只靠降價,成本降低 6%。「輸出 token 減少 17%」在思考占輸出大宗的任務中成立,在其他任務中則可能反轉。不要直接套用標題數字,應實測自己的工作負載組合。上一節提到的思考檔位,對成本的影響遠大於模型版本升級。

1M 上下文視窗確實可用嗎?

可以,而且超出限制時會明確失敗,不會靜默截斷。我們把召回針放在不同長度 prompt 的開頭;輸入達 972K token 時,模型仍能正確找回。超過上限的 prompt 則會清楚回傳 400 input token count exceeds the maximum,不會在沒有提示的情況下丟棄內容。之所以需要明確說明,是因為市面上並非所有標示「1M 上下文」的模型,都真的會提供宣稱的視窗大小。若要重現測試,填充內容應使用多樣且具有句子形式的文字。若 prompt 只由同一個 token 重複組成,模型會在遠低於大小限制時就開始產生退化的亂碼。

Prompt caching 是自動運作的,而且關鍵數字完全符合規格。Google 文件指出,Flash 模型的上下文快取下限是 4,096 個 token,我們的掃描結果正好落在這裡:前綴不超過約 2.1K 時從未命中快取,約 4.1K token 開始命中;經過 5 到 8 次呼叫暖機後,每次命中仍會留下最後約 2.1K 不快取。快取輸入讀取費率為 $0.15/M,只有 $1.50 新輸入費率的十分之一。這次的結果讓人放心:我們測過部分模型,其宣稱數字高於端點實際能力;Gemini 3.6 Flash 的快取下限與 1M 視窗則都與文件一致。快取仍只適合真正夠長且穩定的前綴。另需注意,Flash 系列只支援自動(隱式)快取,不支援明確指定的 cached-content API,因此無法手動固定大型文件,並在低於門檻時重複使用。

Gemini 3.5 Flash-Lite 適合什麼場景?

Flash-Lite 是成本可預測的層級。它不會暗中使用推理 token,因此帳單會與可見輸出一對一變動。在相同的多步驟數學題中,Flash-Lite 的費用是 $0.00057,3.6 Flash 預設設定則是 $0.00368,前者約便宜 6 倍,而且會直接呈現解題過程,不會藏在不可見的推理欄位。它的輸入費率為 $0.30/M,輸出為 $2.50/M,適合作為高流量、對延遲敏感、單步驟工作的預設選擇;任務需要推理時,再升級至 3.6 Flash,透過檔位加回思考能力。Tokenizer 不只在三個新模型間相同,甚至一路回溯到 Gemini 2.5 Flash 都沒有變化。我們檢查的每一代模型,在英文、中文、日文、韓文和 Python 上都有相同的 token 數量。因此,為 2.5 制定的各語言預算可以直接沿用到 3.6,不必重新建立基準。

常見問題

Gemini 3.6 Flash 可以完全關閉推理嗎?

在我們的探測中,reasoning_effort: "minimal"(或 thinking_level: "minimal")會將推理 token 降至零,也是檔位的最低值;可接受的檔位為 minimal、low、medium 和 high。它沒有獨立的「停用」狀態,嘗試強制停用推理會被上游拒絕。因此,minimal 已是最低設定,而且對單步驟任務而言已經足夠低。

為什麼 Gemini 帳單比可見答案看起來更高?

因為推理 token 會依完整輸出費率計費,但不會出現在回傳文字中。只有兩個 token 的答案,背後可能帶有數十到數千個計費的推理 token。可讀取 completion_tokens_details.reasoning_tokens(或用 total_tokens − prompt − completion 核對)查看實際輸出費用,並在任務允許時調低檔位。

Gemini 3.6 Flash 還是 Claude Haiku 4.5?

兩者都位於價格相近的高速層級,選擇取決於工作負載,沒有單一贏家。從成本角度來看,3.6 Flash 的差異化功能是思考檔位:在單步驟流量上,minimal 能讓成本降低一個數量級;預設設定則會花費推理 token,而費率為 $1/$5 的 Haiku 4.5 不會。公開基準測試顯示,Haiku 4.5 在程式設計深度上較有優勢,3.6 Flash 則在數學能力與原始 token 價格上領先。應依流量組成選擇,正式採用前也要使用自己的任務實測兩者。

Gemini 3.6 Flash 比 3.5 Flash 便宜嗎?

是。我們測量的所有工作負載中,3.6 都比較便宜,但差距取決於任務型態。輸出費率從 $9/M 降至 $7.50/M,而且在重推理短任務中,3.6 使用的輸出 token 也較少,因此成本下降約 32%;在代理流量中,它使用的 token 稍多,節省的成本只來自費率調降,約為 6%。無論哪種情況都更便宜,但遷移後仍應重新測量自己的工作負載組合。如需比較不同模型系列的每 token 成本結構,請參閱我們的 token 用量結構 研究。

本次測量於 2026-07-24 經由 Synthorai 閘道進行,使用 gemini-3.6-flashgemini-3.5-flashgemini-3.5-flash-lite。任務矩陣與代理工作套件的 token 數量取自逐次呼叫的用量紀錄;推理檔位結果來自加入隨機內容的五任務消融測試(每個組合 n=3);上下文與快取則透過召回針和前綴掃描測試。正確率只統計具有單一可驗證答案的任務。價格與行為可能變更,請以自己的用量紀錄確認。

← 返回部落格