🎁 新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。
DeepSeek V4 Flash API 成本:思考模式會破壞嚴格 JSON

DeepSeek V4 Flash API 成本:思考模式會破壞嚴格 JSON

目錄
  1. 三個 V4 版本的規格與實測用量有何差異?
  2. V4 Flash 的思考模式會破壞結構化輸出嗎?
  3. API 接受哪些思考控制參數?
  4. 二步驟數學題實際需要多少思考預算?
  5. 隱式快取能提供什麼?
  6. 1M context 與 384K 輸出上限是真的嗎?
  7. 預覽版、0731 與 Pro:實際由哪個版本回應請求?
  8. 常見問題

DeepSeek V4 Flash 每百萬個輸入 token 收費 $0.14、每百萬個輸出 token 收費 $0.28,快取命中則是 $0.0028。現在以這個名稱提供的 0731 重新訓練版本有一項必須繞開的缺陷:開啟思考模式(預設值)並使用嚴格 json_schema 時,透過兩條獨立請求路徑執行的 13 次預設思考測試中,有 8 次回傳了損毀的整數欄位。關閉思考模式後,每次執行都恢復正常,擷取所用的 token 也降至七分之一。我們在上線首日實測了 deepseek-v4-flash-0731:包括資料損毀、重新訓練後更明顯的關閉思考效能斷崖、可挽救正確率的最低預算、1,024-token 快取頁面,以及它與預覽版本V4 Pro 之間仍有哪些差異。

TL;DR

  • deepseek-v4-flash-0731 在預設思考模式搭配嚴格 json_schema 時,透過兩條請求路徑執行的 13 次測試中,有 8 次整數欄位損毀;V4 Pro 為 4 次中 2 次,只有預覽版本完全正常。
  • 0731 重新訓練版本的關閉思考效能斷崖更明顯:二步驟數學題從 6/6 降至 0/6。
  • 快取從約 1.1K token 的門檻開始,以 1,024-token 頁面提供資料;預熱後 0.3 秒即可命中,項目可保留超過 45 分鐘。
  • enable_thinking: false 讓所有結構化輸出測試恢復正常,token 用量降至七分之一;二步驟數學題的安全思考預算為 256。

三個 V4 版本的規格與實測用量有何差異?

三者使用相同的 tokenizer、快取與思考機制,但價格和失敗模式不同。以下所有數據都來自對三個版本執行的相同探測(破折號表示該項未測);首日分析討論串主要著重 benchmark,本文則比較實際運作特性:

Flash 0731Flash 預覽版V4 Pro
定價,每 1M 輸入/輸出$0.14 / $0.28$0.14 / $0.28$0.435 / $0.87
每 1M 快取命中輸入$0.0028$0.0028$0.003625
預設思考模式開啟開啟開啟
開啟思考模式的嚴格 JSON5/5 損毀(我們的路徑)4/4 正常2/4 損毀
關閉思考模式的二步驟數學題0/62/64/4
thinking_budgettoken 數精準一致token 數精準一致確實套用(設為 16 時 4/4)
快取頁面1,024 個 token,0.3 秒命中相同相同
Tokenizer 與 prompt 額外用量相同,5 個 token相同相同
大海撈針召回測試上限838K 個 token--

V4 Flash 的思考模式會破壞結構化輸出嗎?

0731 版本會,而且這種失敗很隱晦,足以一路進入正式環境。我們以嚴格 json_schema 擷取發票的四個欄位(供應商、日期、總額、明細項目數),在預設思考模式下取得了符合 schema 的有效 JSON,但數值是錯的。文件明明列出三個項目,line_items 卻分別回傳 -1、1、-1 和 -19;透過我們的閘道執行 5 次,沒有一次正確。限制預算也避不開這個問題:64-token 預算的測試出現同樣的損毀;即使預算提高到 256 個 token,3 次中仍有 1 次把明細項目數回傳為 670。損毀取決於是否出現思考內容,而不是思考內容的長度。透過第二條獨立請求路徑執行相同探測時,分兩批共 8 次測試,其中 3 次損毀:一次把文件中的 $520.00 總額回傳為 519.95,另一次把明細項目數回傳為 22。該路徑即使收到停用思考的要求,仍會維持推理,因此下述修正只在主要路徑完成驗證。所有 JSON 都能成功解析,也都通過 schema 驗證,只有值是錯的。對信任驗證結果的資料管線來說,這是最糟的失敗模式。

修正只需要一行:設定 enable_thinking: false 後,每次都回傳正確且有效的 JSON,completion 約使用 44 個 token,預設模式則為 328 個。三個版本的差異很明顯:在相同探測下,預覽版本開啟思考模式仍維持 4/4 正常;V4 Pro 則有 4 次中 2 次損毀。這個問題橫跨 V4 思考系列,其中重新訓練的 Flash 版本最嚴重。它也不是先前已有紀錄的思考模式搭配 schema 問題。vLLM 去年 4 月修正過一個資料傳遞問題:DeepSeek JSON 被放進 reasoning 欄位,而 content 留空;這次資料傳遞正常,但值本身錯誤,問題嚴重得多。在 DeepSeek 修正前,這些模型不應同時使用思考模式與嚴格結構化輸出。這項取捨沒有額外成本:單步擷取正適合關閉思考模式,而且便宜 7 倍。

API 接受哪些思考控制參數?

它提供兩種關閉方式、精確的預算,以及一個無法關閉思考的 effort 設定。我們測試的介面接受 reasoning_effort 值 low、medium、high、xhigh 和 max;不同於 Qwen 3.8 Maxnoneminimal 會遭到拒絕,因此只靠這個設定無法讓模型停止思考。若要關閉思考模式,可使用 enable_thinking: falsethinking: {"type": "disabled"},兩者行為完全相同(簡單問題都使用 9 個 token 作答)。thinking_budget 會精準套用到指定的 token 數,與我們對 Qwen 3.8 的實測完全一致:要求 16,計量結果就是 16。完整思考鏈會透過 reasoning_content 回傳,每次呼叫固定增加的 prompt 用量僅 5 個 token。

另一方面,effort 設定沒有產生任何可測得的效果。在深度質數計數任務中,lowhigh 分別使用 31,374 與 31,370 個推理 token,預設值則為 26,897,三者答案都正確。這只是一般波動,看不出任何上限。Qwen 3.8 的層級是隱藏的預算上限,會在深度工作中實際限制用量;V4 Flash 的層級則在我們測試的所有深度下都沒有差異。對這個模型而言,真正有用的控制項只有關閉開關和 thinking_budget;effort 設定可以視為裝飾。有趣的是,DeepSeek 自己的 model card將 agent benchmark 固定為「max reasoning effort」,但在我們測試的介面上,這個設定與預設值沒有可辨識的差異。

二步驟數學題實際需要多少思考預算?

需要的預算比重新訓練前更多,與我們針對其他模型提出的低成本模式建議正好相反。在可重現的二步驟算術測試中(1850 箱乘以每箱 24 個零件,75% 已出貨,最終抵達 3,120 個),三個 V4 版本的表現像是三個不同模型:

設定0731Flash 預覽版V4 Pro
預設(開啟思考模式)6/66/64/4
關閉思考模式0/62/64/4
thinking_budget: 162/65/64/4
thinking_budget: 645/6--
thinking_budget: 2566/6--

這裡有兩個結論。第一,agent 重新訓練把算術能力移進了思考通道:預覽版本關閉思考後還能勉強作答,0731 則完全失效,Pro 毫無影響。第二,最低預算取決於模型:Qwen 3.8 Max 在同一批題目上只需 16 個思考 token 就能完全恢復,0731 則需要 256。達到 256 後不但全數答對,也比預設模式便宜(completion 總量為 53 至 188,預設模式則為 100 至 200)。將思考預算設定移植到其他模型時,必須重新執行正確率測試;這個控制手段普遍適用,但門檻並不通用。

隱式快取能提供什麼?

它會在很低的門檻後,以 1,024-token 頁面快速提供資料,而且保留時間很長。隨著 prompt 增長,加入 salt 的前綴配對分別命中恰好 1,024、2,048、4,096 和 7,168 個 token,顯示快取以 1,024 為單位進行頁面對齊量化。門檻略高於一頁:704-token prompt 從未命中,1,166-token prompt 則命中 1,024 個。預熱後 0.3 秒就能命中,不需要特別處理建置延遲;項目在 +45 分鐘時仍可提供資料,是我們在這個價格級距測過保留時間最長的隱式快取。Qwen 3.8 Max 的項目會在 15 至 45 分鐘之間失效,最低門檻也接近 4.3K 個 token。DeepSeek 列出的快取命中輸入價格為每百萬個 token $0.0028,是未命中價格的 2%,且寫入不加價。仍應遵循一般的分層原則:穩定前綴放前面,易變內容放後面。

1M context 與 384K 輸出上限是真的嗎?

在所有測試範圍內,context window 都能正常運作:我們把覆寫碼埋在 137,638、465,238 和 838,198 個 prompt token 中,模型都能逐字回傳,耗時 7 至 20 秒。這是我們在此價格級距測過最快的長 context 召回。輸出限制則比文件寬鬆:DeepSeek 公布的最大輸出為 384K 個 token,但 max_tokens 設為 393,217,甚至 524,288 的請求,在思考與非思考模式下都會被接受。這表示 API 不會在收到請求時強制執行該上限,過大的預算也不會明確報錯。若系統依賴輸出上限,請自行設定。

預覽版、0731 與 Pro:實際由哪個版本回應請求?

DeepSeek 的定價頁面現在只列出一個 SKU:deepseek-v4-flash,模型版本為 DeepSeek-V4-Flash-0731,價格維持不變。實務上,部分路由仍會以原本的名稱提供預覽版本。雖然兩者共用 tokenizer,在英文、中文與程式碼語料上的 token 數完全相同,因此預算可以沿用,但仍可從外部行為輕易區分。最明確的指紋是關閉思考探測:在我們的批次中,關閉思考後的二步驟數學題,預覽版約為 2/6,0731 則為 0/6;預覽版也是唯一完整通過結構化輸出探測的版本,成績為 4/4,0731 則是 5/5 損毀,Pro 為 2/4 損毀。如果流量依賴其中任何一種行為,應直接探測實際呼叫的端點,不要只相信名稱。V4 Pro($0.435/$0.87)不受數學能力斷崖影響,但仍有結構化輸出問題。

容量規劃還需注意:三個版本共用的 tokenizer 在相同語料上會比 Qwen 3.8 多產生約 6% 至 9% 的 token。因此,比較不同供應商的預算時,不能只看價目表,還需要參考各語言的 token 密度數據

常見問題

DeepSeek V4 Flash 的結構化輸出安全嗎?

關閉思考模式後是安全的:嚴格 json_schema 會確實執行,我們批次中的每次擷取也都正確。0731 版本使用預設思考模式時,透過兩條請求路徑執行的 13 次測試中,有 8 次整數欄位損毀,但仍通過 schema 驗證。V4 Pro 在相同探測中有 4 次中 2 次損毀,只有預覽版本完全正常。在缺陷修正前,結構化輸出路由應固定設定 enable_thinking: false

可以關閉 DeepSeek V4 Flash 的思考模式嗎?

可以,有兩種寫法:enable_thinking: falsethinking: {"type": "disabled"}。但 0731 重新訓練版本在關閉思考後,處理多步驟工作時很不穩定,二步驟數學題只有 0/6。單步查詢以外的工作,建議將 thinking_budget 的最低值設為 256;實測不但全數答對,也比預設模式便宜。

V4 Flash 快取的最低 prompt 大小是多少?

略高於 1,024 個 token:704-token prompt 從未進入快取,1,166-token prompt 則恰好命中 1,024 個。命中量會以 1,024-token 頁面為單位量化,預熱後 0.3 秒即可命中,並可保留超過 45 分鐘。快取命中輸入的定價為每百萬個 token $0.0028,是未命中價格的 2%。

0731 釋出後有調整價格嗎?

沒有。DeepSeek 維持每百萬個輸入 token(快取未命中)$0.14、快取命中 $0.0028,以及輸出 $0.28,並把 0731 納入現有 deepseek-v4-flash 名稱,作為目前的模型版本。改變的是行為,不是價格:模型更依賴思考模式,也出現上述結構化輸出缺陷。

測量日期為 2026-08-04,透過 Synthorai 閘道對 deepseek-v4-flash-0731 執行(對照組為 deepseek-v4-flash 預覽版與 deepseek-v4-pro):逐次記錄 payload 的嚴格 schema 擷取批次,並透過第二條獨立請求路徑驗證;effort 設定接受度與無效值探測;加入 salt、每組 n=4 至 6 的二步驟正確率批次,以及逐步增加思考預算的恢復測試;以 2.5 秒間隔執行加入 salt 的快取配對,探測門檻、頁面、延遲與時間間隔;在兩種模式下探測 max_tokens 邊界;比較三個版本與 Qwen 3.8 Max 在三套相同語料上的 tokenizer 計數。金額採用文章發布時 DeepSeek 公布的定價;請以自身供應商的計量結果核對。隨著 DeepSeek 持續調整 0731 版本,模型行為可能改變。

← 返回部落格