實測 DeepSeek V4 Pro GA 與 Preview:思考量少 18–62%
DeepSeek V4 Pro 正式版在相同任務上使用的推理 token,比它取代的 Preview 少 18% 到 62%。它修正了可能耗盡整個 8,192 token 輸出視窗的失效模式,也是首個關閉思考後能穩定進行嚴格 JSON 擷取的 Pro 版本。不過,它也失去了 Preview 坦承不知道答案的能力。我們在 GA 上線四天後,以同一批測試比較 deepseek-v4-pro-0813 與 Preview 版本。本文只比較 token 數量,因為 DeepSeek 在測量前一天調整了 V4 定價,並新增尖峰/離峰計費;用兩張持續變動的價目表比較金額,反而不如 token 數量有參考價值。DeepSeek 推出 GA 版本時,沒有發布部落格文章、變更記錄或新聞稿,要確認改了什麼,只能實測。
TL;DR
- GA 每項任務使用的推理 token 少 18–62%;簡單查詢為 18 對 48。
- 兩個版本開啟思考後,都會產生值錯誤的嚴格 JSON(正確率 2/8);只有關閉思考的 GA 能穩定輸出正確結果(8/8)。
- GA 修正了 Preview 的失效模式:設定
thinking_budget: 16時,Preview 在 9 次測試中有 5 次耗盡 8,192 token 輸出視窗;GA 則是 0 次。 - GA 不再明確拒答:面對虛構實體時,Preview 會在 100 到 150 token 內表示無法回答;GA 則會回傳空訊息,或直接捏造答案。
GA 版本的思考量少多少?
少 18% 到 62%,工作越簡單,差距越大。以下是四項標準任務,各執行三次並加入隨機干擾後,推理與完整輸出的 token 中位數:
| 任務 | GA 推理 | Preview 推理 | GA 輸出 | Preview 輸出 | 推理減幅 |
|---|---|---|---|---|---|
| 簡單查詢 | 18 | 48 | 21 | 52 | 62% |
| 兩步驟文字題 | 72 | 139 | 74 | 142 | 48% |
| JSON 擷取 | 78 | 152 | 94 | 174 | 49% |
| 五步驟算術 | 105 | 128 | 107 | 131 | 18% |
每項任務在兩個版本上的正確率都是 3/3,因此這是純粹的效率提升,並非以品質換取成本。容量規劃時要注意這個趨勢:任務越深,節省幅度越小。單步查詢可減少 62%,五步驟推理鏈則只減少 18%。無論兩個版本實際價格如何,差異都呈現這種分布。結構化擷取的改善最大;使用嚴格 json_schema 時,推理 token 從 159 降到 40,減少為四分之一。
切換版本後,快取行為完全相同:兩個版本都會快取 5,000 token 前綴中的 4,096 token,並在預熱請求後 4 秒命中。目前變動的是費率,而不是快取機制。DeepSeek 調高了 V4 系列價格,並自 2026-08-16 16:00 UTC 起導入尖峰/離峰計費,離峰費率減半。將這些 token 數量換算成金額前,請先確認各版本當下的價目表,以及執行時段。
GA 有修正任何可量化的問題嗎?
有,而且修正的是這個系列成本最高的失效模式。對 Preview 版本傳送 thinking_budget: 16 會讓模型失去脈絡:它不會短暫思考後回答,而是陷入重複迴圈(「I’ll output: 168. I’ll output: 168…」),直到耗盡 max_tokens。在相同五步驟任務的 9 次測試中,Preview 有 5 次填滿整個 8,192 token 視窗;GA 則是 0 次,每次都在 79 到 130 token 內正常回答。
這個問題的關鍵就是成本:原本想限制推理量來省錢,最後卻產生 8,193 個輸出 token;正常回答約只需 130 個,相當於為了要求模型少思考,反而付出 63 倍的輸出費用。Preview 使用 64 token 預算也不安全,3 次測試中有 2 次答錯,答案分別為 183 與 174。如果仍固定使用 Preview,並透過小型思考預算控制成本,應優先停用這個組合。
在這裡關閉思考是安全的,但同系列模型不一定都如此:Flash 0731 關閉思考後,兩步驟算術的正確率從 6/6 降到 0/6。兩個 Pro 版本使用 thinking: {"type": "disabled"} 或 enable_thinking: false 時,在五步驟推理鏈上仍維持 3/3。對 Pro 而言,關閉思考不會降低推理任務的正確率,還能修正下文所述的結構化擷取問題。
兩個版本的調整旋鈕都仍只是裝飾。reasoning_effort 接受 low、medium、high、xhigh 與 max;傳入 none 或 minimal 時,會回傳 400 並列出有效選項。在五步驟任務中,GA 各等級使用 76–122 個推理 token,Preview 則使用 116–167 個,沒有單調遞增或遞減的趨勢。正如跨供應商思考控制矩陣的實測結果,DeepSeek 真正有效的控制方式是關閉開關與預算,而不是 enum。
思考仍會破壞嚴格 JSON 嗎?
會,兩個版本都有這個問題,但 GA 首次提供了可靠的解法。我們先前在 DeepSeek V4 Flash 0731 發現這項缺陷:JSON 符合 schema,但數值錯誤。這個問題延續到了 Pro。我們要求兩個版本依照嚴格 json_schema,從三行發票中擷取四個欄位。每種設定各執行 8 次,並檢查實際數值,而非只驗證 schema:
| 版本與設定 | Schema 有效 | 數值正確 |
|---|---|---|
| Preview,開啟思考 | 8/8 | 2/8 |
| Preview,關閉思考 | 8/8 | 2/8 |
Preview,thinking_budget: 256 | 7/8 | 1/8 |
| GA,開啟思考 | 8/8 | 2/8 |
GA,thinking_budget: 256 | 8/8 | 2/8 |
| GA,關閉思考 | 8/8 | 8/8 |
所有失敗結果都能解析、通過 schema 驗證,但內容是錯的。明明只有三個品項,模型回傳的品項數量卻包括 45、22、2026、-4、-35 與 -3864。某次 Preview 回傳的總額是 -139,308,173,307,904;某次 GA 則捏造了另一家公司(「MITRE」,總額 1000)。驗證器會把這些結果全部視為有效 JSON。
實務結論很直接。在 GA 上關閉結構化擷取的思考後,我們每次測試都得到正確結果;這項設定是離開 Preview 的最有力理由。Preview 即使關閉思考,8 次仍有 6 次錯誤。結果與我們對 Flash 的實測一致,關閉思考同樣修正了所有測試結果。這也再次符合思考控制矩陣中的單步驟安全區:擷取不需要推理,而在這個模型系列中,推理反而會破壞結果。
GA 失去了什麼?
它失去了回答「我不知道」的能力。我們詢問五個虛構實體,包括某公司的股價、某研究機構的人數、某城鎮的章程、某合金的熔點,以及某獎項得主。Preview 會在 100 到 150 個輸出 token 內明確表示無法回答,例如:「I don’t have any information about a 1987 Pan-Continental Robotics Prize.」GA 則有兩種反應,而且都沒有用:
| 版本 | 面對虛構實體時的行為 |
|---|---|
| Preview | 5 次中有 2 次在 100–150 token 內拒答並回傳文字;其餘 3 次耗盡視窗 |
| GA(2,048 token 視窗) | 5 次全部將整個視窗用於隱藏推理,最後回傳空白訊息 |
| GA(8,192 token 視窗) | 完成思考後直接捏造:「The Electric Monk won the 1987 Pan-Continental Robotics Prize」 |
發布前,我們透過第二條獨立請求路徑再次驗證。Preview 對抽樣的三個問題全部拒答,使用 101 到 148 個 token。GA 則有一題耗用 8,191 個 token 後回傳空白答案;另一題使用模糊措辭;第三題為不存在的合金斷言具體熔點「2,314 degrees Celsius」。不同用戶端呈現相同的不對稱行為,表示問題來自模型本身。
對檢索管線而言,實際後果是雙重成本:索引中沒有答案的問題,會耗盡整個輸出視窗進行隱藏推理;最後回傳的不是空白,就是驗證器可能照單全收的虛構內容。如果將無法回答的查詢路由到這個模型,請把 max_tokens 設得夠低,讓問題容易察覺且成本可控,並將空白輸出視為未命中,而不是錯誤。
切換後還有其他變化嗎?
變化很少,因此是否切換取決於行為,而不是整合成本。兩個版本都能在單次呼叫中接受 279,000 個輸入 token,並回答藏在中段的針對性問題。兩者也共用同一套系列 tokenizer:相同的英文、中文與程式碼混合語料,在 GA、Preview 與 deepseek-v4-flash-0731 上的計數完全一致,因此 token 預算可原封不動地套用到整個系列。兩個版本都會直接接受 temperature、top_p 與 top_k,也都支援預填 assistant turn,也就是 DeepSeek 文件中的 prefix-completion 功能。
快取行為連分頁單位都完全相同:兩個版本都不會快取 512 token 前綴;超過此門檻後,則以精確的 1,024 token 分頁快取,包括 1,024、2,048 與 4,096。預熱請求後 4 秒即可命中,分頁大小與 Flash 相同。另一個需要釐清的成本問題是:兩個版本都會在 reasoning_content 中回傳完整思考鏈,而把它帶入下一輪不會產生成本。無論上一輪推理是否保留,後續輪次在 GA 都計為相同的 134 個輸入 token,Preview 則是 56 個。某些模型會對保留的推理逐 token 重複計費,但這個系列會直接忽略它。
工具迴圈沒有明顯優勢。在由兩個函式組成的 agent 迴圈中,先查詢事件,再重啟事件指定的服務。GA 第一跳的推理量較多,為 48 對 34;第二跳則較少,為 18 對 35。兩個版本選對工具的比例都是 3/3。考量 DeepSeek 將這次更新定位於 agent 工作負載,逐跳推理量的差異更接近持平,沒有整體效率數字看起來那麼明顯。對會遇到死路的 agent 而言,上述拒答行為更值得注意。
常見問題
GA 版本的執行成本低多少?
以 token 計算,每項任務的推理量減少 18–62%;使用嚴格 json_schema 時則減為四分之一。若要換算金額,請查看目前價目表。DeepSeek 在 2026-08-16 調整 V4 系列價格,並新增尖峰/離峰計費,離峰費率減半。因此,即使 token 數量相同,實際價格也會依版本與時段不同。
GA 在簡單任務還是複雜任務上省得更多?
簡單任務。單步查詢的推理量減少 62%;兩步驟文字題與 JSON 擷取約減少 48%;五步驟算術推理鏈則只有 18%。兩個版本在深層多步驟工作上的差異會縮小;切換版本對淺層、高流量工作負載最划算。
DeepSeek V4 Pro 還適合使用小型思考預算嗎?
Preview 不適合。thinking_budget: 16 會讓它陷入重複迴圈,9 次測試中有 5 次耗盡完整的 8,192 token 輸出視窗。原本想降低成本,結果輸出費用反而約為 63 倍;使用 64 token 時也會答錯。GA 在相同預算下 9 次都正常完成,因此小型預算只有在這個具日期版本上才安全。
DeepSeek V4 Pro 的嚴格 JSON 輸出可信嗎?
只有 GA 關閉思考後可信。每種設定各執行 8 次時,兩個版本開啟思考後,都有 6/8 的 schema 有效回應包含錯誤數字;三個品項的發票,品項數量竟回傳 45、2026 或 -3864。GA 使用 thinking: {"type": "disabled"} 時,8 次全部正確;Preview 即使關閉思考,仍有 6/8 錯誤。不要只驗證 schema,也要驗證實際數值。
DeepSeek V4 Pro 會拒答無法回答的問題嗎?
Preview 會在 100–150 token 內拒答。GA 大多不會:面對虛構實體時,它不是耗盡整個輸出視窗進行思考後回傳空白訊息,就是在視窗較大時斬釘截鐵地捏造答案。請用自己的資料來源驗證,不要因模型沒有拒答就信任結果,並將空白輸出視為未命中。
本次測量於 2026-08-17 透過 Synthorai 閘道完成,當時 GA 版本已上線四天。所有比較都在同一批次重新執行 Preview:調整旋鈕與關閉開關矩陣(7 個 effort 值、5 個 budget、2 個關閉參數,n=3)、四項任務的推理掃描、嚴格 JSON 結構化輸出、兩輪函式呼叫迴圈、使用兩種視窗大小的五題虛構實體探測、四欄位嚴格 JSON 數值完整性探測(每種設定 n=8)、一組推理重播計費比較、兩種等待時間的隱式快取成對測試與快取下限區間測試、包含針對性問題的 279K token 脈絡接受測試、V4 系列固定語料 tokenizer 比較,以及 sampling/prefill/n>1 接受度探測。失控率來自每個版本在 max_tokens: 8192 下的 9 次執行。本文使用 token 數量而非金額,因為 DeepSeek 在本批測試前一天,也就是 2026-08-16,調整 V4 系列定價並導入尖峰/離峰計費。拒答行為與失控問題皆透過第二條獨立請求路徑交叉驗證。費率與行為可能改變;依賴任何單一數字前,請重新測量。