DeepSeek V4.1 Flash API 成本:答對率同 Pro,每題省 3-6x
目錄
DeepSeek V4.1 Flash 尖峰時段每百萬個輸入 token 收費 $0.30、輸出 token 收費 $1.20,離峰價格減半。我們選了 11 個答案可驗證的任務,每題各跑 3 次,結果 33/33 全部答對,和 V4 Pro 相同,但每個正確答案的成本低 3 到 6x,輸出速度快 2.9x。和它取代的 V4 Flash 相比,每個正確答案便宜 26%、速度快 1.5x,也是第一個能讀取圖片的 Flash。不過,有兩種行為需要在系統設計時處理:關閉思考後,它會用一個錯誤 token 回答多步驟算術題;開啟思考後,遇到不存在事物的問題,則可能耗盡整個輸出視窗,5 次測試中有 3 次用滿 16,384 個 token。我們在發布 4 天後,於同一批次、同一小時、同一閘道測試 deepseek-v4.1-flash 和 deepseek-v4-pro-0813,並在當晚測試 deepseek-v4-flash-0731。
TL;DR
- V4.1 Flash 尖峰價格為每百萬個 token $0.30/$1.20,離峰減半;V4 Pro 為 $1.32/$3.96。
- 開啟思考後,3 個版本都拿到 33/33;V4.1 Flash 每個正確答案成本為 $0.00097 到 $0.00149,比 V4 Pro 低 3 到 6x,也比 V4 Flash 低 26%。
- 關閉思考後,3 個版本都降到 21/33;V4.1 Flash 此時只會回傳一個錯誤 token。
- 面對 5 個虛構實體時,開啟思考的 V4.1 Flash 有 3 次撞上 16,384-token 上限,另有 2 次捏造答案;關閉思考後則 5 次全部拒答。
9 月 10 日改了什麼?V4.1 Flash 要多少錢?
新架構、新價格,以及一個產品退場。V4.1 Flash 是「新架構系列中最小的模型」:共有 552B 個參數,採用因果 encoder-decoder 架構,一組 20 層堆疊負責讀取 prompt,另一組負責產生答案;輸入時每個 token 啟用 8B 個參數,輸出時啟用 16B。它原生支援圖片輸入,context 上限為 1M 個 token,輸出上限為 384K,並採用 MIT 授權。DeepSeek 的價格頁面列出的尖峰價格為每百萬個輸入 token $0.30、輸出 token $1.20,尖峰時段是週一到週五 UTC 01:00 到 04:00,以及 06:00 到 10:00。離峰價格分別為 $0.15 和 $0.60,快取命中則為 $0.006 和 $0.003。這個價格介於 V4 Flash 的兩套費率之間:7 月推出時固定為 $0.14/$0.28,從 2026-08-16 起尖峰調整為 $0.44/$1.32。它也遠低於 V4 Pro 的尖峰價格 $1.32/$3.96。
V4 Flash 和 Vision Exp 版本都已退場,原本的模型名稱會改為導向 V4.1 Flash,並採用 Flash 價格。DeepSeek 原先也計畫從 9 月 14 日起,將 V4 Pro 流量導向 V4.1 Flash;但變更記錄在同一天以「回應使用者需求」為由取消了這項計畫,因此 Pro 會繼續供應,並維持 Pro 價格。
底層介面的變化沒有價格那麼大。3 個版本使用完全相同的 tokenizer,在相同的英文、中文和 Python 語料上分別產生 729、452 和 528 個 token,因此既有的 token 預算可直接沿用。快取分頁從 1,024 個 token 減半為 512,所以一個 549-token prompt 現在會快取其中 512 個 token。我們也測試了一個埋入單一值的 902K-token prompt,模型成功找回該值;超過 1M context 視窗的 prompt 則會回傳 400,不會靜默截斷。
DeepSeek 在模型卡公布的數據顯示,新版 Flash 在所有項目都高於舊版,在 agent 與程式開發任務上也高於 Pro,但知識類任務除外:
| Benchmark | 測試內容 | V4 Flash | V4.1 Flash | V4 Pro |
|---|---|---|---|---|
| GPQA Diamond | 研究所程度的科學問題 | 89.9 | 90.9 | 92.4 |
| HLE | 高難度跨領域問題 | 37.8 | 36.8 | 42.7 |
| Codeforces | 競賽程式設計評分 | 3289 | 3471 | 3348 |
| MathArena Apex | 數學競賽 | 58.6 | 65.6 | 65.3 |
| Terminal-Bench 2.1 | 終端機中的 agent 任務 | 82.7 | 90.6 | 87.9 |
| Terminal-Bench 4.0 | 更困難的終端機 agent 任務 | 7.0 | 31.2 | 12.4 |
| DeepSWE v1.1 | 修復真實軟體儲存庫 | 54.4 | 74.2 | 62.7 |
| CyberGym | 資安漏洞任務 | 76.7 | 88.1 | 83.3 |
| AutomationBench | 工作流程自動化 | 37.7 | 54.8 | 43.2 |
以下內容聚焦於我們能自行驗證的部分,也就是這張表前半段涵蓋的可驗證答案,而不是知識類項目。
V4.1 Flash 真的能追平 V4 Pro,並勝過 V4 Flash 嗎?
在答案可驗證的任務中,3 個版本的分數完全相同,差異只在價格、速度和失敗方式。我們選了 11 個答案為單一數字、可直接驗證的任務,包括質數總和、數字出現次數、網格路徑、硬幣組合、重複套用規則 40 次、計算 7 的 222 次方除以 1000 的餘數、進位轉換、背包問題,以及計算同時滿足 3 項限制的四位數數量。每個任務分別以 reasoning_effort 的 low、high、max 和關閉思考執行 3 次。Reasoning token 是模型在答案前產生、但不直接顯示的思考內容,並按輸出 token 計費。每個正確答案的成本,是各模型在尖峰牌價下的總花費除以正確答案數;V4 Flash 採用退場前的 $0.44/$1.32 費率。離峰價格減半:
| 模型 | Effort | 答對數 | Reasoning token,中位數(最大值) | 每個正確答案成本,尖峰 |
|---|---|---|---|---|
| V4 Flash 0731 | low | 33/33 | 492(6,444) | $0.00131 |
| V4 Flash 0731 | high(預設) | 33/33 | 433(9,172) | $0.00163 |
| V4 Flash 0731 | max | 33/33 | 453(24,010) | $0.00343 |
| V4 Flash 0731 | 關閉思考 | 21/33 | 0 | $0.00083 |
| V4.1 Flash | low | 33/33 | 316(6,153) | $0.00097 |
| V4.1 Flash | high(預設) | 33/33 | 391(13,300) | $0.00149 |
| V4.1 Flash | max | 33/33 | 391(11,037) | $0.00129 |
| V4.1 Flash | 關閉思考 | 21/33 | 0 | $0.00050 |
| V4 Pro | low | 33/33 | 309(6,398) | $0.00286 |
| V4 Pro | high(預設) | 33/33 | 548(18,247) | $0.00768 |
| V4 Pro | max | 33/33 | 644(15,920) | $0.00825 |
| V4 Pro | 關閉思考 | 21/33 | 0 | $0.00232 |
開啟思考後,所有版本在各種 effort 設定下都沒有答錯,因此這組測試無法區分準確度,只能比較費用和速度。V4.1 Flash 相較 Pro,在 low 下便宜 2.9x、預設 high 下便宜 5.2x、max 下便宜 6.4x;相較 V4 Flash,low 下便宜 26%。關閉思考並使用串流輸出時,計時只涵蓋答案產生,不包含思考。V4.1 Flash 每秒可解碼 121 到 134 個輸出 token,從送出請求到第一個 token 為 1.4 秒;V4 Flash 為每秒 86 到 94 個 token,第一個 token 需 2.3 秒;Pro 為每秒 46 到 49 個 token,第一個 token 需 1.9 秒。在兩輪 function-calling 流程中,每個版本每輪都只呼叫一次函式。兩個階段中,V4.1 Flash 分別使用 27 和 13 個 reasoning token,V4 Flash 使用 30 和 19 個,Pro 使用 61 和 29 個;每階段成本分別為 $0.00019、$0.00030 和 $0.00103。DeepSeek 表格中的知識差距,也就是 HLE 和 GPQA,正是這組測試沒有涵蓋的部分。
Effort 設定會改變什麼?可以關閉思考嗎?
Effort 設定只會在少數任務上改變費用,不會改變答案;關閉思考則會讓每個版本少答對 12/33。V4.1 Flash 接受 reasoning_effort 的 low、high 和 max。DeepSeek 會把 minimal 對應到 low,把 medium 和 xhigh 對應到 high。11 個任務中有 9 個在 3 種設定下的 reasoning token 差距只有數百個,只有計數任務,也就是計算滿足 3 項限制的四位數數量,差距明顯:low 使用 5,650 個、high 使用 9,714 個、max 使用 6,763 個,答案全部正確。從 0 到 1,024 的所有 thinking_budget 值都會被接受,但完全不生效。模型卡所稱的「可連續控制的 reasoning effort 設定,整數 1-100」並未出現在 API 上,傳入整數會遭到拒絕。V4 Pro 和 V4 Flash 的行為相同,只是 token 數不同。舊版模型在計數任務使用 max 時成本尤其高:Pro 使用 12,729 到 15,920 個 reasoning token,V4 Flash 使用 17,866 到 24,010 個,而 V4.1 Flash 只用 6,763 個就得到相同的正確答案。
以下是兩種控制方式,以及如何從回應取得實測數據:
resp = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{"role": "user", "content": prompt}],
reasoning_effort="low", # "low" | "high" | "max"; default "high"
extra_body={"thinking": {"type": "enabled"}}, # {"type": "disabled"} turns it off
max_tokens=4096, # always set one: see the next section
)
usage = resp.usage
reasoning_tokens = usage.completion_tokens_details.reasoning_tokens # billed as output
thinking_text = resp.choices[0].message.reasoning_content # returned on every thinking call
關閉思考最省錢,也最危險,而且每個版本會在不同任務上失敗:
| 關閉思考,11 個任務 x 3 | V4 Flash 0731 | V4.1 Flash | V4 Pro |
|---|---|---|---|
| 答對 | 21/33 | 21/33 | 21/33 |
| 全部失敗(0/3) | 背包問題、質數總和、火車時刻 | 硬幣組合、40 步規則、背包問題 | 背包問題、計數任務 |
| 失敗方式 | 格式正確但數字錯誤(17, 1043;10:40) | 一個錯誤 token(五步驟鏈的正確答案是 168,卻回傳 83) | 寫出計算過程,最後給出錯誤答案 |
標準題型中的五步驟鏈最能看出差異。關閉思考後,V4.1 Flash 只答對 1/3,另一組重跑則是 0/3;V4 Flash 為 2/3,Pro 為 3/3。原因是 Pro 會在答案前寫出步驟,Flash 版本則不會。預算上還有兩個細節:思考模式會增加一段隱藏的 template prefix,並計入輸入費用。V4.1 Flash 多 26 個 prompt token,V4 Flash 和 Pro 多 79 個;3 個版本關閉思考時,相同文字都是 729 個 token。另外,下一輪送回的 reasoning_content 不會再次計費。V4.1 Flash 無論是否帶回該內容,都是 81 個 prompt token,Pro 則是 134 個。
詢問不存在的事物時會發生什麼?
V4.1 Flash 開啟思考後,不是耗盡輸出上限,就是捏造答案;關閉思考後則會拒答,而且比另外兩個版本更可靠。我們詢問了 5 個自行虛構的實體,因此唯一正確的回答是「我不知道」。問題包括「Verantis Dynamics」的股價、「Kessler-Fanning Institute」的人數、「Oridium-7」的熔點,以及「1987 Pan-Continental Robotics Prize」的得主,輸出上限設為 16,384 個 token:
| 模型、設定 | 拒答 | 捏造答案 | 撞上 16,384-token 上限,沒有答案 | Reasoning token |
|---|---|---|---|---|
| V4.1 Flash,開啟思考 | 0/5 | 2/5(「The Simpsons 的 Professor Frink 贏得 1987 年獎項」;「Oridium-7 的熔點是 1815 °C」) | 3/5 | 2,610;11,905;16,384 x3 |
| V4.1 Flash,關閉思考 | 5/5 | 0/5 | 0/5 | 0(69 到 248 個輸出 token) |
| V4 Flash 0731,開啟思考 | 1/5 | 3/5(「0 名員工」;「Oridium-7 約為 1065 °C」;「漫畫 Pluto 中的瑞士機器人 Montblanc 獲勝」) | 1/5 | 4,080 到 16,384 |
| V4 Flash 0731,關閉思考 | 4/5 | 1/5(「Oridium-7 的熔點是……」) | 0/5 | 0 |
| V4 Pro,開啟思考 | 1/5 | 3/5(「Andrew Martin 獲勝」;「0 名員工」;熔點範圍為 899 到 949 °C) | 1/5 | 754 到 16,384 |
| V4 Pro,關閉思考 | 3/5 | 2/5(According to reference 844476, the Kessler-Fanning Institute had 247…) | 0/5 | 0 |
V4.1 Flash 開啟思考的 5 次測試中,有 3 次在尖峰時段各花費 $0.0197,最後只回傳空訊息。改用我們在其他測試採用的 2,048-token 上限後,5 次全部如此,Pro 也有 4/5 是同樣結果。如果查詢本來就可能沒有答案,應關閉思考,或限制 max_tokens,並把空訊息視為「未知」。Pro 關閉思考後的失敗模式不同,值得另外設一條 regex:它會先寫出 Let me check that reference for you. According to reference,接著捏造一個數字。
V4 Flash 的 JSON 損毀問題修好了嗎?
使用 json_object 時,所有版本都沒有問題需要修;嚴格 json_schema 則無法測試。V4 Flash 0731 發布時有一項缺陷:開啟思考並使用嚴格 json_schema,13 次測試中有 8 次會損毀整數欄位。在 V4.1 Flash 上,嚴格 json_schema 經由我們使用的路徑會回傳 400,而且 DeepSeek 的 JSON 指南只記載 {"type": "json_object"}。
在 json_object 下,同一張發票的供應商、日期、總額和明細項目,3 個版本無論開啟或關閉思考,8/8 次都正確。V4 Pro 使用嚴格 json_schema 並開啟思考時,仍會損毀資料:8 次測試中沒有一次得到正確的明細數量,錯誤值包括 45、12、47、1、2026;關閉思考後則是 8/8 正確。進行資料擷取時,所有版本使用 json_object 並關閉思考都能每次答對;V4.1 Flash 只需要 25 個輸出 token。
V4.1 Flash 的圖片輸入成本是多少?
任何不超過 512x512 的圖片都需要 184 個輸入 token,1 百萬像素需要 652 個,4 百萬像素需要 994 個。圖片輸入是 Flash 系列的新功能,已退場的 Vision Exp 是另一個獨立模型,而 V4 Flash 0731 只接受文字。因此,我們把產生的 PNG 圖片送給 V4.1 Flash,再扣除純文字 prompt 的 token 數:
| 圖片 | 圖片 token | 尖峰成本 |
|---|---|---|
| 64x64、128x128、256x256、512x512 | 184 | $0.000055 |
| 1024x1024 | 652 | $0.000196 |
| 2048x512(面積與 1024x1024 相同) | 652 | $0.000196 |
| 512x2048 | 688 | $0.000206 |
| 2048x2048 | 994 | $0.000298 |
最低值與視覺功能指南一致:「總像素低於約 544x544 的圖片會被放大」,較大的圖片則會縮小到「約等同 1300x1300 圖片的大小」,文件記載的每張圖片上限為 1,024 個 token。內容是純色、雜訊或渲染文字,以及格式是 PNG、JPEG 或 WebP,都不會改變 token 數,檔案大小測試範圍為 174 到 243 KB。因此,計費依據是圖片幾何尺寸,不是位元組數。尖峰時段處理 1,000 張 1 百萬像素圖片,圖片 token 成本為 $0.20,尚未計入問題和答案。
Synthorai 如何提供這個模型
V4.1 Flash 在閘道上的模型名稱是 deepseek-v4.1-flash,DeepSeek 自己的 id 則是 deepseek-flash。全天候費率為每百萬個輸入 token $0.30、輸出 token $1.20,快取讀取為每百萬個 token $0.03,沒有離峰價格。本文所有數字都使用 DeepSeek 公開牌價,方便你依實際使用時段自行換算。V4 Flash 0731 和 V4 Pro 0813 仍分別以 deepseek-v4-flash-0731 和 deepseek-v4-pro-0813 提供,並採用各自費率。/v1/chat/completions 和 /v1/responses 都支援這個模型;在此路徑上,thinking: {"type": "disabled"} 可關閉思考,每次開啟思考的呼叫都會透過 reasoning_content 回傳推理文字。圖片輸入則使用 image_url content part 傳入。
常見問題
DeepSeek V4.1 Flash 比 V4 Flash 便宜嗎?
比它取代的 8 月費率便宜,但不比 7 月首發費率便宜。V4.1 Flash 尖峰價格為每百萬個 token $0.30/$1.20,離峰為 $0.15/$0.60;V4 Flash 從 8 月中起的尖峰價格為 $0.44/$1.32,此前則為 $0.14/$0.28。在我們的測試中,V4.1 Flash 使用 low 時,每個正確答案成本為 $0.00097;V4 Flash 依退場前費率計算則為 $0.00131。
可以關閉 DeepSeek V4.1 Flash 的思考嗎?
可以,設定 thinking: {"type": "disabled"} 即可,DeepSeek 也記載了 reasoning_effort: "none"。但關閉後會降低多步驟任務的準確度:V4.1 Flash 在我們的測試中從 33/33 降到 21/33,並用一個錯誤 token 回答五步驟鏈。算術和規劃任務應保持開啟;資料擷取和可能沒有答案的查詢則應關閉。
DeepSeek V4.1 Flash 支援圖片輸入嗎?一張圖片要多少錢?
支援,而且是原生功能。在 V4.1 Flash 上,圖片不超過 512x512 時需要 184 個輸入 token,1024x1024 需要 652 個,2048x2048 需要 994 個,不受內容和格式影響。按尖峰牌價計算,每張圖片成本為 $0.000055 到 $0.000298。
延伸閱讀:DeepSeek V4 Flash 成本、DeepSeek V4 Pro 正式版與預覽版比較、LLM 思考控制、圖片輸入 token 成本、LLM 結構化輸出。