新人 免费注册,送 10 次调用,最高 $1,免绑卡。

DeepSeek V4.1 Flash API 成本:准确率持平 V4 Pro,便宜 3-6 倍

目录
  1. 9 月 10 日发生了什么变化,V4.1 Flash 多少钱?
  2. V4.1 Flash 真的能追平 V4 Pro,并超过 V4 Flash 吗?
  3. Effort 档位有什么作用,可以关闭 thinking 吗?
  4. 如果询问不存在的事物,会发生什么?
  5. V4 Flash 的 JSON 损坏问题修复了吗?
  6. V4.1 Flash 的图像输入成本是多少?
  7. Synthorai 如何接入
  8. 常见问题

DeepSeek V4.1 Flash 峰时每百万输入 token 收费 $0.30,每百万输出 token 收费 $1.20,非峰时减半。我们选取了 11 项答案可验证的任务,每项运行 3 次,它以 33/33 全部答对,与 V4 Pro 得分相同,但每个正确答案的成本低 3-6x,输出速度快 2.9x。与被它取代的 V4 Flash 相比,每个正确答案便宜 26%,速度快 1.5x,也是第一个能读图的 Flash。使用时还要处理两种行为:关闭 thinking 后,它会用一个错误 token 回答多步算术题;开启 thinking 后,问到不存在的事物时它会耗尽整个输出窗口,5 次运行中有 3 次用完了 16,384 个 token。发布 4 天后,我们在同一小时内通过同一 gateway 批量测试了 deepseek-v4.1-flashdeepseek-v4-pro-0813,并在当天晚上测试了 deepseek-v4-flash-0731

TL;DR

  • V4.1 Flash 峰时价格为每百万 token $0.30/$1.20,非峰时减半;V4 Pro 为 $1.32/$3.96。
  • 开启 thinking 后,三个版本均答对 33/33;V4.1 Flash 每个正确答案的成本为 $0.00097 到 $0.00149,比 V4 Pro 低 3-6x,比 V4 Flash 低 26%。
  • 关闭 thinking 后,三个版本都降至 21/33;V4.1 Flash 此时只会返回一个错误 token。
  • 面对 5 个虚构实体时,开启 thinking 的 V4.1 Flash 有 3 次触及 16,384-token 上限,另有 2 次编造答案;关闭 thinking 后,5 次全部拒答。

9 月 10 日发生了什么变化,V4.1 Flash 多少钱?

新架构、新价格,以及旧版本退役。V4.1 Flash 是“新架构系列中最小的模型”:总参数量 552B,采用因果 encoder-decoder 架构,一组 20 层网络读取 prompt,另一组生成答案。输入时每个 token 激活 8B 参数,输出时激活 16B 参数。它原生支持图像输入,context window 为 1M token,输出上限为 384K,并采用 MIT 许可。DeepSeek 的价格页面显示,峰时每百万输入 token 收费 $0.30,每百万输出 token 收费 $1.20。峰时为周一至周五 UTC 01:00 到 04:00,以及 06:00 到 10:00。非峰时价格为 $0.15 和 $0.60,缓存命中则为 $0.006 和 $0.003。这个价格介于 V4 Flash 之前的两档价格之间:7 月发布时固定为 $0.14/$0.28,2026-08-16 起峰时调整为 $0.44/$1.32。它也明显低于 V4 Pro 的峰时价格 $1.32/$3.96。

V4 Flash 和 Vision Exp 版本现已退役,其模型名称会按 Flash 价格路由到 V4.1 Flash。DeepSeek 原本还计划从 9 月 14 日起把 V4 Pro 的流量也路由到 V4.1 Flash,但更新日志当天以“响应用户需求”为由放弃了这一计划,因此 Pro 继续按 Pro 价格提供。

底层的变化没有价格那么大。三个版本使用相同的 tokenizer,对同一组英文、中文和 Python 语料分别计为 729、452 和 528 个 token,因此原有 token 预算可以直接沿用。缓存页从 1,024 个 token 减半为 512 个,因此一个 549-token 的 prompt 现在会缓存其中 512 个 token。包含一个预埋值的 902K-token prompt 能正确返回该值;超过 1M context window 的 prompt 会收到 400,而不是被静默截断。

根据 DeepSeek 在 model card 中公布的数据,新版 Flash 在所有项目上都优于旧版,在 agent 和编程任务上也超过 Pro,但知识类任务除外:

基准测试测试内容V4 FlashV4.1 FlashV4 Pro
GPQA Diamond研究生水平科学问题89.990.992.4
HLE高难度跨学科问题37.836.842.7
Codeforces竞技编程等级分328934713348
MathArena Apex竞赛数学58.665.665.3
Terminal-Bench 2.1终端中的 agent 任务82.790.687.9
Terminal-Bench 4.0难度更高的终端 agent 任务7.031.212.4
DeepSWE v1.1修复真实代码仓库54.474.262.7
CyberGym安全漏洞任务76.788.183.3
AutomationBench工作流自动化37.754.843.2

本文其余部分只讨论我们能自行验证的内容,也就是表格前半部分中答案可核验的项目,不包括知识类项目。

V4.1 Flash 真的能追平 V4 Pro,并超过 V4 Flash 吗?

在答案可验证的任务上,三个版本得分相同,差异主要体现在价格、速度和失败方式。我们选择了 11 项答案为单个数字、可以直接核验的任务,包括质数求和、数字计数、网格路径、硬币组合、重复应用规则 40 次、计算 7 的 222 次方除以 1000 的余数、进制转换、背包问题,以及统计同时满足 3 个约束条件的四位数。每项任务分别在 reasoning_effortlowhighmax,以及关闭 thinking 的条件下运行 3 次。Reasoning token 是模型在生成答案前写出的隐藏思考内容,按输出 token 计费。每个正确答案的成本,是按各模型峰时价格计算的总费用除以正确答案数。其中 V4 Flash 使用退役前的 $0.44/$1.32 价格。非峰时价格减半:

模型Effort正确数Reasoning token,中位数(最大值)每个正确答案的峰时成本
V4 Flash 0731low33/33492(6,444)$0.00131
V4 Flash 0731high(默认)33/33433(9,172)$0.00163
V4 Flash 0731max33/33453(24,010)$0.00343
V4 Flash 0731关闭 thinking21/330$0.00083
V4.1 Flashlow33/33316(6,153)$0.00097
V4.1 Flashhigh(默认)33/33391(13,300)$0.00149
V4.1 Flashmax33/33391(11,037)$0.00129
V4.1 Flash关闭 thinking21/330$0.00050
V4 Prolow33/33309(6,398)$0.00286
V4 Prohigh(默认)33/33548(18,247)$0.00768
V4 Promax33/33644(15,920)$0.00825
V4 Pro关闭 thinking21/330$0.00232

开启 thinking 后,三个版本在任何 effort 设置下都没有答错,因此这组测试无法区分它们的准确率,只能比较费用和速度。V4.1 Flash 相比 Pro,在 low 下便宜 2.9x,在默认 high 下便宜 5.2x,在 max 下便宜 6.4x;相比 V4 Flash,在 low 下便宜 26%。关闭 thinking 并使用 streaming 后,计时只包含答案生成,不包含思考。V4.1 Flash 的解码速度为每秒 121 到 134 个输出 token,从请求发出到首个 token 用时 1.4 秒;V4 Flash 为每秒 86 到 94 个 token,首个 token 用时 2.3 秒;Pro 为每秒 46 到 49 个 token,首个 token 用时 1.9 秒。在一个两轮 function-calling 循环中,每个版本每轮都只调用一次函数。V4.1 Flash 在两段流程中分别使用 27 和 13 个 reasoning token,V4 Flash 使用 30 和 19 个,Pro 使用 61 和 29 个;每段成本分别为 $0.00019、$0.00030 和 $0.00103。这组测试唯一没有覆盖的是 DeepSeek 表格中 HLE、GPQA 所体现的知识能力差距。

V4 Flash 0731、V4.1 Flash 和 V4 Pro 0813 在 effort 为 low、high、max 以及关闭 thinking 时,每个正确答案成本的横向条形图。V4.1 Flash 在所有设置下都最短;V4 Pro 在 max 下最长,为 $0.00825;关闭 thinking 的条形为红色,并标注三个模型均答对 21/33

Effort 档位有什么作用,可以关闭 thinking 吗?

Effort 档位只会改变少数任务的费用,不会影响答案;关闭 thinking 则会让每个版本在 33 次中少答对 12 次。V4.1 Flash 接受 lowhighmax 三种 reasoning_effort。DeepSeek 会把 minimal 映射到 low,把 mediumxhigh 映射到 high。在 11 项任务中的 9 项上,三个设置之间只相差几百个 reasoning token。只有计数任务,也就是统计满足 3 个约束条件的四位数,差距较大:low 使用 5,650 个,high 使用 9,714 个,max 使用 6,763 个,但答案都正确。从 0 到 1,024 的所有 thinking_budget 值都会被接受,但不会产生任何效果。Model card 中所说的“可连续控制的推理强度设置,整数 1-100”并未开放给 API,传入整数会被拒绝。V4 ProV4 Flash 的行为相同,只是 token 数量不同。在旧版本上,计数任务会让 max 变得昂贵:Pro 使用 12,729 到 15,920 个 reasoning token,V4 Flash 使用 17,866 到 24,010 个,而 V4.1 Flash 只用 6,763 个就得到了相同的正确答案。

下面是两个控制项,以及响应中实测数据的来源:

resp = client.chat.completions.create(
    model="deepseek-v4.1-flash",
    messages=[{"role": "user", "content": prompt}],
    reasoning_effort="low",                    # "low" | "high" | "max"; default "high"
    extra_body={"thinking": {"type": "enabled"}},  # {"type": "disabled"} turns it off
    max_tokens=4096,                           # always set one: see the next section
)
usage = resp.usage
reasoning_tokens = usage.completion_tokens_details.reasoning_tokens  # billed as output
thinking_text = resp.choices[0].message.reasoning_content            # returned on every thinking call

关闭 thinking 是最便宜也最危险的设置,而且三个版本丢失的任务各不相同:

关闭 thinking,11 项任务 x 3V4 Flash 0731V4.1 FlashV4 Pro
正确21/3321/3321/33
完全失败(0/3)背包问题、质数求和、列车时刻表硬币组合、40 步规则、背包问题背包问题、计数任务
失败方式格式正确,但数字错误(17, 104310:40只输出一个错误 token(一个答案为 168 的五步链式任务却返回 83先写出计算过程,再给出错误答案

我们标准题型中的五步链式任务最能体现这个问题:关闭 thinking 后,V4.1 Flash 只答对 1/3,第二组运行则为 0/3;V4 Flash 答对 2/3;Pro 答对 3/3。原因是 Pro 会先写出步骤再给出答案,而两个 Flash 版本不会。预算方面还有两个细节。第一,thinking 模式会添加一段按输入计费的隐藏模板前缀,V4.1 Flash 增加 26 个 prompt token,V4 Flash 和 Pro 增加 79 个;关闭 thinking 时,三个版本对同一文本都计为 729 个 token。第二,把 reasoning_content 放回下一轮请求时不会重复计费。V4.1 Flash 带或不带这部分内容都计为 81 个 prompt token,Pro 则为 134 个。

如果询问不存在的事物,会发生什么?

开启 thinking 后,V4.1 Flash 要么耗尽输出上限,要么编造答案;关闭 thinking 后则会拒答,而且比另外两个版本更可靠。我们针对自行虚构的实体提出了 5 个问题,唯一正确的答案只能是“不知道”。问题包括“Verantis Dynamics”的股价、“Kessler-Fanning Institute”的员工人数、“Oridium-7”的熔点,以及“1987 Pan-Continental Robotics Prize”的获奖者。输出上限设为 16,384 个 token:

模型、设置拒答编造答案触及 16,384-token 上限且无答案Reasoning token
V4.1 Flash,开启 thinking0/52/5(“《辛普森一家》中的 Professor Frink 获得了 1987 年的奖项”;“Oridium-7 的熔点为 1815 °C”)3/52,610;11,905;16,384 x3
V4.1 Flash,关闭 thinking5/50/50/50(69 到 248 个输出 token)
V4 Flash 0731,开启 thinking1/53/5(“0 名员工”;“Oridium-7 约为 1065 °C”;“漫画《Pluto》中的瑞士机器人 Montblanc 获奖”)1/54,080 到 16,384
V4 Flash 0731,关闭 thinking4/51/5(“Oridium-7 的熔点为……”)0/50
V4 Pro,开启 thinking1/53/5(“Andrew Martin 获奖”;“0 名员工”;熔点范围为 899 到 949 °C)1/5754 到 16,384
V4 Pro,关闭 thinking3/52/5(According to reference 844476, the Kessler-Fanning Institute had 247…0/50

开启 thinking 的 5 次 V4.1 Flash 运行中,有 3 次在峰时各花费 $0.0197,并返回空消息。把输出上限改为我们在其他测试中使用的 2,048 个 token 后,5 次全部如此,Pro 也有 4/5 出现同样情况。如果查询本身可能没有答案,应关闭 thinking,或者限制 max_tokens,并把空消息视为“未知”。Pro 在关闭 thinking 时的失败方式不同,适合单独用正则拦截:它会先写出 Let me check that reference for you. According to reference,然后给出一个编造的数字。

V4 Flash 的 JSON 损坏问题修复了吗?

使用 json_object 时,三个版本都没有需要修复的问题;严格 json_schema 则无法测试。V4 Flash 0731 发布时存在一个缺陷:开启 thinking 并使用严格 json_schema 时,13 次运行中有 8 次出现整数字段损坏。在 V4.1 Flash 上,严格 json_schema 通过我们的调用路径会返回 400,而且 DeepSeek 的 JSON 指南只记录了 {"type": "json_object"}

使用 json_object 时,同一张发票中的供应商、日期、总额和明细项目,在开启 thinking 的 8/8 次运行和关闭 thinking 的 8/8 次运行中全部正确,三个版本均如此。V4 Pro 使用严格 json_schema 并开启 thinking 时仍会损坏数据:8 次运行中没有一次返回正确的明细项目数量,结果分别为 45、12、47、1、2026;关闭 thinking 后则为 8/8 全部正确。对于数据抽取,三个版本使用 json_object 并关闭 thinking 时每次都正确;V4.1 Flash 只需 25 个输出 token。

V4.1 Flash 的图像输入成本是多少?

512x512 以内的图像统一使用 184 个输入 token,100 万像素使用 652 个,400 万像素使用 994 个。图像输入是 Flash 系列的新能力。已退役的 Vision Exp 是单独的模型,而 V4 Flash 0731 只接受文本。我们向 V4.1 Flash 发送了生成的 PNG 图像,并减去纯文本 prompt 的 token 数:

图像图像 token峰时成本
64x64、128x128、256x256、512x512184$0.000055
1024x1024652$0.000196
2048x512(面积与 1024x1024 相同)652$0.000196
512x2048688$0.000206
2048x2048994$0.000298

V4.1 Flash 的图像输入 token 数与正方形图像尺寸之间的折线图:从 64 到 512 像素均为 184 个 token,1024 像素为 652 个,2048 像素为 994 个,并按峰时输入费率标注美元成本

最低值与视觉指南一致:“总像素数低于约 544x544 的图像会被放大”,较大的图像则会被缩小到“约等于 1300x1300 图像”的尺寸。文档规定每张图像的上限为 1,024 个 token。内容类型,包括纯色、噪声和渲染文字,以及格式,包括 PNG、JPEG、WebP,文件大小从 174 到 243 KB,都不会改变 token 数。因此计费依据是图像尺寸,而不是字节数。按峰时价格计算,1,000 张 100 万像素图像的图像 token 成本为 $0.20,不含问题和答案。

Synthorai 如何接入

V4.1 Flash 在 gateway 上的模型 ID 为 deepseek-v4.1-flash,DeepSeek 自己的 ID 为 deepseek-flash。全天统一按每百万输入 token $0.30、每百万输出 token $1.20 计费,缓存读取为每百万 token $0.03,不设非峰时价格。本文所有数据均按 DeepSeek 官方价目计算,便于按自己的使用时段换算。V4 Flash 0731V4 Pro 0813 仍分别以 deepseek-v4-flash-0731deepseek-v4-pro-0813 提供,并按各自价格计费。/v1/chat/completions/v1/responses 都支持该模型。通过此调用路径时,thinking: {"type": "disabled"} 可以关闭 thinking;每次开启 thinking 的调用都会在 reasoning_content 中返回推理文本。图像输入通过 image_url content part 传递。

常见问题

DeepSeek V4.1 Flash 比 V4 Flash 便宜吗?

比它取代的 8 月价格便宜,但不低于 7 月首发价格。V4.1 Flash 峰时每百万 token 为 $0.30/$1.20,非峰时为 $0.15/$0.60;V4 Flash 从 8 月中旬起的峰时价格为 $0.44/$1.32,此前则为 $0.14/$0.28。在我们的测试中,V4.1 Flash 使用 low 时每个正确答案成本为 $0.00097,V4 Flash 按退役前价格计算则为 $0.00131。

DeepSeek V4.1 Flash 可以关闭 thinking 吗?

可以,使用 thinking: {"type": "disabled"}。DeepSeek 还记录了 reasoning_effort: "none"。但关闭后会降低多步任务的准确率:V4.1 Flash 在我们的测试中从 33/33 降至 21/33,并用一个错误 token 回答了一项五步链式任务。算术和规划任务应保持开启;数据抽取,以及可能没有答案的查询,应将其关闭。

DeepSeek V4.1 Flash 支持图像输入吗,一张图像要多少钱?

支持,而且是原生支持。在 V4.1 Flash 上,512x512 以内的图像使用 184 个输入 token,1024x1024 使用 652 个,2048x2048 使用 994 个,与内容和格式无关。按峰时官方价格计算,每张图像成本为 $0.000055 到 $0.000298。

相关阅读:DeepSeek V4 Flash 成本DeepSeek V4 Pro 正式版与预览版对比LLM thinking 控制项图像输入 token 成本LLM 结构化输出

← 返回博客