2026 最佳 Flash LLM API:GLM 性价比最高,Gemini 3.8 最强
目录
2026 年 9 月哪款 Flash 级 LLM API 最好,取决于你的需求:GLM 5.3 Flash 每美元能买到的基准测试分数最高;Gemini 3.8 Flash 综合实力最强,也是处理音频和视频的首选;Claude Sonnet 5 最少编造答案,但价格最高;Seed 2.0 Mini 则是通过我们全部测试的最便宜模型。这里的 Flash 级,指每家厂商旗下小型、快速的模型。我们评估了 16 款模型,发现每家厂商的当前型号都优于上一代小模型,并从标价、缓存价格、输入类型、thinking 控制、独立基准测试、单任务成本和生产环境故障点等方面,对比其中 9 款当前型号。
TL;DR
- 应升级到各厂商的当前型号:Claude Sonnet 5、GPT-5.6 Terra 和 Gemini 3.8 Flash 的每 token 价格高于 Haiku 4.5、GPT-5.4 mini 和 Gemini 3.5 Flash-Lite,但每个正确答案的成本低 2.5 到 3.9 倍。
- 性价比最高:GLM 5.3 Flash,Artificial Analysis 指数为 41.9,单任务成本 $0.25。
- 综合实力和多模态能力最强:Gemini 3.8 Flash。
- 编造答案最少:Claude Sonnet 5,但单任务成本最高。
- 最便宜:Seed 2.0 Mini,价格为 $0.10 / $0.40。
这 9 款模型表现如何,我们怎么测试?
价格和功能来自厂商页面,基准测试来自使用同一套测试框架运行所有模型的独立排行榜。我们的实测只用于判断模型是否达到准入线,不用于排名。排行榜包括 Artificial Analysis(AA)Intelligence Index v4.3 及其 non-hallucination rate(模型在不知道答案时拒绝回答,而不是猜测的比例)、LiveBench、Vals Index,以及 Arena 的文本和 WebDev 投票。我们的测试包含 11 道答案可核验的题目,包括数字计数、质数求和、网格路径、硬币组合、模幂、背包问题等,每题运行 3 次。另有 5 个关于虚构公司、研究所、城镇、合金和奖项的问题,我们会通读回答,判断模型是拒绝作答还是编造答案。Thinking 指模型在输出答案前生成的 reasoning token,这些 token 按输出计费,并通过 reasoning_effort 等字段逐请求设置。所有模型都分别在默认设置和支持的每档 thinking 设置下运行。
| 模型 | AA 指数 | AA non-hallucination | LiveBench | Vals Index | Arena 文本 / WebDev | 我们的测试:默认 / 最佳 | 默认设置下编造答案 |
|---|---|---|---|---|---|---|---|
| GPT-5.6 Terra | 最高档 42.3 | 12.1 | 77.9 | 59.6 | 1466 / 1521 | 31 / 33 | 5 题中 2 题 |
| GLM 5.3 Flash | 41.9 | 72.4 | 71.6 | 47.2 | 1475 / 1607 | 31 / 31 | 5 题中 0 题 |
| Gemini 3.8 Flash | high 时 41.2 | 44.8 | 75.8 | 62.3 | 1493 / 1568 | 32 / 33 | 5 题中 0 题 |
| Qwen3.8 Flash | 39.9 | 54.7 | 76.2 | 未收录 | 未收录 / 1635 | 33 / 33 | 5 题中 2 题 |
| DeepSeek V4.1 Flash | 最高档 39.5 | 3.5 | 81.1 | 57.9 | 未收录 / 1614 | 33 / 33 | 5 题中 4 题 |
| Claude Sonnet 5 | 最高档 38.4 | 60.6 | 76.0 | 59.6 | 1461 / 1537 | 33 / 33 | 5 题中 0 题 |
| GPT-5.6 Luna | 最高档 37.5 | 7.4 | 73.6 | 59.9 | 1453 / 1519 | 31 / 32 | 5 题中 4 题 |
| Hy3 | 25.8 | 25.9 | 未收录 | 未收录 | 1456 / 1513 | 33 / 33 | 5 题中 0 题 |
| Seed 2.0 Mini | 未收录 | 未收录 | 未收录 | 未收录 | 未收录 | 33 / 33 | 5 题中 0 题 |
数据源,读取于 2026-09-17:Artificial Analysis、LiveBench、Vals Index、Arena 文本榜和 Arena WebDev 榜。Arena 使用类似 Elo 的评分,20 分差距很小。Qwen3.8 Flash 在榜单中列为 Qwen3.8-Flash-Next,它是该 API 背后的开放权重模型。测量于 2026-09-16 和 17 进行,其中两款模型在第二天重新运行,以确认两天的数据可比。
没有任何模型在所有榜单上领先:Terra 的指数最高,DeepSeek 在 LiveBench 排名第一,Gemini 3.8 Flash 在 Vals 和 Arena 文本榜领先,Qwen3.8 Flash 则位居 Arena WebDev 榜首。AA non-hallucination rate 与我们 5 道虚构问题的结果基本一致:DeepSeek V4.1 Flash、Luna 和 Terra 很少拒绝回答,GLM 5.3 Flash 和 Sonnet 5 通常会拒绝。Seed 2.0 Mini 没有出现在任何独立榜单中,因此我们的测试是目前唯一证据。
哪些厂商的模型算 Flash 级,是否应该升级到最新型号?
各厂商最新的小模型都算,而且应该升级。Google、DeepSeek、Alibaba、Z.ai、ByteDance 和 Tencent 会直接使用 Flash、Mini,或只提供一款低价模型。Anthropic 当前一代产品线是 Fable、Opus 和 Sonnet,而 Haiku 4.5 已落后一代(发布于 2025 年 10 月,最早在 2026 年 10 月 15 日退役),因此我们把 Claude Sonnet 5 归入 Claude 的 Flash 级。OpenAI 文档将 GPT-5.6 Terra 对应到旧版 mini 档,将 GPT-5.6 Luna 对应到 nano 档。Sonnet 5($2 / $10)和 Terra($2 / $12)的每 token 价格比另外 7 款高出数倍,因此在下文中单独属于一个价格档。
我们还评估了 4 家厂商的上一代小模型,并按每个正确答案的成本评分:33 次运行的总支出除以正确答案数。因此,如果某模型只有一半答案正确,每个正确答案的成本就会翻倍。每组对比都是当前型号胜出。TL;DR 中提到的 3 组模型虽然每 token 更贵,但每个正确答案反而更便宜:
- Claude Sonnet 5 优于 Claude Haiku 4.5。Haiku 只有在最高 thinking 档位才达到 32 / 33;Sonnet 5 在所有开启 thinking 的设置下都达到 33 / 33,并且在其最便宜的
max档,每个正确答案的成本低 2.9 倍。两款模型都拒绝回答全部 5 道虚构问题。 - GPT-5.6 Terra 优于 GPT-5.4 mini。Mini 默认设置只得到 9 / 33,需要调到
high才能达到 33 / 33;Terra 在low档就得到 33 / 33,成本低 2.5 倍。Terra 编造了 2 个答案,而 mini 拒绝了全部 5 道虚构问题。 - Gemini 3.8 Flash 优于 Gemini 3.5 Flash-Lite 和 Gemini 3.7 Flash。与 Flash-Lite 相比,每个正确答案的成本低 3.9 倍;Flash-Lite 回答了 3 道虚构问题,而 3.8 全部拒绝。Flash-Lite 只在单步抽取任务中仍有适用场景。与 3.7 Flash 相比,两者标价相同,3.8 每次调用约贵 10%,因此升级带来的是能力提升,而不是成本节省。
- GPT-5.6 Luna 优于 GPT-5.4 nano,两者同为 31 / 33,但 Luna 每个正确答案的成本约为 nano 的三分之一。Qwen3.8 Flash 也优于 Qwen3.6 Flash 和 Qwen3.5 Flash,后两者使用的 thinking 约多 10 倍,每个正确答案的成本高 6 到 27 倍。
下文只讨论这 9 款当前型号。
这 9 款模型价格如何?
按输出标价可分为 3 档。图中的柱形表示各模型在最佳设置下,每个正确答案的实测成本,因此既能反映低标价,也能反映模型过度 thinking 带来的额外支出。标签列出标价和缓存读取价格,后者表示重复 prompt 前缀的成本占输入价格的比例。
价格档并不能准确预测账单。GPT-5.6 Terra 位于最贵的一档,但每个正确答案的成本低于 Gemini 3.8 Flash,也只比 Seed 2.0 Mini 高约四分之一。模型主动消耗的 thinking token 对成本的影响,与标价本身同样大。价格还会频繁变化,并因时间和地区不同而异:Google 的 3.x Flash 价格将在 2027 年 1 月 1 日翻倍(Gemini 3.8 Flash 调整为 $1.50 / $7.50);DeepSeek 在工作日 UTC 01:00 到 04:00 及 06:00 到 10:00 以外的时段按半价收费;OpenAI 在 7 月将 GPT-5.6 Luna 降价 80%;Qwen3.8 Flash 在 Alibaba 新加坡区域之外便宜 19% 到 25%。测试当天,Synthorai 尚未提供另外 3 款当前小模型,因此未纳入测量:Mistral Small 4($0.15 / $0.60)、StepFun Step 3.7 Flash($0.20 / $1.15)和 Amazon Nova 2 Lite($0.30 / $2.50)。
各模型支持哪些输入,thinking 能否关闭?
9 款模型中有 8 款支持图片,4 款支持视频,2 款支持音频。Hy3 也就是 Tencent 的 Hunyuan 3,只支持文本。最后一列表示在 8 次发票抽取测试中,使用严格 schema 的 JSON 抽取是否返回了正确值。
| 模型 | 输入 | 上下文 / 最大输出 | 开放权重 | thinking 关闭开关 | 默认 thinking | Schema JSON |
|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 文本、图片 | 1M / 128K | 否 | 是 | adaptive、high | 通过 tool call,8/8 |
| GPT-5.6 Terra | 文本、图片 | 1.05M / 128K | 否 | 是 | medium | 8/8 |
| Gemini 3.8 Flash | 文本、图片、音频、视频、PDF | 1M / 64K | 否 | 否 | medium | 8/8 |
| GPT-5.6 Luna | 文本、图片 | 1.05M / 128K | 否 | 是 | medium | 8/8 |
| DeepSeek V4.1 Flash | 文本、图片 | 1M / 384K | MIT | 是 | high | 仅 json_object,8/8 |
| Seed 2.0 Mini | 文本、图片、音频、视频 | 256K / 128K | 否 | 是 | medium | 8/8 |
| Qwen3.8 Flash | 文本、图片、视频 | 1M / 128K | Qwen license | 是 | xhigh | 3/8,整数错误 |
| GLM 5.3 Flash | 文本、图片、视频、文件 | 1M / 128K | MIT | 否 | max | 仅 json_object,8/8 |
| Hy3 | 文本 | 256K / 128K | Apache 2.0 | 是 | high | 仅 json_object,7/8 |
“通过 tool call”表示把 schema 作为工具输入,并强制 Claude 调用该工具。“仅 json_object”表示在我们的请求路径中,严格 schema 无法正确返回,而使用 {"type": "json_object"} 并在 prompt 中明确键名可以。需要音频输入时可选 Gemini 3.8 Flash 或 Seed 2.0 Mini;需要超过 128K 的输出时可选 DeepSeek V4.1 Flash;需要自行托管权重时可选 DeepSeek、GLM、Hy3 或 Qwen3.8 Flash。
完成一个任务要花多少钱,而不是一个 token 多少钱?
单次调用成本取决于价格和模型主动消耗的 token 数。在这个级别中,后者的差异比前者更大。最公平的公开指标是 Artificial Analysis 运行一次指数任务的成本,其中计入 thinking token。9 款模型中有 8 款具备该数据。
GLM 5.3 Flash 的分数与 GPT-5.6 Terra 相差不到 0.5 分,但单任务成本只有后者的五分之一。Qwen3.8 Flash 的标价与 GLM 几乎相同,但每个任务的成本高 50%,因为运行该指数时,它生成了 2.4 亿个输出 token,而 GLM 只生成了 1.8 亿个。Claude Sonnet 5 在 max 档的单任务成本为 $5.09,默认 high 档则为 $1.79,前者只多得到 6 个指数点。我们的单次调用测试也体现了同样的问题:Seed 2.0 Mini 的标价低于 Qwen3.8 Flash,但每个正确答案的成本高 3.4 倍,因为它每道题 thinking 的中位数为 2,810 个 token,而 Qwen 只有 530 个。
缓存读取成本方面,DeepSeek 是输入价格的 2%,Google、OpenAI、Anthropic 和 Alibaba 约为 10%,Z.ai 和 ByteDance 为 20%,Tencent 为 25%。对于 agent 和 RAG 流量(检索增强生成,即每次都把检索出的文档放进 prompt),读取价格决定了主要账单:一个缓存的 100K token 前缀,在 DeepSeek V4.1 Flash 上每次调用只需 $0.0006,而 Sonnet 5 或 Terra 需要 $0.02。OpenRouter 报告称,V4.1 Flash 发布后某一天提供的 token 中,有 90% 是缓存读取(相关帖子)。批处理档会在数小时内返回结果,可将 Gemini 3.8 Flash、GPT-5.6 Luna、Terra 和 Sonnet 5 的价格减半;Qwen3.8 Flash、GLM 5.3 Flash 和 Hy3 没有批处理档。
应该选择哪款 Flash 模型?
追求性价比选 GLM 5.3 Flash,追求综合实力和多模态输入选 Gemini 3.8 Flash,要求尽量少编造答案选 Claude Sonnet 5,追求最低价格选 Seed 2.0 Mini。
| 问题 | 推荐 | 原因 |
|---|---|---|
| 性价比最高 | GLM 5.3 Flash | 指数 41.9,仅次于 Terra,单任务成本 $0.25;9 款中 non-hallucination rate 最高(72.4);价格 $0.15 / $0.50;支持图片、视频和文件输入;MIT 权重 |
| 综合实力最强 | Gemini 3.8 Flash | 9 款中位居 Vals 和 Arena 文本榜首,指数只比 Terra 低 1.1 分,单任务成本低 11%;low 档达到 33 / 33,并拒绝全部虚构问题 |
| 多模态能力最强 | Gemini 3.8 Flash | 支持音频、视频和 PDF 输入,音频按文本价格计费;schema JSON 测试 8 / 8 |
| 编造答案最少且速度快 | Claude Sonnet 5 | 所有开启 thinking 的设置均达到 33 / 33,无论开启还是关闭 thinking 都拒绝全部 5 道虚构问题,首个答案 token 在 2.2 秒内返回;单任务成本最高,适合编造答案造成的损失高于调用成本的场景 |
| 最便宜 | Seed 2.0 Mini | $0.10 / $0.40;默认设置达到 33 / 33,schema JSON 测试 8 / 8,拒绝全部 5 道虚构问题,支持音频和视频输入 |
另外 3 款模型各因一个问题未获推荐。GPT-5.6 Terra 的指数最高,在 low 档达到 33 / 33,每个正确答案成本为 $0.00199,但它按每百万输出 token 收取 $12,却在 5 道题中编造了 2 个答案。DeepSeek V4.1 Flash 位居 LiveBench 榜首,缓存价格也最低,但只支持文本和图片,而且开启 thinking 时在 5 道题中编造了 4 个答案。Qwen3.8 Flash 在我们的测试中以最低成本拿到满分,每个正确答案只需 $0.00046,并位居 Arena WebDev 榜首,但它编造了 2 个答案,在严格 schema 下输出了错误整数,而且生成一篇 400 词说明用了将近 3 分钟。
不要只选一款模型,应按请求类型路由:答案可核验的封闭任务,交给通过测试的最便宜模型(GLM 5.3 Flash、Qwen3.8 Flash、Hy3);开放式事实问题,交给会拒绝回答的模型(GLM 5.3 Flash、Sonnet 5、Gemini 3.8 Flash);较长的 agent 任务,使用预算范围内能力最强的模型。
哪些 Flash 模型在默认设置下不合格?
9 款中有 2 款不合格。只要把开放式问题路由到会拒绝作答的设置,两款都能通过。准入线按模型出厂默认设置计算:33 道任务至少答对 30 道,5 道虚构问题最多编造 2 个答案。
| 模型 | 默认设置下 | 调整 | 调整后 |
|---|---|---|---|
| DeepSeek V4.1 Flash | 5 题中编造 4 题(“50 名员工”“1790 °C”,以及把一名 Simpsons 角色说成获奖者) | 开放式问题关闭 thinking | 5 题全部拒绝,但任务题只得到 21 / 33,因此只能把开放式问题发送到这个设置 |
| GPT-5.6 Luna | 5 题中编造 4 题(“大约 20 名员工”“1974”“1,400 °C”) | 开放式问题关闭 thinking | 5 题中拒绝 4 题,但任务题只得到 7 / 33,因此需要采用相同的路由方式 |
GPT-5.6 Terra 和 Qwen3.8 Flash 刚好踩线,各自编造了 2 个答案(Terra 的回答包括“0 名员工”和“大约 1,455 °C”),因此处理开放式问题时也应采用相同策略。
Flash 模型是否够用,还是需要更大的模型?
对于边界明确的任务,Flash 模型够用。在较短的 agent 基准测试中,模型需要在 shell 中操作真实代码仓库。DeepSeek V4.1 Flash 在 Terminal-Bench 2.1(90.6 对 87.9)和 DeepSWE(74.2 对 62.7)上都超过 DeepSeek V4 Pro。Gemini 3.8 Flash 在 Terminal-Bench 2.1 得到 89.4,也高于 Claude Opus 5 的 89.1。9 款模型都在我们的两轮 tool-calling 循环测试中连续 3 次成功完成任务。
长任务和长上下文仍会拉开差距。在 Terminal-Bench 4.0 中,Google 自己的表格显示 Gemini 3.8 Flash 得分 19.1,Opus 5 则为 51.8。在 OpenAI 针对 512K 到 1M token 上下文的多针检索测试中,GPT-5.6 Luna 得分 41.3,GPT-5.6 Terra 为 72.5。这说明 1M 上下文窗口不等于最小型号能可靠回忆全部 1M token。Flash 模型适合抽取、分类、较短的工具步骤和模式明确的代码修改;长时间 agent 任务的规划,以及针对超长文档的问答,仍应交给更大的模型。
Flash 模型上线后容易在哪里出问题?
问题更多来自默认设置和请求格式,而不是模型能力。
- 两款模型无法关闭 thinking。我们尝试的所有关闭设置,在 Gemini 3.8 Flash 和 GLM 5.3 Flash 上都返回 400。
- 默认值分布在两个极端。GLM 5.3 Flash 默认使用
max,而 Qwen3.8 Flash 默认使用xhigh(Alibaba 文档)。在我们的 5 道虚构问题中,Qwen3.8 Flash 消耗的 reasoning token 中位数为 11,680。Google 会把 thinking 计入max_output_tokens,因此上限过低可能返回被截断甚至为空的答案,但仍然计费(thinking 指南)。 - Claude 使用自己的控制字段。Claude Sonnet 5 通过
output_config.effort设置 thinking 深度,并拒绝旧版budget_tokens(effort 文档);它不支持reasoning_effort参数。 - 工具循环必须回传 reasoning。DeepSeek 的 thinking 模式要求带上前几轮的
reasoning_content(thinking 模式),Gemini 则会在 function-call 部分附加 thought signature。重新构建消息历史的框架可能把两者都丢掉。 - 严格 JSON 的实现并不统一。Qwen3.8 Flash 会遵守 schema 的类型约束,但 8 次测试中有 5 次写入了错误整数(明细项为
-561994)。在 Qwen、GLM、Hy3 和 DeepSeek 上,应使用json_object并在 prompt 中明确键名;Claude 则使用 tool call。 - Thinking 会改变模型是否诚实。DeepSeek V4.1 Flash 开启 thinking 时在 5 道题中编造了 4 个答案,关闭后一个也没有编造。
- 模型 ID 会发生变化。自 9 月 10 日起,
deepseek-v4-flash实际提供的是 V4.1 Flash(价格说明);Claude Haiku 4.5 最早可能在 10 月 15 日退役(弃用说明)。如果存在带日期的快照,应固定到具体版本,例如seed-2-0-mini-260428。 - 开放权重模型在第三方托管商上的表现会有差异。DeepSeek、GLM、Qwen 和 Hy3 由多家提供商托管,量化方式和缓存行为各不相同。9 月还发现有一家转售商把付费请求路由到更便宜的模型(Hacker News)。应将提供商返回的答案与厂商官方 API 对比。
速度更受默认 thinking 设置影响,而不是模型大小。以下是在各模型默认设置下,以 streaming 方式生成一篇 400 词说明的结果。每款运行 3 次,测试日期为 2026-09-17:
| 模型、默认设置 | 首个答案 token | 总耗时 | 每秒输出 token |
|---|---|---|---|
| Claude Sonnet 5 | 2.2 s | 10.5 s | 70 |
| Gemini 3.8 Flash | 10.7 s | 14.3 s | 114 |
| GPT-5.6 Luna | 24.9 s | 26.1 s | 89 |
| GPT-5.6 Terra | 33.3 s | 34.2 s | 63 |
| GLM 5.3 Flash | 36.7 s | 39.3 s | 128 |
| DeepSeek V4.1 Flash | 40.4 s | 40.6 s | 158 |
| Seed 2.0 Mini | 61.3 s | 61.5 s | 81 |
| Hy3 | 123.0 s | 134.5 s | 35 |
| Qwen3.8 Flash | 159.9 s | 165.8 s | 72 |
每秒 token 数统计整次调用中的 reasoning 和答案。Sonnet 5 的 adaptive thinking 在写作任务上没有消耗 reasoning token,因此立即开始输出答案;Qwen3.8 Flash 在同一任务上消耗的 reasoning token 中位数为 10,697。因此,即使某模型处理封闭任务成本很低,面对开放式 prompt 时也可能耗时数分钟。
在 OpenAI 兼容请求中,只需用一个字段设置档位,thinking 消耗会通过 usage 返回:
from openai import OpenAI
client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")
r = client.chat.completions.create(
model="gemini-3.8-flash", # or glm-5.3-flash, gpt-5.6-terra, ...
reasoning_effort="low",
max_tokens=32768,
messages=[{"role": "user", "content": "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer."}],
)
u = r.usage
print(r.choices[0].message.content, u.completion_tokens, u.completion_tokens_details.reasoning_tokens)
对于 Claude Sonnet 5,应把同一请求发送到 Messages API,并设置 output_config: {"effort": "low"}。
Synthorai 如何处理这些差异
以上每款模型都能通过同一 endpoint 的一个 model ID 调用,同时兼容 OpenAI 和 Anthropic API。模型对比页面可将任意两款模型按价格、缓存、输入类型、上下文和厂商基准测试并排比较。9 款模型的当前价格均可在模型价格对比页面查看。
FAQ
Claude Sonnet 5 算 Flash 模型吗? Anthropic 并未这样称呼它,但它是 Claude 当前一代中最小的模型,因为 Claude Haiku 4.5 发布于 2025 年 10 月,并可能从 2026 年 10 月 15 日起退役。Claude Sonnet 5 的价格为 $2 / $10,Haiku 为 $1 / $5,但在我们的测试中,Sonnet 5 每个正确答案的成本低 2.9 倍。
Gemini Flash API 免费吗? Gemini 3.8 Flash 在 Google AI Studio 提供免费档,但 Google 会使用免费档内容改进其产品(价格说明),而且面向 EEA、Switzerland 或 UK 用户的应用只能使用付费服务(服务条款)。付费档在 2026 年 12 月 31 日前为 $0.75 / $3.75,之后调整为 $1.50 / $7.50。
应该使用 Gemini Flash 还是 Flash-Lite? 除非每个请求都只是单步抽取,否则应选 Gemini 3.8 Flash。它在 Artificial Analysis 指数中得到 41.2,而 Gemini 3.5 Flash-Lite 只有 23;在我们的测试中,每个正确答案的成本低 3.9 倍;5 道虚构问题全部拒绝,而 Flash-Lite 回答了 3 道。Flash-Lite 的价格为 $0.30 / $2.50,响应时间约 4 秒。
GPT-5.6 Luna 还是 GPT-5.6 Terra?
高并发量选 GPT-5.6 Luna,高难度 reasoning 选 GPT-5.6 Terra。Luna 的价格为 $0.20 / $1.20,默认设置得到 31 / 33,每个正确答案成本为 $0.00030;Terra 的价格为 $2 / $12,在 low 档得到 33 / 33,每个正确答案成本为 $0.00199,并且是 9 款模型中指数最高的。两款模型在默认设置下都会编造答案,Luna 为 5 题中 4 题,Terra 为 5 题中 2 题。
哪款 Flash 模型最适合编程? Qwen3.8 Flash、DeepSeek V4.1 Flash 和 GLM 5.3 Flash 在 Arena WebDev 中领先,得分分别为 1635、1614 和 1607;DeepSeek 在 LiveBench 的 agentic coding 类别中排名第一,得分 77.3;DeepSeek 和 Claude Sonnet 5 在 Vals 的 Vibe Code Bench 中领先,得分分别为 84.7 和 81.3。
相关阅读:DeepSeek V4.1 Flash API 成本、GLM 5.3 API 成本、Gemini 3.7 Flash API 成本、各提供商的 prompt 缓存对比、按使用场景选择最佳 LLM。