新人 免费注册,送 10 次调用,最高 $1,免绑卡。

2026 最佳 Flash LLM API:GLM 性价比最高,Gemini 3.8 最强

目录
  1. 这 9 款模型表现如何,我们怎么测试?
  2. 哪些厂商的模型算 Flash 级,是否应该升级到最新型号?
  3. 这 9 款模型价格如何?
  4. 各模型支持哪些输入,thinking 能否关闭?
  5. 完成一个任务要花多少钱,而不是一个 token 多少钱?
  6. 应该选择哪款 Flash 模型?
  7. 哪些 Flash 模型在默认设置下不合格?
  8. Flash 模型是否够用,还是需要更大的模型?
  9. Flash 模型上线后容易在哪里出问题?
  10. Synthorai 如何处理这些差异
  11. FAQ

2026 年 9 月哪款 Flash 级 LLM API 最好,取决于你的需求:GLM 5.3 Flash 每美元能买到的基准测试分数最高;Gemini 3.8 Flash 综合实力最强,也是处理音频和视频的首选;Claude Sonnet 5 最少编造答案,但价格最高;Seed 2.0 Mini 则是通过我们全部测试的最便宜模型。这里的 Flash 级,指每家厂商旗下小型、快速的模型。我们评估了 16 款模型,发现每家厂商的当前型号都优于上一代小模型,并从标价、缓存价格、输入类型、thinking 控制、独立基准测试、单任务成本和生产环境故障点等方面,对比其中 9 款当前型号。

TL;DR

  • 应升级到各厂商的当前型号:Claude Sonnet 5、GPT-5.6 Terra 和 Gemini 3.8 Flash 的每 token 价格高于 Haiku 4.5、GPT-5.4 mini 和 Gemini 3.5 Flash-Lite,但每个正确答案的成本低 2.5 到 3.9 倍。
  • 性价比最高:GLM 5.3 Flash,Artificial Analysis 指数为 41.9,单任务成本 $0.25。
  • 综合实力和多模态能力最强:Gemini 3.8 Flash。
  • 编造答案最少:Claude Sonnet 5,但单任务成本最高。
  • 最便宜:Seed 2.0 Mini,价格为 $0.10 / $0.40。

这 9 款模型表现如何,我们怎么测试?

价格和功能来自厂商页面,基准测试来自使用同一套测试框架运行所有模型的独立排行榜。我们的实测只用于判断模型是否达到准入线,不用于排名。排行榜包括 Artificial Analysis(AA)Intelligence Index v4.3 及其 non-hallucination rate(模型在不知道答案时拒绝回答,而不是猜测的比例)、LiveBench、Vals Index,以及 Arena 的文本和 WebDev 投票。我们的测试包含 11 道答案可核验的题目,包括数字计数、质数求和、网格路径、硬币组合、模幂、背包问题等,每题运行 3 次。另有 5 个关于虚构公司、研究所、城镇、合金和奖项的问题,我们会通读回答,判断模型是拒绝作答还是编造答案。Thinking 指模型在输出答案前生成的 reasoning token,这些 token 按输出计费,并通过 reasoning_effort 等字段逐请求设置。所有模型都分别在默认设置和支持的每档 thinking 设置下运行。

模型AA 指数AA non-hallucinationLiveBenchVals IndexArena 文本 / WebDev我们的测试:默认 / 最佳默认设置下编造答案
GPT-5.6 Terra最高档 42.312.177.959.61466 / 152131 / 335 题中 2 题
GLM 5.3 Flash41.972.471.647.21475 / 160731 / 315 题中 0 题
Gemini 3.8 Flashhigh 时 41.244.875.862.31493 / 156832 / 335 题中 0 题
Qwen3.8 Flash39.954.776.2未收录未收录 / 163533 / 335 题中 2 题
DeepSeek V4.1 Flash最高档 39.53.581.157.9未收录 / 161433 / 335 题中 4 题
Claude Sonnet 5最高档 38.460.676.059.61461 / 153733 / 335 题中 0 题
GPT-5.6 Luna最高档 37.57.473.659.91453 / 151931 / 325 题中 4 题
Hy325.825.9未收录未收录1456 / 151333 / 335 题中 0 题
Seed 2.0 Mini未收录未收录未收录未收录未收录33 / 335 题中 0 题

数据源,读取于 2026-09-17:Artificial AnalysisLiveBenchVals IndexArena 文本榜Arena WebDev 榜。Arena 使用类似 Elo 的评分,20 分差距很小。Qwen3.8 Flash 在榜单中列为 Qwen3.8-Flash-Next,它是该 API 背后的开放权重模型。测量于 2026-09-16 和 17 进行,其中两款模型在第二天重新运行,以确认两天的数据可比。

没有任何模型在所有榜单上领先:Terra 的指数最高,DeepSeek 在 LiveBench 排名第一,Gemini 3.8 Flash 在 Vals 和 Arena 文本榜领先,Qwen3.8 Flash 则位居 Arena WebDev 榜首。AA non-hallucination rate 与我们 5 道虚构问题的结果基本一致:DeepSeek V4.1 Flash、Luna 和 Terra 很少拒绝回答,GLM 5.3 Flash 和 Sonnet 5 通常会拒绝。Seed 2.0 Mini 没有出现在任何独立榜单中,因此我们的测试是目前唯一证据。

哪些厂商的模型算 Flash 级,是否应该升级到最新型号?

各厂商最新的小模型都算,而且应该升级。Google、DeepSeek、Alibaba、Z.ai、ByteDance 和 Tencent 会直接使用 Flash、Mini,或只提供一款低价模型。Anthropic 当前一代产品线是 Fable、Opus 和 Sonnet,而 Haiku 4.5 已落后一代(发布于 2025 年 10 月,最早在 2026 年 10 月 15 日退役),因此我们把 Claude Sonnet 5 归入 Claude 的 Flash 级。OpenAI 文档将 GPT-5.6 Terra 对应到旧版 mini 档,将 GPT-5.6 Luna 对应到 nano 档。Sonnet 5($2 / $10)和 Terra($2 / $12)的每 token 价格比另外 7 款高出数倍,因此在下文中单独属于一个价格档。

我们还评估了 4 家厂商的上一代小模型,并按每个正确答案的成本评分:33 次运行的总支出除以正确答案数。因此,如果某模型只有一半答案正确,每个正确答案的成本就会翻倍。每组对比都是当前型号胜出。TL;DR 中提到的 3 组模型虽然每 token 更贵,但每个正确答案反而更便宜:

  • Claude Sonnet 5 优于 Claude Haiku 4.5。Haiku 只有在最高 thinking 档位才达到 32 / 33;Sonnet 5 在所有开启 thinking 的设置下都达到 33 / 33,并且在其最便宜的 max 档,每个正确答案的成本低 2.9 倍。两款模型都拒绝回答全部 5 道虚构问题。
  • GPT-5.6 Terra 优于 GPT-5.4 mini。Mini 默认设置只得到 9 / 33,需要调到 high 才能达到 33 / 33;Terra 在 low 档就得到 33 / 33,成本低 2.5 倍。Terra 编造了 2 个答案,而 mini 拒绝了全部 5 道虚构问题。
  • Gemini 3.8 Flash 优于 Gemini 3.5 Flash-LiteGemini 3.7 Flash。与 Flash-Lite 相比,每个正确答案的成本低 3.9 倍;Flash-Lite 回答了 3 道虚构问题,而 3.8 全部拒绝。Flash-Lite 只在单步抽取任务中仍有适用场景。与 3.7 Flash 相比,两者标价相同,3.8 每次调用约贵 10%,因此升级带来的是能力提升,而不是成本节省。
  • GPT-5.6 Luna 优于 GPT-5.4 nano,两者同为 31 / 33,但 Luna 每个正确答案的成本约为 nano 的三分之一。Qwen3.8 Flash 也优于 Qwen3.6 FlashQwen3.5 Flash,后两者使用的 thinking 约多 10 倍,每个正确答案的成本高 6 到 27 倍。

下文只讨论这 9 款当前型号。

这 9 款模型价格如何?

按输出标价可分为 3 档。图中的柱形表示各模型在最佳设置下,每个正确答案的实测成本,因此既能反映低标价,也能反映模型过度 thinking 带来的额外支出。标签列出标价和缓存读取价格,后者表示重复 prompt 前缀的成本占输入价格的比例。

9 款当前 Flash 级模型分为 3 个价格档的柱状图,每根柱表示最佳 thinking 设置下每个正确答案的实测成本:$10 到 $12 档包括 Claude Sonnet 5 的 $0.00763 和 GPT-5.6 Terra 的 $0.00199;$1.20 到 $3.75 档包括 GPT-5.6 Luna 的 $0.00052、DeepSeek V4.1 Flash 的 $0.00084 和 Gemini 3.8 Flash 的 $0.00234;$0.40 到 $0.53 档包括 GLM 5.3 Flash 的 $0.00041、Qwen3.8 Flash 的 $0.00046、Hy3 的 $0.00069 和 Seed 2.0 Mini 的 $0.00157;Luna 和 DeepSeek 因在默认设置下编造答案而标为红色

价格档并不能准确预测账单。GPT-5.6 Terra 位于最贵的一档,但每个正确答案的成本低于 Gemini 3.8 Flash,也只比 Seed 2.0 Mini 高约四分之一。模型主动消耗的 thinking token 对成本的影响,与标价本身同样大。价格还会频繁变化,并因时间和地区不同而异:Google 的 3.x Flash 价格将在 2027 年 1 月 1 日翻倍(Gemini 3.8 Flash 调整为 $1.50 / $7.50);DeepSeek 在工作日 UTC 01:00 到 04:00 及 06:00 到 10:00 以外的时段按半价收费;OpenAI 在 7 月将 GPT-5.6 Luna 降价 80%;Qwen3.8 Flash 在 Alibaba 新加坡区域之外便宜 19% 到 25%。测试当天,Synthorai 尚未提供另外 3 款当前小模型,因此未纳入测量:Mistral Small 4($0.15 / $0.60)、StepFun Step 3.7 Flash($0.20 / $1.15)和 Amazon Nova 2 Lite($0.30 / $2.50)。

各模型支持哪些输入,thinking 能否关闭?

9 款模型中有 8 款支持图片,4 款支持视频,2 款支持音频。Hy3 也就是 Tencent 的 Hunyuan 3,只支持文本。最后一列表示在 8 次发票抽取测试中,使用严格 schema 的 JSON 抽取是否返回了正确值。

模型输入上下文 / 最大输出开放权重thinking 关闭开关默认 thinkingSchema JSON
Claude Sonnet 5文本、图片1M / 128Kadaptive、high通过 tool call,8/8
GPT-5.6 Terra文本、图片1.05M / 128Kmedium8/8
Gemini 3.8 Flash文本、图片、音频、视频、PDF1M / 64Kmedium8/8
GPT-5.6 Luna文本、图片1.05M / 128Kmedium8/8
DeepSeek V4.1 Flash文本、图片1M / 384KMIThighjson_object,8/8
Seed 2.0 Mini文本、图片、音频、视频256K / 128Kmedium8/8
Qwen3.8 Flash文本、图片、视频1M / 128KQwen licensexhigh3/8,整数错误
GLM 5.3 Flash文本、图片、视频、文件1M / 128KMITmaxjson_object,8/8
Hy3文本256K / 128KApache 2.0highjson_object,7/8

“通过 tool call”表示把 schema 作为工具输入,并强制 Claude 调用该工具。“仅 json_object”表示在我们的请求路径中,严格 schema 无法正确返回,而使用 {"type": "json_object"} 并在 prompt 中明确键名可以。需要音频输入时可选 Gemini 3.8 Flash 或 Seed 2.0 Mini;需要超过 128K 的输出时可选 DeepSeek V4.1 Flash;需要自行托管权重时可选 DeepSeek、GLM、Hy3 或 Qwen3.8 Flash。

完成一个任务要花多少钱,而不是一个 token 多少钱?

单次调用成本取决于价格和模型主动消耗的 token 数。在这个级别中,后者的差异比前者更大。最公平的公开指标是 Artificial Analysis 运行一次指数任务的成本,其中计入 thinking token。9 款模型中有 8 款具备该数据。

Artificial Analysis Intelligence Index 在各模型最高分设置下的单任务成本柱状图,以最便宜模型的倍数表示:Hy3 $0.07(1x,指数 25.8)、GPT-5.6 Luna $0.18(2.4x,37.5)、GLM 5.3 Flash $0.25(3.4x,41.9)、DeepSeek V4.1 Flash $0.27(3.6x,39.5)、Qwen3.8 Flash $0.37(5x,39.9)、Gemini 3.8 Flash $1.24(16.8x,41.2)、GPT-5.6 Terra $1.40(18.9x,42.3)、Claude Sonnet 5 $5.09(68.8x,38.4)

GLM 5.3 Flash 的分数与 GPT-5.6 Terra 相差不到 0.5 分,但单任务成本只有后者的五分之一。Qwen3.8 Flash 的标价与 GLM 几乎相同,但每个任务的成本高 50%,因为运行该指数时,它生成了 2.4 亿个输出 token,而 GLM 只生成了 1.8 亿个。Claude Sonnet 5max 档的单任务成本为 $5.09,默认 high 档则为 $1.79,前者只多得到 6 个指数点。我们的单次调用测试也体现了同样的问题:Seed 2.0 Mini 的标价低于 Qwen3.8 Flash,但每个正确答案的成本高 3.4 倍,因为它每道题 thinking 的中位数为 2,810 个 token,而 Qwen 只有 530 个。

缓存读取成本方面,DeepSeek 是输入价格的 2%,Google、OpenAI、Anthropic 和 Alibaba 约为 10%,Z.ai 和 ByteDance 为 20%,Tencent 为 25%。对于 agent 和 RAG 流量(检索增强生成,即每次都把检索出的文档放进 prompt),读取价格决定了主要账单:一个缓存的 100K token 前缀,在 DeepSeek V4.1 Flash 上每次调用只需 $0.0006,而 Sonnet 5 或 Terra 需要 $0.02。OpenRouter 报告称,V4.1 Flash 发布后某一天提供的 token 中,有 90% 是缓存读取(相关帖子)。批处理档会在数小时内返回结果,可将 Gemini 3.8 FlashGPT-5.6 Luna、Terra 和 Sonnet 5 的价格减半;Qwen3.8 Flash、GLM 5.3 Flash 和 Hy3 没有批处理档。

应该选择哪款 Flash 模型?

追求性价比选 GLM 5.3 Flash,追求综合实力和多模态输入选 Gemini 3.8 Flash,要求尽量少编造答案选 Claude Sonnet 5,追求最低价格选 Seed 2.0 Mini。

问题推荐原因
性价比最高GLM 5.3 Flash指数 41.9,仅次于 Terra,单任务成本 $0.25;9 款中 non-hallucination rate 最高(72.4);价格 $0.15 / $0.50;支持图片、视频和文件输入;MIT 权重
综合实力最强Gemini 3.8 Flash9 款中位居 Vals 和 Arena 文本榜首,指数只比 Terra 低 1.1 分,单任务成本低 11%;low 档达到 33 / 33,并拒绝全部虚构问题
多模态能力最强Gemini 3.8 Flash支持音频、视频和 PDF 输入,音频按文本价格计费;schema JSON 测试 8 / 8
编造答案最少且速度快Claude Sonnet 5所有开启 thinking 的设置均达到 33 / 33,无论开启还是关闭 thinking 都拒绝全部 5 道虚构问题,首个答案 token 在 2.2 秒内返回;单任务成本最高,适合编造答案造成的损失高于调用成本的场景
最便宜Seed 2.0 Mini$0.10 / $0.40;默认设置达到 33 / 33,schema JSON 测试 8 / 8,拒绝全部 5 道虚构问题,支持音频和视频输入

另外 3 款模型各因一个问题未获推荐。GPT-5.6 Terra 的指数最高,在 low 档达到 33 / 33,每个正确答案成本为 $0.00199,但它按每百万输出 token 收取 $12,却在 5 道题中编造了 2 个答案。DeepSeek V4.1 Flash 位居 LiveBench 榜首,缓存价格也最低,但只支持文本和图片,而且开启 thinking 时在 5 道题中编造了 4 个答案。Qwen3.8 Flash 在我们的测试中以最低成本拿到满分,每个正确答案只需 $0.00046,并位居 Arena WebDev 榜首,但它编造了 2 个答案,在严格 schema 下输出了错误整数,而且生成一篇 400 词说明用了将近 3 分钟。

不要只选一款模型,应按请求类型路由:答案可核验的封闭任务,交给通过测试的最便宜模型(GLM 5.3 Flash、Qwen3.8 Flash、Hy3);开放式事实问题,交给会拒绝回答的模型(GLM 5.3 Flash、Sonnet 5、Gemini 3.8 Flash);较长的 agent 任务,使用预算范围内能力最强的模型。

哪些 Flash 模型在默认设置下不合格?

9 款中有 2 款不合格。只要把开放式问题路由到会拒绝作答的设置,两款都能通过。准入线按模型出厂默认设置计算:33 道任务至少答对 30 道,5 道虚构问题最多编造 2 个答案。

模型默认设置下调整调整后
DeepSeek V4.1 Flash5 题中编造 4 题(“50 名员工”“1790 °C”,以及把一名 Simpsons 角色说成获奖者)开放式问题关闭 thinking5 题全部拒绝,但任务题只得到 21 / 33,因此只能把开放式问题发送到这个设置
GPT-5.6 Luna5 题中编造 4 题(“大约 20 名员工”“1974”“1,400 °C”)开放式问题关闭 thinking5 题中拒绝 4 题,但任务题只得到 7 / 33,因此需要采用相同的路由方式

GPT-5.6 TerraQwen3.8 Flash 刚好踩线,各自编造了 2 个答案(Terra 的回答包括“0 名员工”和“大约 1,455 °C”),因此处理开放式问题时也应采用相同策略。

Flash 模型是否够用,还是需要更大的模型?

对于边界明确的任务,Flash 模型够用。在较短的 agent 基准测试中,模型需要在 shell 中操作真实代码仓库。DeepSeek V4.1 Flash 在 Terminal-Bench 2.1(90.6 对 87.9)和 DeepSWE(74.2 对 62.7)上都超过 DeepSeek V4 ProGemini 3.8 Flash 在 Terminal-Bench 2.1 得到 89.4,也高于 Claude Opus 5 的 89.1。9 款模型都在我们的两轮 tool-calling 循环测试中连续 3 次成功完成任务。

长任务和长上下文仍会拉开差距。在 Terminal-Bench 4.0 中,Google 自己的表格显示 Gemini 3.8 Flash 得分 19.1,Opus 5 则为 51.8。在 OpenAI 针对 512K 到 1M token 上下文的多针检索测试中,GPT-5.6 Luna 得分 41.3,GPT-5.6 Terra 为 72.5。这说明 1M 上下文窗口不等于最小型号能可靠回忆全部 1M token。Flash 模型适合抽取、分类、较短的工具步骤和模式明确的代码修改;长时间 agent 任务的规划,以及针对超长文档的问答,仍应交给更大的模型。

Flash 模型上线后容易在哪里出问题?

问题更多来自默认设置和请求格式,而不是模型能力。

  • 两款模型无法关闭 thinking。我们尝试的所有关闭设置,在 Gemini 3.8 FlashGLM 5.3 Flash 上都返回 400。
  • 默认值分布在两个极端。GLM 5.3 Flash 默认使用 max,而 Qwen3.8 Flash 默认使用 xhighAlibaba 文档)。在我们的 5 道虚构问题中,Qwen3.8 Flash 消耗的 reasoning token 中位数为 11,680。Google 会把 thinking 计入 max_output_tokens,因此上限过低可能返回被截断甚至为空的答案,但仍然计费(thinking 指南)。
  • Claude 使用自己的控制字段Claude Sonnet 5 通过 output_config.effort 设置 thinking 深度,并拒绝旧版 budget_tokenseffort 文档);它不支持 reasoning_effort 参数。
  • 工具循环必须回传 reasoning。DeepSeek 的 thinking 模式要求带上前几轮的 reasoning_contentthinking 模式),Gemini 则会在 function-call 部分附加 thought signature。重新构建消息历史的框架可能把两者都丢掉。
  • 严格 JSON 的实现并不统一。Qwen3.8 Flash 会遵守 schema 的类型约束,但 8 次测试中有 5 次写入了错误整数(明细项为 -561994)。在 Qwen、GLM、Hy3 和 DeepSeek 上,应使用 json_object 并在 prompt 中明确键名;Claude 则使用 tool call。
  • Thinking 会改变模型是否诚实DeepSeek V4.1 Flash 开启 thinking 时在 5 道题中编造了 4 个答案,关闭后一个也没有编造。
  • 模型 ID 会发生变化。自 9 月 10 日起,deepseek-v4-flash 实际提供的是 V4.1 Flash(价格说明);Claude Haiku 4.5 最早可能在 10 月 15 日退役(弃用说明)。如果存在带日期的快照,应固定到具体版本,例如 seed-2-0-mini-260428
  • 开放权重模型在第三方托管商上的表现会有差异。DeepSeek、GLM、Qwen 和 Hy3 由多家提供商托管,量化方式和缓存行为各不相同。9 月还发现有一家转售商把付费请求路由到更便宜的模型(Hacker News)。应将提供商返回的答案与厂商官方 API 对比。

速度更受默认 thinking 设置影响,而不是模型大小。以下是在各模型默认设置下,以 streaming 方式生成一篇 400 词说明的结果。每款运行 3 次,测试日期为 2026-09-17:

模型、默认设置首个答案 token总耗时每秒输出 token
Claude Sonnet 52.2 s10.5 s70
Gemini 3.8 Flash10.7 s14.3 s114
GPT-5.6 Luna24.9 s26.1 s89
GPT-5.6 Terra33.3 s34.2 s63
GLM 5.3 Flash36.7 s39.3 s128
DeepSeek V4.1 Flash40.4 s40.6 s158
Seed 2.0 Mini61.3 s61.5 s81
Hy3123.0 s134.5 s35
Qwen3.8 Flash159.9 s165.8 s72

每秒 token 数统计整次调用中的 reasoning 和答案。Sonnet 5 的 adaptive thinking 在写作任务上没有消耗 reasoning token,因此立即开始输出答案;Qwen3.8 Flash 在同一任务上消耗的 reasoning token 中位数为 10,697。因此,即使某模型处理封闭任务成本很低,面对开放式 prompt 时也可能耗时数分钟。

在 OpenAI 兼容请求中,只需用一个字段设置档位,thinking 消耗会通过 usage 返回:

from openai import OpenAI

client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")
r = client.chat.completions.create(
    model="gemini-3.8-flash",          # or glm-5.3-flash, gpt-5.6-terra, ...
    reasoning_effort="low",
    max_tokens=32768,
    messages=[{"role": "user", "content": "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer."}],
)
u = r.usage
print(r.choices[0].message.content, u.completion_tokens, u.completion_tokens_details.reasoning_tokens)

对于 Claude Sonnet 5,应把同一请求发送到 Messages API,并设置 output_config: {"effort": "low"}

Synthorai 如何处理这些差异

以上每款模型都能通过同一 endpoint 的一个 model ID 调用,同时兼容 OpenAI 和 Anthropic API。模型对比页面可将任意两款模型按价格、缓存、输入类型、上下文和厂商基准测试并排比较。9 款模型的当前价格均可在模型价格对比页面查看。

FAQ

Claude Sonnet 5 算 Flash 模型吗? Anthropic 并未这样称呼它,但它是 Claude 当前一代中最小的模型,因为 Claude Haiku 4.5 发布于 2025 年 10 月,并可能从 2026 年 10 月 15 日起退役。Claude Sonnet 5 的价格为 $2 / $10,Haiku 为 $1 / $5,但在我们的测试中,Sonnet 5 每个正确答案的成本低 2.9 倍。

Gemini Flash API 免费吗? Gemini 3.8 Flash 在 Google AI Studio 提供免费档,但 Google 会使用免费档内容改进其产品(价格说明),而且面向 EEA、Switzerland 或 UK 用户的应用只能使用付费服务(服务条款)。付费档在 2026 年 12 月 31 日前为 $0.75 / $3.75,之后调整为 $1.50 / $7.50。

应该使用 Gemini Flash 还是 Flash-Lite? 除非每个请求都只是单步抽取,否则应选 Gemini 3.8 Flash。它在 Artificial Analysis 指数中得到 41.2,而 Gemini 3.5 Flash-Lite 只有 23;在我们的测试中,每个正确答案的成本低 3.9 倍;5 道虚构问题全部拒绝,而 Flash-Lite 回答了 3 道。Flash-Lite 的价格为 $0.30 / $2.50,响应时间约 4 秒。

GPT-5.6 Luna 还是 GPT-5.6 Terra? 高并发量选 GPT-5.6 Luna,高难度 reasoning 选 GPT-5.6 Terra。Luna 的价格为 $0.20 / $1.20,默认设置得到 31 / 33,每个正确答案成本为 $0.00030;Terra 的价格为 $2 / $12,在 low 档得到 33 / 33,每个正确答案成本为 $0.00199,并且是 9 款模型中指数最高的。两款模型在默认设置下都会编造答案,Luna 为 5 题中 4 题,Terra 为 5 题中 2 题。

哪款 Flash 模型最适合编程? Qwen3.8 FlashDeepSeek V4.1 FlashGLM 5.3 Flash 在 Arena WebDev 中领先,得分分别为 1635、1614 和 1607;DeepSeek 在 LiveBench 的 agentic coding 类别中排名第一,得分 77.3;DeepSeek 和 Claude Sonnet 5 在 Vals 的 Vibe Code Bench 中领先,得分分别为 84.7 和 81.3。

相关阅读:DeepSeek V4.1 Flash API 成本GLM 5.3 API 成本Gemini 3.7 Flash API 成本各提供商的 prompt 缓存对比按使用场景选择最佳 LLM

← 返回博客