新人 免费注册,送 10 次调用,最高 $1,免绑卡。

GLM 5.3 API 成本:始终思考,每个正确答案比 5.2 便宜 2.5 倍

目录
  1. GLM 5.3 是什么,价格是多少?
  2. 现在还能关闭思考吗?
  3. 哪个 effort 档位能答对?
  4. 问题本来没有答案时,它会编造吗?
  5. GLM 5.3 会遵循 JSON schema 吗?
  6. GLM 5.3 Flash 处理一张图片要多少钱?
  7. 与 GLM 5.2 相比,还有哪些变化?
  8. Synthorai 如何接入
  9. FAQ

GLM 5.3 的价格与 GLM 5.2 相同,每百万输入 token 为 $1.40,每百万输出 token 为 $4.40,但已经无法关闭思考。任何禁用方式都会返回 400 错误,默认 effort 为 max。我们选了 11 道答案可验证的题目,每道运行 3 次。只有 max 做到了 33/33 全对,单次正确答案成本为 $0.00468。这个数字比使用 max 的 GLM 5.2 低 2.5x,因为 GLM 5.3 使用的推理 token 约少一半。low 的单次正确答案成本低 63%,但 33 次中错了 5 次。GLM 5.3 Flash 做对 31/33,价格只有十分之一。reasoning_effort 用于控制模型回答前的思考时长,现在它既决定成本,也影响准确率。我们在同一批测试中比较了两个 GLM 5.3 版本、GLM 5.2 和 DeepSeek V4.1 Flash

TL;DR

  • GLM 5.3 和 GLM 5.3 Flash 对 thinking: disabledreasoning_effort: nonemedium 都会返回错误 1210;只有 lowhighmax(默认值)可用。
  • 使用 max 时,GLM 5.3 得分为 33/33,单次正确答案成本为 $0.00468;GLM 5.2 使用 max 时为 $0.01173。
  • 使用 low 时,GLM 5.3 得分为 28/33,GLM 5.3 Flash 为 24/33。
  • 两个 GLM 5.3 版本都会忽略严格的 json_schema;使用 json_object 时,8/8 次都返回了正确值。

GLM 5.3 是什么,价格是多少?

它是以相同价格重新训练的 GLM 5.2,另有一个价格仅为十分之一的小型版本。根据 Z.ai 的使用指南,GLM 5.3“使用与 GLM-5.2 相同的基础模型,所有改进都来自后训练”,并且只接受文本输入。GLM 5.3 Flash“总参数量为 320B,每个 token 激活 18B 参数”(每个 token 实际只有 18B 参数参与计算,因此成本更低),支持图片、视频和文件输入。两者都有 1M token 的上下文窗口和 128K token 的最大输出。以下价格来自 Z.ai 的定价页面,单位为每百万 token:

模型输入缓存输入输出
GLM 5.3$1.40$0.26$4.40
GLM 5.3 Flash$0.15$0.03$0.50
GLM 5.2$1.40$0.26$4.40
DeepSeek V4.1 Flash$0.30 峰值$0.006 峰值$1.20 峰值

Z.ai 的模型卡Flash 使用指南显示,主要提升集中在 agent 和编程任务:

Benchmark测试内容GLM 5.2GLM 5.3GLM 5.3 Flash
Terminal Bench 3.0终端中的 agent 任务4.628.3未列出
DeepSWE v1.1修复真实代码仓库46.266.963.4
AutomationBench工作流自动化26.248.248.8
CyberGym安全漏洞任务77.284.5未列出
HLE with tools允许使用工具的高难度问题54.762.5未列出

下面是我们能够自行验证的部分:答案唯一且可检查的任务,不包括 agent benchmark。

现在还能关闭思考吗?

不能。GLM 5.2 支持 thinking: {"type": "disabled"}GLM 5.3GLM 5.3 Flash 遇到 thinking: disabledenable_thinking: false,或者将 reasoning_effort 设为 noneminimalmediumxhigh 时,都会返回 HTTP 400 和错误码 1210,错误信息为 该模型始终思考,不支持关闭思考;请使用 low、high 或 max。省略 reasoning_effort 时,默认使用 max。部分供应商支持用 thinking_budget 限制思考 token,但 GLM 5.3 虽然接受这个参数,实际会忽略它。对同一道题,无论将其设为 0 到 1,024 中的哪个值,模型都会产生约 101 个推理 token。

resp = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": prompt}],
    reasoning_effort="high",   # "low" | "high" | "max"; omitted means "max"
    max_tokens=8192,           # GLM 5.3 Flash rejects anything above 131,072
)
reasoning_tokens = resp.usage.completion_tokens_details.reasoning_tokens  # billed as output
thinking_text = resp.choices[0].message.reasoning_content                # the thinking itself, as text

旧版的低成本方案本来也不好用:关闭思考后,GLM 5.2 在 33 次测试中只答对 10 次,DeepSeek V4.1 Flash 只答对 22 次。

哪个 effort 档位能答对?

对 GLM 5.3 来说,只有 max 可以;GLM 5.3 Flash 没有任何档位能全部答对。我们准备了 11 道答案为单个数字、可以直接验证的题目,每道运行 3 次。题目包括质数求和、数字计数、网格路径、硬币组合、将一条规则重复应用 40 次、计算 7 的 222 次方除以 1000 的余数、进制转换、背包问题,以及统计同时满足 3 个约束的四位数。推理 token 是模型在输出答案前生成的隐藏思考内容,按输出 token 计费。单次正确答案成本按标价计算,即总费用除以正确答案数:

模型Effort正确次数推理 token,中位数(最大值)单次正确答案成本
GLM 5.3low28/33143(1,826)$0.00173
GLM 5.3high29/33226(1,950)$0.00197
GLM 5.3max(默认)33/33538(7,733)$0.00468
GLM 5.3 Flashlow24/33120(467)$0.00012
GLM 5.3 Flashhigh29/33196(1,582)$0.00021
GLM 5.3 Flashmax(默认)31/33419(5,024)$0.00040
GLM 5.2max33/331,129(21,917)$0.01173
DeepSeek V4.1 Flashlow33/33337(6,797)$0.00102
DeepSeek V4.1 Flashmax33/33386(10,769)$0.00138

GLM 5.3、GLM 5.3 Flash、GLM 5.2 和 DeepSeek V4.1 Flash 在 low、high 和 max 档位下的单次正确答案成本柱状图,并标注 33 次测试中的正确次数。GLM 5.3 只有使用 max 才能达到 33/33,成本为 $0.00468;GLM 5.2 使用 max 时为 $0.01173;GLM 5.3 Flash 最便宜,但最多只能达到 31/33

相对 GLM 5.2 的 2.5x 差距来自推理量:推理 token 中位数分别为 538 和 1,129,最长一次分别为 7,733 和 21,917。较低档位通过省略检查步骤来降低成本。使用 low 时,GLM 5.3 有两次将网格路径数量答成 216,但由于其中一个单元格被阻塞,正确答案应为 132;硬币组合、背包问题和进制转换也各错了一次。GLM 5.3 Flash 使用 low 时,40 步规则题和约束计数题每次都答错。相比之下,DeepSeek V4.1 Flash 在所有档位都取得了 33/33。

只要任务涉及算术或多个步骤,GLM 5.3 就应保留默认设置。只有当错误答案容易被后续流程发现时,才适合使用 low。使用 max 时,GLM 5.3 的单次正确答案成本是 DeepSeek V4.1 Flash 的 3.4x;GLM 5.3 Flash 的成本不到其三分之一,但 33 次中错了 2 次。

问题本来没有答案时,它会编造吗?

不会,即使无法关闭思考也是如此。我们构造了 5 个虚假实体,并针对它们提问,因此唯一正确的回答是“我不知道”(例如 Verantis Dynamics 的股价、Oridium-7 的熔点,以及 1987 Pan-Continental Robotics Prize 的获奖者)。测试使用默认 effort,并将 token 上限设为 16,384:

模型拒绝作答编造答案达到上限且答案为空推理 token单题成本
GLM 5.35/50/50/5230 到 542$0.0022
GLM 5.3 Flash5/50/50/5238 到 625$0.0003
GLM 5.25/50/50/5134 到 1,559$0.0035
DeepSeek V4.1 Flash1/53/51/57,021 到 16,384$0.0139

两个 GLM 5.3 版本都只用了几百个推理 token,就明确表示没有相关信息。DeepSeek V4.1 Flash 会先思考 7,000 到 16,000 个 token,然后通常会编造内容(Andrew Martin, the robot protagonist of Isaac Asimov's The Bicentennial Man, won)。在前一天对它进行的单独测试中,更多请求直接达到了 token 上限,但它同样很少拒绝作答。对于确实可能查不到结果的查询,这是我们在两个 Flash 档模型之间测得的最大差异。

GLM 5.3 会遵循 JSON schema 吗?

不会严格遵循,应使用 json_object。我们通过 response_format 为发票提取任务设置了严格的 json_schemaGLM 5.3GLM 5.3 Flash 在 16/16 次运行中都返回 HTTP 200,但完全忽略了 schema。返回的 JSON 被包在 Markdown 代码块中,还包含 schema 未要求的字段(invoice_datereference),因此没有任何一次能解析为要求的对象。Z.ai 的 API 参考文档只列出了 textjson_object。问题在于,API 会静默接受 schema,而不是直接报错。

改用 {"type": "json_object"},并在 prompt 中写明字段后,两个版本都在 8/8 次运行中返回了全部正确的值,GLM 5.2DeepSeek V4.1 Flash 也是如此。由于思考始终开启,GLM 5.3 完成提取时的输出 token 中位数为 240,Flash 为 140;关闭思考的 V4.1 Flash 只需要 25。你仍需自行根据 schema 验证结果。

GLM 5.3 Flash 处理一张图片要多少钱?

token 数会随像素面积增加,而且不会在 2048x2048 处封顶。因此即使费率更低,处理大图时仍然比 DeepSeek V4.1 Flash 更贵。我们向 GLM 5.3 Flash 发送了生成的 PNG 图片(GLM 5.3 仅支持文本),然后减去纯文本 prompt 的 token 数:

图片GLM 5.3 Flash token按 $0.15/M 计算的成本DeepSeek V4.1 Flash token按 $0.30/M 计算的成本
512x512363$0.000054184$0.000055
1024x10241,371$0.000206652$0.000196
2048x20485,478$0.000822994$0.000298

方形图片尺寸与图片输入 token 数的折线图:GLM 5.3 Flash 的 token 数随像素面积增加,在 2048x2048 时达到 5,478;DeepSeek V4.1 Flash 在 512x512 以内保持为 184,最高达到 994

尺寸超过 512 像素后,GLM 5.3 Flash 平均每 766 个像素使用约 1 个 token;detail、图片内容和文件格式都不会改变计数。DeepSeek V4.1 Flash 的数据来自前一天对该模型的测试。发送截图和文档页面前应先缩小尺寸:在 2048x2048 下,GLM 5.3 Flash 的单张图片成本高出 2.8x。

与 GLM 5.2 相比,还有哪些变化?

速度有所提升,接口机制基本没变。在同一时间窗口内使用 low 进行 streaming 时,GLM 5.3 每秒生成 59 到 64 个输出 token,GLM 5.3 Flash 为 70 到 82,GLM 5.2 为 51 到 55,DeepSeek V4.1 Flash 为 124 到 161。在两轮 function calling 循环中,每个模型每轮都发起一次调用。3 个 GLM 版本对英文、中文和 Python 文本的 token 计数完全相同,分别为 737、484 和 488,因此现有 token 预算可以直接沿用。

prompt 中重复出现的开头部分按缓存费率计费,缓存 token 以 64 个为步长计算(一个 1,153 token 的 prompt 中,有 1,024 个 token 命中缓存)。两个版本都能接受接近 1M token 上限的 prompt,尽管 Flash 模型卡上写的是 300,000 token。我们在约 990,000 token 的 prompt 前部隐藏了一个值,模型成功返回了该值(我们没有测试末尾内容的召回);当 prompt 增加到约 1.07M token 时,API 返回 400 和 Prompt exceeds max length,而不是静默截断。升级时有一处不兼容:GLM 5.3 Flash 不接受高于 131,072 的 max_tokens

Synthorai 如何接入

GLM 5.3GLM 5.3 FlashGLM 5.2 在网关中的模型 ID 分别为 glm-5.3glm-5.3-flashglm-5.2,按 Z.ai 标价计费,并通过 /v1/chat/completions/v1/responses 提供服务。错误 1210 会原样透传,因此仍在发送 GLM 5.2 关闭参数的客户端会直接失败,而不会静默切换到 max 进行思考。推理文本通过 reasoning_content 返回;发送给 GLM 5.3 Flash 的图片使用 image_url content part。

FAQ

GLM 5.3 可以关闭思考吗?

不能。GLM 5.3GLM 5.3 Flash 对所有关闭方式都会返回 400 和错误 1210;只接受 lowhighmax,默认值为 max。在我们的测试中,low 的单次正确答案成本低 63%,但正确次数从 33/33 降至 28/33。

GLM 5.3 比 GLM 5.2 便宜吗?

按 token 计算,不便宜:两者的输入价格都是 $1.40,输出价格都是 $4.40。按单次正确答案计算,更便宜:使用 max 时,GLM 5.3 的成本为 $0.00468,GLM 5.2 为 $0.01173,因为前者使用的推理 token 约少一半。

GLM 5.3 Flash 能替代 GLM 5.3 吗?

如果偶尔出现的数字错误能被下游流程发现,可以,价格只有十分之一。GLM 5.3 Flash 使用 max 时得分为 31/33,单次正确答案成本为 $0.00040;GLM 5.3 则以 $0.00468 的成本取得 33/33。多步算术任务不应使用 Flash 的 low,该设置只答对了 24/33。

相关内容:GLM 5.2 的 reasoning effortGLM 5.2 的 tool callDeepSeek V4.1 Flash 成本LLM 思考控制LLM 结构化输出

← 返回博客