GLM 5.3 API 成本:強制思考,每個答案比 5.2 便宜 2.5 倍
目錄
GLM 5.3 的價格與 GLM 5.2 相同,每百萬個輸入權杖 $1.40、每百萬個輸出權杖 $4.40,但已無法關閉思考。所有停用方式都會回傳 400 錯誤,預設推理強度則是 max。我們用 11 個答案可驗證的任務,各執行 3 次。只有 max 能答對全部 33 題,每個正確答案的成本為 $0.00468。GLM 5.2 在 max 下則是 $0.0117,因此 GLM 5.3 便宜 2.5 倍,原因是它的推理量約少一半。low 的每個正確答案成本低 63%,但 33 題錯了 5 題。GLM 5.3 Flash 答對 31 題,價格只有十分之一。reasoning_effort 用來控制模型回答前的思考時間,現在不只影響成本,也決定準確度。我們在同一批測試中,將兩個版本與 GLM 5.2、DeepSeek V4.1 Flash 進行比較。
TL;DR
- GLM 5.3 與 GLM 5.3 Flash 對
thinking: disabled、reasoning_effort: none和medium都會回傳錯誤碼 1210;只有low、high和max(預設值)可用。 - GLM 5.3 在
max下答對 33/33,每個正確答案成本為 $0.00468;GLM 5.2 在max下則為 $0.01173。 - GLM 5.3 在
low下答對 28/33,GLM 5.3 Flash 則答對 24/33。 - 兩個 GLM 5.3 版本都會忽略嚴格的
json_schema;json_object在 8/8 次測試中都回傳正確值。
GLM 5.3 是什麼?價格多少?
它是以相同價格重新訓練的 GLM 5.2,另外還有一個價格只有十分之一的小型模型。根據 Z.ai 的指南,GLM 5.3「使用與 GLM-5.2 相同的基礎模型,所有改進都來自後訓練」,而且只接受文字輸入。GLM 5.3 Flash「共有 320B 個參數,其中啟用 18B 個」(每個權杖只由 18B 個參數處理,因此成本較低),並支援圖片、影片和檔案。兩者都有 1M 權杖的上下文和 128K 輸出上限。以下是 Z.ai 價格頁面列出的每百萬個權杖價格:
| 模型 | 輸入 | 快取輸入 | 輸出 |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 | $4.40 |
| GLM 5.3 Flash | $0.15 | $0.03 | $0.50 |
| GLM 5.2 | $1.40 | $0.26 | $4.40 |
| DeepSeek V4.1 Flash | $0.30 尖峰 | $0.006 尖峰 | $1.20 尖峰 |
Z.ai 的模型說明和 Flash 指南顯示,主要改進集中在代理和程式開發任務:
| 基準測試 | 測試內容 | GLM 5.2 | GLM 5.3 | GLM 5.3 Flash |
|---|---|---|---|---|
| Terminal Bench 3.0 | 終端機中的代理任務 | 4.6 | 28.3 | 未列出 |
| DeepSWE v1.1 | 修正真實程式碼儲存庫 | 46.2 | 66.9 | 63.4 |
| AutomationBench | 工作流程自動化 | 26.2 | 48.2 | 48.8 |
| CyberGym | 資安漏洞任務 | 77.2 | 84.5 | 未列出 |
| HLE with tools | 可使用工具的高難度問題 | 54.7 | 62.5 | 未列出 |
以下是我們能自行驗證的結果:答案唯一且可檢查的任務,不是代理基準測試。
還能關閉思考嗎?
不能。GLM 5.2 接受 thinking: {"type": "disabled"}。GLM 5.3 和 GLM 5.3 Flash 在收到 thinking: disabled、enable_thinking: false,或將 reasoning_effort 設為 none、minimal、medium、xhigh 時,都會回傳 HTTP 400 和錯誤碼 1210(「此模型一律會思考,不支援關閉思考;請使用 low、high 或 max」)。省略 reasoning_effort 時會使用 max。部分供應商會採用 thinking_budget 限制思考權杖,但 GLM 5.3 只接受參數,不會實際套用。面對同一個問題,從 0 到 1,024 的每個設定都產生約 101 個推理權杖。
resp = client.chat.completions.create(
model="glm-5.3",
messages=[{"role": "user", "content": prompt}],
reasoning_effort="high", # "low" | "high" | "max"; omitted means "max"
max_tokens=8192, # GLM 5.3 Flash rejects anything above 131,072
)
reasoning_tokens = resp.usage.completion_tokens_details.reasoning_tokens # billed as output
thinking_text = resp.choices[0].message.reasoning_content # the thinking itself, as text
舊版的低成本做法本來就不理想。關閉思考後,GLM 5.2 在 33 個任務中只答對 10 個,DeepSeek V4.1 Flash 則答對 22 個。
哪個推理強度能答對?
GLM 5.3 只有 max 可以,GLM 5.3 Flash 則沒有任何設定能全對。我們準備了 11 個答案為單一數字且可驗證的任務,包括質數總和、數字出現次數、網格路徑、硬幣組合、重複套用規則 40 次、7 的 222 次方除以 1000 的餘數、進位轉換、背包問題,以及計算同時符合 3 個限制的四位數。每個任務執行 3 次。推理權杖是模型在回答前寫下但不顯示的思考內容,會以輸出計費。每個正確答案的成本,是依牌價將總花費除以正確答案數:
| 模型 | 推理強度 | 答對 | 推理權杖,中位數(最大值) | 每個正確答案成本 |
|---|---|---|---|---|
| GLM 5.3 | low | 28/33 | 143 (1,826) | $0.00173 |
| GLM 5.3 | high | 29/33 | 226 (1,950) | $0.00197 |
| GLM 5.3 | max(預設) | 33/33 | 538 (7,733) | $0.00468 |
| GLM 5.3 Flash | low | 24/33 | 120 (467) | $0.00012 |
| GLM 5.3 Flash | high | 29/33 | 196 (1,582) | $0.00021 |
| GLM 5.3 Flash | max(預設) | 31/33 | 419 (5,024) | $0.00040 |
| GLM 5.2 | max | 33/33 | 1,129 (21,917) | $0.01173 |
| DeepSeek V4.1 Flash | low | 33/33 | 337 (6,797) | $0.00102 |
| DeepSeek V4.1 Flash | max | 33/33 | 386 (10,769) | $0.00138 |
相較 GLM 5.2 便宜 2.5 倍,原因在於推理量。推理權杖中位數分別為 538 和 1,129,最長一次則分別為 7,733 和 21,917。較低的設定會略過檢查,因此省下成本。在 low 下,GLM 5.3 有兩次將網格路徑數回答為 216(其中一格被封鎖後,正確答案是 132),硬幣組合、背包問題和進位轉換也各錯一次。GLM 5.3 Flash 在 low 下,每次都答錯重複 40 步的規則和受限計數題。相較之下,DeepSeek V4.1 Flash 在所有設定下都是 33/33。
GLM 5.3 遇到算術或多步驟任務時,應保留預設值。只有在錯誤答案容易被攔截時才使用 low。在 max 下,GLM 5.3 每個正確答案的成本是 DeepSeek V4.1 Flash 的 3.4 倍;GLM 5.3 Flash 的成本不到三分之一,但 33 題錯了 2 題。
問題沒有答案時,它會捏造內容嗎?
不會,即使強制啟用思考也是如此。我們詢問 5 個虛構實體,唯一正確的回答是「我不知道」,包括 Verantis Dynamics 的股價、Oridium-7 的熔點,以及 1987 Pan-Continental Robotics Prize 的得主。測試使用預設推理強度,權杖上限為 16,384:
| 模型 | 拒絕回答 | 捏造答案 | 達到上限但答案為空 | 推理權杖 | 每題成本 |
|---|---|---|---|---|---|
| GLM 5.3 | 5/5 | 0/5 | 0/5 | 230 至 542 | $0.0022 |
| GLM 5.3 Flash | 5/5 | 0/5 | 0/5 | 238 至 625 | $0.0003 |
| GLM 5.2 | 5/5 | 0/5 | 0/5 | 134 至 1,559 | $0.0035 |
| DeepSeek V4.1 Flash | 1/5 | 3/5 | 1/5 | 7,021 至 16,384 | $0.0139 |
兩個 GLM 5.3 版本都只用了幾百個推理權杖,就表示沒有相關資訊。DeepSeek V4.1 Flash 會先思考 7,000 至 16,000 個權杖,接著通常捏造答案(Andrew Martin, the robot protagonist of Isaac Asimov's The Bicentennial Man, won)。前一天的獨立測試中,更多執行結果改為達到上限,但它仍很少拒絕回答。查詢結果可能合理為空時,這是我們測得兩個 Flash 級模型之間最大的差異。
GLM 5.3 會遵循 JSON schema 嗎?
不會嚴格遵循,請使用 json_object。在發票擷取測試中,將 response_format 設為嚴格的 json_schema 後,GLM 5.3 和 GLM 5.3 Flash 都回傳 HTTP 200,但 16/16 次執行都忽略 schema。JSON 被包在 Markdown 程式碼區塊中,還包含 schema 未要求的鍵(invoice_date、reference),因此沒有任何結果能解析成指定物件。Z.ai 的 API 參考文件只列出 text 和 json_object。問題在於,API 會默默接受 schema,不會回報錯誤。
改用 {"type": "json_object"},並在提示詞中指定欄位後,兩個版本都在 8/8 次執行中回傳所有正確值,GLM 5.2 和 DeepSeek V4.1 Flash 也一樣。由於思考無法關閉,GLM 5.3 每次擷取的輸出權杖中位數為 240,Flash 為 140;V4.1 Flash 關閉思考後則為 25。請自行根據 schema 驗證結果。
GLM 5.3 Flash 的圖片輸入成本多少?
成本會隨像素面積增加,而且不會在 2048x2048 封頂。因此即使費率較低,大型圖片仍比 DeepSeek V4.1 Flash 更貴。我們將產生的 PNG 傳給 GLM 5.3 Flash(GLM 5.3 僅支援文字),再扣除只有文字提示詞時的權杖數:
| 圖片 | GLM 5.3 Flash 權杖 | 以 $0.15/M 計算的成本 | DeepSeek V4.1 Flash 權杖 | 以 $0.30/M 計算的成本 |
|---|---|---|---|---|
| 512x512 | 363 | $0.000054 | 184 | $0.000055 |
| 1024x1024 | 1,371 | $0.000206 | 652 | $0.000196 |
| 2048x2048 | 5,478 | $0.000822 | 994 | $0.000298 |
超過 512 像素後,GLM 5.3 Flash 約每 766 個像素使用 1 個權杖;detail、圖片內容和檔案格式都不會改變數量。DeepSeek V4.1 Flash 的數據來自前一天的測試。傳送螢幕截圖和文件頁面前應先縮小尺寸。圖片為 2048x2048 時,GLM 5.3 Flash 的單張成本高出 2.8 倍。
相較 GLM 5.2,還有哪些變更?
速度變快,底層介面則幾乎沒變。在同一時段以 low 進行串流測試時,GLM 5.3 每秒產生 59 至 64 個輸出權杖,GLM 5.3 Flash 為 70 至 82 個,GLM 5.2 為 51 至 55 個,DeepSeek V4.1 Flash 則為 124 至 161 個。在兩輪函式呼叫流程中,每個模型每輪都呼叫一次。3 個 GLM 版本對英文、中文和 Python 文字計算出的權杖數完全相同(737、484 和 488),因此權杖預算可以直接沿用。
提示詞中重複的開頭部分會按快取費率計費,並以 64 個權杖為單位計算(1,153 個權杖的提示詞中,有 1,024 個從快取讀取)。兩個版本都能接受接近 1M 權杖上限的提示詞,雖然 Flash 的模型說明寫的是 300,000 個權杖。將一個值藏在 990,000 個權杖提示詞的前段,模型仍能正確回傳(我們沒有測試末尾內容的召回);約 1.07M 個權杖的提示詞則回傳 400 和 Prompt exceeds max length,不會直接截斷。升級時有一項不相容變更:GLM 5.3 Flash 不接受高於 131,072 的 max_tokens。
Synthorai 如何處理這些差異
在閘道上,GLM 5.3、GLM 5.3 Flash 和 GLM 5.2 分別使用 glm-5.3、glm-5.3-flash 和 glm-5.2,套用 Z.ai 牌價,並支援 /v1/chat/completions 和 /v1/responses。錯誤碼 1210 會原樣傳回,因此仍在傳送 GLM 5.2 關閉思考參數的用戶端會直接失敗,不會在不知情下改用 max 思考。推理文字會放在 reasoning_content 中回傳;圖片則透過 image_url 內容區段傳給 GLM 5.3 Flash。
常見問題
可以關閉 GLM 5.3 的思考嗎?
不行。GLM 5.3 和 GLM 5.3 Flash 對任何關閉設定都會回傳 400 和錯誤碼 1210;只接受 low、high 和 max,預設值為 max。在我們的測試中,low 的每個正確答案成本低 63%,但只答對 28/33,而不是 33/33。
GLM 5.3 比 GLM 5.2 便宜嗎?
以每個權杖計算,不是。兩者的輸入價格都是 $1.40,輸出價格都是 $4.40。以每個正確答案計算,則是。在 max 下,GLM 5.3 的成本為 $0.00468,GLM 5.2 則為 $0.01173,因為前者的推理量約少一半。
GLM 5.3 Flash 可以取代 GLM 5.3 嗎?
如果下游能攔截偶爾出現的錯誤數字,可以,而且價格只有十分之一。GLM 5.3 Flash 在 max 下答對 31/33,每個正確答案成本為 $0.00040;GLM 5.3 則答對 33/33,成本為 $0.00468。多步驟算術不要使用 Flash 的 low,該設定只答對 24/33。
相關文章:GLM 5.2 推理強度、GLM 5.2 工具呼叫、DeepSeek V4.1 Flash 成本、LLM 思考控制、LLM 結構化輸出。