新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

GLM 5.3 API 成本:強制思考,每個答案比 5.2 便宜 2.5 倍

目錄
  1. GLM 5.3 是什麼?價格多少?
  2. 還能關閉思考嗎?
  3. 哪個推理強度能答對?
  4. 問題沒有答案時,它會捏造內容嗎?
  5. GLM 5.3 會遵循 JSON schema 嗎?
  6. GLM 5.3 Flash 的圖片輸入成本多少?
  7. 相較 GLM 5.2,還有哪些變更?
  8. Synthorai 如何處理這些差異
  9. 常見問題

GLM 5.3 的價格與 GLM 5.2 相同,每百萬個輸入權杖 $1.40、每百萬個輸出權杖 $4.40,但已無法關閉思考。所有停用方式都會回傳 400 錯誤,預設推理強度則是 max。我們用 11 個答案可驗證的任務,各執行 3 次。只有 max 能答對全部 33 題,每個正確答案的成本為 $0.00468。GLM 5.2 在 max 下則是 $0.0117,因此 GLM 5.3 便宜 2.5 倍,原因是它的推理量約少一半。low 的每個正確答案成本低 63%,但 33 題錯了 5 題。GLM 5.3 Flash 答對 31 題,價格只有十分之一。reasoning_effort 用來控制模型回答前的思考時間,現在不只影響成本,也決定準確度。我們在同一批測試中,將兩個版本與 GLM 5.2、DeepSeek V4.1 Flash 進行比較。

TL;DR

  • GLM 5.3 與 GLM 5.3 Flash 對 thinking: disabledreasoning_effort: nonemedium 都會回傳錯誤碼 1210;只有 lowhighmax(預設值)可用。
  • GLM 5.3 在 max 下答對 33/33,每個正確答案成本為 $0.00468;GLM 5.2 在 max 下則為 $0.01173。
  • GLM 5.3 在 low 下答對 28/33,GLM 5.3 Flash 則答對 24/33。
  • 兩個 GLM 5.3 版本都會忽略嚴格的 json_schemajson_object 在 8/8 次測試中都回傳正確值。

GLM 5.3 是什麼?價格多少?

它是以相同價格重新訓練的 GLM 5.2,另外還有一個價格只有十分之一的小型模型。根據 Z.ai 的指南,GLM 5.3「使用與 GLM-5.2 相同的基礎模型,所有改進都來自後訓練」,而且只接受文字輸入。GLM 5.3 Flash「共有 320B 個參數,其中啟用 18B 個」(每個權杖只由 18B 個參數處理,因此成本較低),並支援圖片、影片和檔案。兩者都有 1M 權杖的上下文和 128K 輸出上限。以下是 Z.ai 價格頁面列出的每百萬個權杖價格:

模型輸入快取輸入輸出
GLM 5.3$1.40$0.26$4.40
GLM 5.3 Flash$0.15$0.03$0.50
GLM 5.2$1.40$0.26$4.40
DeepSeek V4.1 Flash$0.30 尖峰$0.006 尖峰$1.20 尖峰

Z.ai 的模型說明Flash 指南顯示,主要改進集中在代理和程式開發任務:

基準測試測試內容GLM 5.2GLM 5.3GLM 5.3 Flash
Terminal Bench 3.0終端機中的代理任務4.628.3未列出
DeepSWE v1.1修正真實程式碼儲存庫46.266.963.4
AutomationBench工作流程自動化26.248.248.8
CyberGym資安漏洞任務77.284.5未列出
HLE with tools可使用工具的高難度問題54.762.5未列出

以下是我們能自行驗證的結果:答案唯一且可檢查的任務,不是代理基準測試。

還能關閉思考嗎?

不能。GLM 5.2 接受 thinking: {"type": "disabled"}GLM 5.3GLM 5.3 Flash 在收到 thinking: disabledenable_thinking: false,或將 reasoning_effort 設為 noneminimalmediumxhigh 時,都會回傳 HTTP 400 和錯誤碼 1210(「此模型一律會思考,不支援關閉思考;請使用 low、high 或 max」)。省略 reasoning_effort 時會使用 max。部分供應商會採用 thinking_budget 限制思考權杖,但 GLM 5.3 只接受參數,不會實際套用。面對同一個問題,從 0 到 1,024 的每個設定都產生約 101 個推理權杖。

resp = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": prompt}],
    reasoning_effort="high",   # "low" | "high" | "max"; omitted means "max"
    max_tokens=8192,           # GLM 5.3 Flash rejects anything above 131,072
)
reasoning_tokens = resp.usage.completion_tokens_details.reasoning_tokens  # billed as output
thinking_text = resp.choices[0].message.reasoning_content                # the thinking itself, as text

舊版的低成本做法本來就不理想。關閉思考後,GLM 5.2 在 33 個任務中只答對 10 個,DeepSeek V4.1 Flash 則答對 22 個。

哪個推理強度能答對?

GLM 5.3 只有 max 可以,GLM 5.3 Flash 則沒有任何設定能全對。我們準備了 11 個答案為單一數字且可驗證的任務,包括質數總和、數字出現次數、網格路徑、硬幣組合、重複套用規則 40 次、7 的 222 次方除以 1000 的餘數、進位轉換、背包問題,以及計算同時符合 3 個限制的四位數。每個任務執行 3 次。推理權杖是模型在回答前寫下但不顯示的思考內容,會以輸出計費。每個正確答案的成本,是依牌價將總花費除以正確答案數:

模型推理強度答對推理權杖,中位數(最大值)每個正確答案成本
GLM 5.3low28/33143 (1,826)$0.00173
GLM 5.3high29/33226 (1,950)$0.00197
GLM 5.3max(預設)33/33538 (7,733)$0.00468
GLM 5.3 Flashlow24/33120 (467)$0.00012
GLM 5.3 Flashhigh29/33196 (1,582)$0.00021
GLM 5.3 Flashmax(預設)31/33419 (5,024)$0.00040
GLM 5.2max33/331,129 (21,917)$0.01173
DeepSeek V4.1 Flashlow33/33337 (6,797)$0.00102
DeepSeek V4.1 Flashmax33/33386 (10,769)$0.00138

GLM 5.3、GLM 5.3 Flash、GLM 5.2 和 DeepSeek V4.1 Flash 在 low、high、max 推理強度下,每個正確答案成本的長條圖,並標示 33 題中的答對數。GLM 5.3 只有在 max 下達到 33/33,成本為 $0.00468;GLM 5.2 在 max 下成本為 $0.01173;GLM 5.3 Flash 最便宜,但最高只達到 31/33

相較 GLM 5.2 便宜 2.5 倍,原因在於推理量。推理權杖中位數分別為 538 和 1,129,最長一次則分別為 7,733 和 21,917。較低的設定會略過檢查,因此省下成本。在 low 下,GLM 5.3 有兩次將網格路徑數回答為 216(其中一格被封鎖後,正確答案是 132),硬幣組合、背包問題和進位轉換也各錯一次。GLM 5.3 Flash 在 low 下,每次都答錯重複 40 步的規則和受限計數題。相較之下,DeepSeek V4.1 Flash 在所有設定下都是 33/33。

GLM 5.3 遇到算術或多步驟任務時,應保留預設值。只有在錯誤答案容易被攔截時才使用 low。在 max 下,GLM 5.3 每個正確答案的成本是 DeepSeek V4.1 Flash 的 3.4 倍;GLM 5.3 Flash 的成本不到三分之一,但 33 題錯了 2 題。

問題沒有答案時,它會捏造內容嗎?

不會,即使強制啟用思考也是如此。我們詢問 5 個虛構實體,唯一正確的回答是「我不知道」,包括 Verantis Dynamics 的股價、Oridium-7 的熔點,以及 1987 Pan-Continental Robotics Prize 的得主。測試使用預設推理強度,權杖上限為 16,384:

模型拒絕回答捏造答案達到上限但答案為空推理權杖每題成本
GLM 5.35/50/50/5230 至 542$0.0022
GLM 5.3 Flash5/50/50/5238 至 625$0.0003
GLM 5.25/50/50/5134 至 1,559$0.0035
DeepSeek V4.1 Flash1/53/51/57,021 至 16,384$0.0139

兩個 GLM 5.3 版本都只用了幾百個推理權杖,就表示沒有相關資訊。DeepSeek V4.1 Flash 會先思考 7,000 至 16,000 個權杖,接著通常捏造答案(Andrew Martin, the robot protagonist of Isaac Asimov's The Bicentennial Man, won)。前一天的獨立測試中,更多執行結果改為達到上限,但它仍很少拒絕回答。查詢結果可能合理為空時,這是我們測得兩個 Flash 級模型之間最大的差異。

GLM 5.3 會遵循 JSON schema 嗎?

不會嚴格遵循,請使用 json_object。在發票擷取測試中,將 response_format 設為嚴格的 json_schema 後,GLM 5.3GLM 5.3 Flash 都回傳 HTTP 200,但 16/16 次執行都忽略 schema。JSON 被包在 Markdown 程式碼區塊中,還包含 schema 未要求的鍵(invoice_datereference),因此沒有任何結果能解析成指定物件。Z.ai 的 API 參考文件只列出 textjson_object。問題在於,API 會默默接受 schema,不會回報錯誤。

改用 {"type": "json_object"},並在提示詞中指定欄位後,兩個版本都在 8/8 次執行中回傳所有正確值,GLM 5.2DeepSeek V4.1 Flash 也一樣。由於思考無法關閉,GLM 5.3 每次擷取的輸出權杖中位數為 240,Flash 為 140;V4.1 Flash 關閉思考後則為 25。請自行根據 schema 驗證結果。

GLM 5.3 Flash 的圖片輸入成本多少?

成本會隨像素面積增加,而且不會在 2048x2048 封頂。因此即使費率較低,大型圖片仍比 DeepSeek V4.1 Flash 更貴。我們將產生的 PNG 傳給 GLM 5.3 FlashGLM 5.3 僅支援文字),再扣除只有文字提示詞時的權杖數:

圖片GLM 5.3 Flash 權杖以 $0.15/M 計算的成本DeepSeek V4.1 Flash 權杖以 $0.30/M 計算的成本
512x512363$0.000054184$0.000055
1024x10241,371$0.000206652$0.000196
2048x20485,478$0.000822994$0.000298

圖片輸入權杖數與正方形圖片尺寸的折線圖:GLM 5.3 Flash 隨像素面積增加,在 2048x2048 時達到 5,478 個權杖;DeepSeek V4.1 Flash 在 512x512 以下維持 184 個,最高達到 994 個

超過 512 像素後,GLM 5.3 Flash 約每 766 個像素使用 1 個權杖;detail、圖片內容和檔案格式都不會改變數量。DeepSeek V4.1 Flash 的數據來自前一天的測試。傳送螢幕截圖和文件頁面前應先縮小尺寸。圖片為 2048x2048 時,GLM 5.3 Flash 的單張成本高出 2.8 倍。

相較 GLM 5.2,還有哪些變更?

速度變快,底層介面則幾乎沒變。在同一時段以 low 進行串流測試時,GLM 5.3 每秒產生 59 至 64 個輸出權杖,GLM 5.3 Flash 為 70 至 82 個,GLM 5.2 為 51 至 55 個,DeepSeek V4.1 Flash 則為 124 至 161 個。在兩輪函式呼叫流程中,每個模型每輪都呼叫一次。3 個 GLM 版本對英文、中文和 Python 文字計算出的權杖數完全相同(737、484 和 488),因此權杖預算可以直接沿用。

提示詞中重複的開頭部分會按快取費率計費,並以 64 個權杖為單位計算(1,153 個權杖的提示詞中,有 1,024 個從快取讀取)。兩個版本都能接受接近 1M 權杖上限的提示詞,雖然 Flash 的模型說明寫的是 300,000 個權杖。將一個值藏在 990,000 個權杖提示詞的前段,模型仍能正確回傳(我們沒有測試末尾內容的召回);約 1.07M 個權杖的提示詞則回傳 400 和 Prompt exceeds max length,不會直接截斷。升級時有一項不相容變更:GLM 5.3 Flash 不接受高於 131,072 的 max_tokens

Synthorai 如何處理這些差異

在閘道上,GLM 5.3GLM 5.3 FlashGLM 5.2 分別使用 glm-5.3glm-5.3-flashglm-5.2,套用 Z.ai 牌價,並支援 /v1/chat/completions/v1/responses。錯誤碼 1210 會原樣傳回,因此仍在傳送 GLM 5.2 關閉思考參數的用戶端會直接失敗,不會在不知情下改用 max 思考。推理文字會放在 reasoning_content 中回傳;圖片則透過 image_url 內容區段傳給 GLM 5.3 Flash。

常見問題

可以關閉 GLM 5.3 的思考嗎?

不行。GLM 5.3GLM 5.3 Flash 對任何關閉設定都會回傳 400 和錯誤碼 1210;只接受 lowhighmax,預設值為 max。在我們的測試中,low 的每個正確答案成本低 63%,但只答對 28/33,而不是 33/33。

GLM 5.3 比 GLM 5.2 便宜嗎?

以每個權杖計算,不是。兩者的輸入價格都是 $1.40,輸出價格都是 $4.40。以每個正確答案計算,則是。在 max 下,GLM 5.3 的成本為 $0.00468,GLM 5.2 則為 $0.01173,因為前者的推理量約少一半。

GLM 5.3 Flash 可以取代 GLM 5.3 嗎?

如果下游能攔截偶爾出現的錯誤數字,可以,而且價格只有十分之一。GLM 5.3 Flashmax 下答對 31/33,每個正確答案成本為 $0.00040;GLM 5.3 則答對 33/33,成本為 $0.00468。多步驟算術不要使用 Flash 的 low,該設定只答對 24/33。

相關文章:GLM 5.2 推理強度GLM 5.2 工具呼叫DeepSeek V4.1 Flash 成本LLM 思考控制LLM 結構化輸出

← 返回部落格