GLM 5.3 API 비용: 항상 추론, 답변당 5.2보다 2.5배 저렴
목차
GLM 5.3의 가격은 GLM 5.2와 동일하게 입력 token 100만 개당 $1.40, 출력 token 100만 개당 $4.40이다. 달라진 점은 추론을 끌 수 없다는 것이다. 어떤 방식으로 비활성화를 시도해도 400 오류가 발생하며 기본 effort는 max다. 정답을 검증할 수 있는 11개 문제를 각각 3회 실행한 결과, 33개를 모두 맞힌 설정은 max뿐이었다. 정답당 비용은 $0.00468로, max를 사용한 GLM 5.2보다 2.5배 저렴했다. GLM 5.3의 추론량이 절반 수준이기 때문이다. low는 정답당 비용이 63% 낮지만 33개 중 5개를 틀렸다. GLM 5.3 Flash는 10분의 1 가격으로 33개 중 31개를 맞혔다. 모델이 답변 전에 얼마나 오래 추론할지 정하는 reasoning_effort가 이제 비용뿐 아니라 정확도까지 좌우한다. 두 GLM 5.3 모델을 GLM 5.2 및 DeepSeek V4.1 Flash와 같은 batch에서 측정했다.
TL;DR
- GLM 5.3과 GLM 5.3 Flash는
thinking: disabled,reasoning_effort: none,medium을 오류 1210으로 거부한다. 사용할 수 있는 값은low,high,max뿐이며 기본값은max다. max에서 GLM 5.3은 33개 중 33개를 맞혔고 정답당 비용은 $0.00468이었다. GLM 5.2의max는 $0.01173이었다.low에서 GLM 5.3은 33개 중 28개, GLM 5.3 Flash는 33개 중 24개를 맞혔다.- 두 GLM 5.3 모델 모두 엄격한
json_schema를 무시했다.json_object는 8회 모두 올바른 값을 반환했다.
GLM 5.3은 어떤 모델이며 비용은 얼마인가?
GLM 5.3은 같은 가격으로 재학습한 GLM 5.2이고, 여기에 10분의 1 가격인 소형 모델이 추가됐다. Z.ai의 가이드에 따르면 GLM 5.3은 “GLM-5.2와 같은 base model을 사용하며 모든 개선은 post-training으로 이루어졌다”. 입력은 text만 지원한다. GLM 5.3 Flash는 “전체 parameter 320B 중 18B를 활성화”한다. token 하나를 처리할 때 실제로 동작하는 parameter가 18B뿐이라 비용이 낮다. image, video, file 입력도 지원한다. 두 모델 모두 context는 1M token, 최대 출력은 128K token이다. Z.ai의 요금 페이지에 나온 token 100만 개당 가격은 다음과 같다.
| 모델 | 입력 | 캐시된 입력 | 출력 |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 | $4.40 |
| GLM 5.3 Flash | $0.15 | $0.03 | $0.50 |
| GLM 5.2 | $1.40 | $0.26 | $4.40 |
| DeepSeek V4.1 Flash | $0.30 peak | $0.006 peak | $1.20 peak |
Z.ai의 모델 카드와 Flash 가이드는 agent 및 coding 작업에서 성능이 향상됐다고 설명한다.
| Benchmark | 측정 항목 | GLM 5.2 | GLM 5.3 | GLM 5.3 Flash |
|---|---|---|---|---|
| Terminal Bench 3.0 | terminal에서 수행하는 agent 작업 | 4.6 | 28.3 | 미기재 |
| DeepSWE v1.1 | 실제 repository 수정 | 46.2 | 66.9 | 63.4 |
| AutomationBench | workflow 자동화 | 26.2 | 48.2 | 48.8 |
| CyberGym | 보안 취약점 작업 | 77.2 | 84.5 | 미기재 |
| HLE with tools | 도구 사용이 허용된 고난도 질문 | 54.7 | 62.5 | 미기재 |
아래에서는 직접 검증할 수 있는 항목만 다룬다. agent benchmark가 아니라 정답이 하나로 정해진 문제들이다.
추론을 여전히 끌 수 있는가?
불가능하다. GLM 5.2는 thinking: {"type": "disabled"}를 허용했다. GLM 5.3과 GLM 5.3 Flash는 thinking: disabled, enable_thinking: false 또는 reasoning_effort를 none, minimal, medium, xhigh로 설정하면 HTTP 400과 오류 코드 1210을 반환한다. 오류 내용은 “이 모델은 항상 추론하므로 추론을 끌 수 없습니다. low, high 또는 max를 사용하세요”이다. reasoning_effort를 생략하면 max가 적용된다. 일부 provider가 지원하는 추론 token 상한인 thinking_budget은 GLM 5.3에서 요청 자체는 허용되지만 무시된다. 같은 질문에서 0부터 1,024까지 어떤 값을 넣어도 추론 token은 약 101개였다.
resp = client.chat.completions.create(
model="glm-5.3",
messages=[{"role": "user", "content": prompt}],
reasoning_effort="high", # "low" | "high" | "max"; omitted means "max"
max_tokens=8192, # GLM 5.3 Flash rejects anything above 131,072
)
reasoning_tokens = resp.usage.completion_tokens_details.reasoning_tokens # billed as output
thinking_text = resp.choices[0].message.reasoning_content # the thinking itself, as text
기존의 저비용 설정은 성능도 좋지 않았다. 추론을 끈 상태에서 GLM 5.2는 33개 중 10개, DeepSeek V4.1 Flash는 22개를 맞혔다.
어떤 effort 설정이 정답을 맞히는가?
GLM 5.3에서는 max만 모든 문제를 맞혔다. GLM 5.3 Flash에서는 모든 문제를 맞힌 설정이 없었다. 정답이 검증 가능한 단일 숫자인 문제 11개를 각각 3회 실행했다. 소수의 합, 자릿수 세기, grid 경로, 동전 조합, 규칙 40회 적용, 7의 222제곱을 1000으로 나눈 나머지, 진법 변환, knapsack, 3가지 조건을 만족하는 네 자리 수의 개수를 포함했다. 추론 token은 답변 전에 생성되는 숨겨진 추론이며 출력 token으로 과금된다. 정답당 비용은 정가 기준 총비용을 정답 수로 나눴다.
| 모델 | Effort | 정답 | 추론 token, 중앙값 (최댓값) | 정답당 비용 |
|---|---|---|---|---|
| GLM 5.3 | low | 28/33 | 143 (1,826) | $0.00173 |
| GLM 5.3 | high | 29/33 | 226 (1,950) | $0.00197 |
| GLM 5.3 | max (기본값) | 33/33 | 538 (7,733) | $0.00468 |
| GLM 5.3 Flash | low | 24/33 | 120 (467) | $0.00012 |
| GLM 5.3 Flash | high | 29/33 | 196 (1,582) | $0.00021 |
| GLM 5.3 Flash | max (기본값) | 31/33 | 419 (5,024) | $0.00040 |
| GLM 5.2 | max | 33/33 | 1,129 (21,917) | $0.01173 |
| DeepSeek V4.1 Flash | low | 33/33 | 337 (6,797) | $0.00102 |
| DeepSeek V4.1 Flash | max | 33/33 | 386 (10,769) | $0.00138 |
GLM 5.2보다 2.5배 저렴한 이유는 추론량이다. 추론 token 중앙값은 538개와 1,129개, 가장 긴 실행은 7,733개와 21,917개였다. 낮은 설정은 검증 단계를 생략해 비용을 줄인다. low에서 GLM 5.3은 grid 경로 수를 두 번 216으로 답했다. 막힌 칸 하나를 반영하면 정답은 132다. 동전 조합, knapsack, 진법 변환 문제도 각각 한 번씩 틀렸다. GLM 5.3 Flash는 low에서 40단계 규칙과 제약 조건이 있는 개수 세기 문제를 매번 틀렸다. 반면 DeepSeek V4.1 Flash는 모든 설정에서 33개를 전부 맞혔다.
GLM 5.3으로 산술이나 여러 단계가 필요한 작업을 처리한다면 기본값을 유지해야 한다. 오답을 저렴하게 탐지할 수 있는 경우에만 low를 쓰는 편이 낫다. max에서 GLM 5.3의 정답당 비용은 DeepSeek V4.1 Flash의 3.4배다. GLM 5.3 Flash는 비용이 3분의 1 미만이지만 33개 중 2개를 틀렸다.
답이 없는 질문에 내용을 지어내는가?
추론이 항상 켜진 상태에서도 지어내지 않았다. 존재하지 않는 대상을 다룬 질문 5개를 만들었다. 정답은 “모르겠습니다”뿐이다. Verantis Dynamics의 주가, Oridium-7의 녹는점, 1987 Pan-Continental Robotics Prize의 수상자 등을 물었다. 기본 effort와 16,384 token 상한을 사용했다.
| 모델 | 답변 거부 | 답변 생성 | 상한 도달, 빈 답변 | 추론 token | 질문당 비용 |
|---|---|---|---|---|---|
| GLM 5.3 | 5/5 | 0/5 | 0/5 | 230에서 542 | $0.0022 |
| GLM 5.3 Flash | 5/5 | 0/5 | 0/5 | 238에서 625 | $0.0003 |
| GLM 5.2 | 5/5 | 0/5 | 0/5 | 134에서 1,559 | $0.0035 |
| DeepSeek V4.1 Flash | 1/5 | 3/5 | 1/5 | 7,021에서 16,384 | $0.0139 |
두 GLM 5.3 모델은 수백 개의 추론 token을 사용한 뒤 관련 정보가 없다고 답했다. DeepSeek V4.1 Flash는 7,000개에서 16,000개의 token을 사용해 추론한 뒤 대부분 내용을 지어냈다. 예를 들어 Andrew Martin, the robot protagonist of Isaac Asimov's The Bicentennial Man, won고 답했다. 하루 전 진행한 자체 테스트에서는 상한에 도달한 실행이 더 많았지만 답변을 거부하는 경우는 드물었다. 조회 결과가 정상적으로 비어 있을 수 있는 작업에서 두 Flash급 모델 간 가장 큰 차이가 여기서 나타났다.
GLM 5.3은 JSON schema를 따르는가?
엄격한 schema는 따르지 않는다. json_object를 사용해야 한다. invoice 추출용 엄격한 json_schema를 response_format에 지정했을 때 GLM 5.3과 GLM 5.3 Flash는 HTTP 200을 반환했지만 16회 모두 schema를 무시했다. JSON이 markdown code fence로 감싸져 있었고 schema에서 요청하지 않은 key인 invoice_date, reference도 들어갔다. 요청한 object로 parsing된 결과는 하나도 없었다. Z.ai의 API 레퍼런스는 text와 json_object만 명시한다. 문제는 schema가 오류 없이 받아들여진다는 점이다.
{"type": "json_object"}를 사용하고 prompt에 field 이름을 지정하면 두 모델 모두 8회 중 8회 모든 값을 올바르게 반환했다. GLM 5.2와 DeepSeek V4.1 Flash도 같은 결과를 냈다. 추론이 계속 켜져 있으므로 추출에 사용된 출력 token 중앙값은 GLM 5.3이 240개, Flash가 140개였다. 추론을 끈 V4.1 Flash는 25개였다. 반환 결과는 직접 schema로 검증해야 한다.
GLM 5.3 Flash의 image 비용은 얼마인가?
image token은 pixel 면적에 따라 늘어나며 2048x2048에서도 상한이 적용되지 않는다. 요율이 낮아도 큰 image에서는 DeepSeek V4.1 Flash보다 비싸다. 생성한 PNG를 GLM 5.3 Flash에 보내고 text-only prompt의 token 수를 뺐다. GLM 5.3은 text만 지원한다.
| Image | GLM 5.3 Flash token | $0.15/M 기준 비용 | DeepSeek V4.1 Flash token | $0.30/M 기준 비용 |
|---|---|---|---|---|
| 512x512 | 363 | $0.000054 | 184 | $0.000055 |
| 1024x1024 | 1,371 | $0.000206 | 652 | $0.000196 |
| 2048x2048 | 5,478 | $0.000822 | 994 | $0.000298 |
512 pixel을 넘으면 GLM 5.3 Flash는 약 766 pixel당 token 1개를 사용한다. detail, image 내용, file format은 token 수에 영향을 주지 않았다. DeepSeek V4.1 Flash 수치는 전날 진행한 테스트에서 가져왔다. screenshot과 document page는 전송 전에 해상도를 낮추는 편이 좋다. 2048x2048에서 GLM 5.3 Flash의 image당 비용은 2.8배 높다.
GLM 5.2에서 또 무엇이 달라졌는가?
속도는 달라졌지만 나머지 API 동작은 거의 같다. 같은 시간대에 low로 streaming했을 때 초당 출력 token은 GLM 5.3이 59에서 64개, GLM 5.3 Flash가 70에서 82개, GLM 5.2가 51에서 55개, DeepSeek V4.1 Flash가 124에서 161개였다. 두 turn으로 구성된 function-calling loop에서는 모든 모델이 turn마다 한 번씩 호출했다. 세 GLM 모델은 영어, 중국어, Python text를 동일한 token 수로 계산했다. 각각 737개, 484개, 488개이므로 기존 token budget을 그대로 적용할 수 있다.
prompt 앞부분이 반복되면 cached rate로 과금되며 64 token 단위로 계산된다. 1,153 token prompt에서는 1,024 token이 cache에서 읽혔다. Flash 모델 카드에는 300,000 token으로 적혀 있지만 두 모델 모두 1M token 한도에 가까운 prompt를 받아들인다. 앞부분에 값 하나를 숨긴 990,000 token prompt에서 해당 값을 찾아 반환했다(끝부분 내용의 회상은 테스트하지 않았다). 약 1.07M token인 prompt에는 중간에서 잘리는 대신 Prompt exceeds max length 메시지와 함께 400 오류가 발생했다. upgrade 시 주의할 변경 사항도 하나 있다. GLM 5.3 Flash는 131,072를 넘는 max_tokens를 거부한다.
Synthorai에서 처리하는 방식
gateway에서 GLM 5.3, GLM 5.3 Flash, GLM 5.2의 ID는 각각 glm-5.3, glm-5.3-flash, glm-5.2다. Z.ai 정가로 /v1/chat/completions와 /v1/responses에서 제공된다. 오류 1210은 변경 없이 전달된다. GLM 5.2용 추론 비활성화 설정을 계속 보내는 client는 조용히 max로 추론하는 대신 명확한 오류를 받는다. 추론 text는 reasoning_content로 반환된다. image는 image_url content part로 GLM 5.3 Flash에 전달한다.
FAQ
GLM 5.3에서 추론을 끌 수 있는가?
불가능하다. GLM 5.3과 GLM 5.3 Flash는 모든 비활성화 설정에 400과 오류 1210을 반환한다. 허용되는 값은 low, high, max뿐이며 기본값은 max다. 테스트에서 low는 정답당 비용을 63% 줄였지만 정답 수는 33개 중 33개에서 28개로 감소했다.
GLM 5.3은 GLM 5.2보다 저렴한가?
token당 가격은 아니다. 두 모델 모두 입력은 $1.40, 출력은 $4.40이다. 정답당 비용은 더 저렴하다. max에서 GLM 5.3은 $0.00468, GLM 5.2는 $0.01173이었다. GLM 5.3의 추론량이 절반 수준이기 때문이다.
GLM 5.3 Flash로 GLM 5.3을 대체할 수 있는가?
간헐적으로 발생하는 숫자 오답을 downstream에서 잡을 수 있다면 가능하다. 가격은 10분의 1이다. max에서 GLM 5.3 Flash는 33개 중 31개를 맞혔고 정답당 비용은 $0.00040이었다. GLM 5.3은 33개 중 33개를 맞혔고 비용은 $0.00468이었다. 여러 단계의 산술 작업에는 Flash의 low를 피해야 한다. 이 설정에서는 33개 중 24개만 맞혔다.
관련 글: GLM 5.2 추론 effort, GLM 5.2 tool 호출, DeepSeek V4.1 Flash 비용, LLM 추론 제어, LLM structured output.