Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

API GLM 5.3: sempre pensa, 2.5x menos por resposta que a 5.2

Conteúdo
  1. O que é o GLM 5.3 e quanto ele custa?
  2. Ainda é possível desativar o raciocínio?
  3. Qual nível de esforço produz as respostas corretas?
  4. Ele inventa informações quando uma pergunta não tem resposta?
  5. O GLM 5.3 segue um schema JSON?
  6. Quanto custa uma imagem no GLM 5.3 Flash?
  7. O que mais mudou em relação ao GLM 5.2?
  8. Como a Synthorai implementa esses modelos
  9. Perguntas frequentes

O GLM 5.3 custa os mesmos $1.40 por milhão de tokens de entrada e $4.40 por milhão de tokens de saída que o GLM 5.2, mas não permite mais desativar o raciocínio: qualquer tentativa retorna erro 400, e o nível padrão é max. Em 11 tarefas com resposta verificável, executadas três vezes cada, max foi a única configuração que acertou todas as 33, a $0.00468 por resposta correta. Isso representa um custo 2.5x menor que o GLM 5.2 em max, porque o GLM 5.3 usa cerca de metade do raciocínio. low custa 63% menos por resposta correta, mas erra 5 de 33. O GLM 5.3 Flash acertou 31 de 33 por um décimo do preço. O parâmetro reasoning_effort, que define quanto tempo o modelo pensa antes de responder, agora determina tanto a precisão quanto o custo. Medimos os dois modelos em um único lote e os comparamos com o GLM 5.2 e o DeepSeek V4.1 Flash.

TL;DR

  • GLM 5.3 e GLM 5.3 Flash rejeitam thinking: disabled, reasoning_effort: none e medium com o erro 1210; somente low, high e max (o padrão) funcionam.
  • Em max, o GLM 5.3 acertou 33 de 33 a $0.00468 por resposta correta; o GLM 5.2 em max custou $0.01173.
  • Em low, o GLM 5.3 acertou 28 de 33, e o GLM 5.3 Flash, 24 de 33.
  • Os dois modelos GLM 5.3 ignoram um json_schema estrito; json_object retornou os valores corretos em 8 de 8 execuções.

O que é o GLM 5.3 e quanto ele custa?

É um GLM 5.2 retreinado pelo mesmo preço, acompanhado de um modelo menor que custa um décimo. Segundo o guia da Z.ai, o GLM 5.3 “usa o mesmo modelo-base do GLM-5.2, e todas as melhorias vêm do pós-treinamento”. Ele aceita somente texto. O GLM 5.3 Flash tem “320B de parâmetros no total, com 18B ativados” (somente 18B processam cada token, o que reduz o custo) e aceita imagens, vídeos e arquivos. Ambos têm contexto de 1M tokens e saída de 128K. Estes são os preços por milhão de tokens publicados na página de preços da Z.ai:

ModeloEntradaEntrada em cacheSaída
GLM 5.3$1.40$0.26$4.40
GLM 5.3 Flash$0.15$0.03$0.50
GLM 5.2$1.40$0.26$4.40
DeepSeek V4.1 Flash$0.30 no pico$0.006 no pico$1.20 no pico

O model card e o guia do Flash da Z.ai atribuem os ganhos a tarefas com agentes e programação:

BenchmarkO que avaliaGLM 5.2GLM 5.3GLM 5.3 Flash
Terminal Bench 3.0tarefas de agentes em um terminal4.628.3não informado
DeepSWE v1.1correções em repositórios reais46.266.963.4
AutomationBenchautomação de workflows26.248.248.8
CyberGymtarefas de vulnerabilidade de segurança77.284.5não informado
HLE with toolsperguntas difíceis com uso de ferramentas54.762.5não informado

A seguir estão os resultados que conseguimos verificar diretamente, usando tarefas com uma única resposta verificável, não benchmarks de agentes.

Ainda é possível desativar o raciocínio?

Não. O GLM 5.2 aceitava thinking: {"type": "disabled"}. O GLM 5.3 e o GLM 5.3 Flash retornam HTTP 400 com o código de erro 1210 (“este modelo sempre pensa; não é possível desativar o raciocínio; use low, high ou max”) para thinking: disabled, enable_thinking: false e reasoning_effort definido como none, minimal, medium ou xhigh. Se reasoning_effort for omitido, o valor usado será max. O thinking_budget, limite de tokens de raciocínio respeitado por alguns provedores, é aceito e ignorado pelo GLM 5.3: na mesma pergunta, todos os valores de 0 a 1,024 produziram cerca de 101 tokens de raciocínio.

resp = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": prompt}],
    reasoning_effort="high",   # "low" | "high" | "max"; omitted means "max"
    max_tokens=8192,           # GLM 5.3 Flash rejects anything above 131,072
)
reasoning_tokens = resp.usage.completion_tokens_details.reasoning_tokens  # billed as output
thinking_text = resp.choices[0].message.reasoning_content                # the thinking itself, as text

A antiga opção mais barata também não era boa: com o raciocínio desativado, o GLM 5.2 acertou 10 das nossas 33 tarefas, e o DeepSeek V4.1 Flash, 22.

Qual nível de esforço produz as respostas corretas?

No GLM 5.3, somente max; no GLM 5.3 Flash, nenhum deles. Executamos três vezes cada uma das 11 tarefas cuja resposta é um único número verificável: somas de números primos, contagens de dígitos, caminhos em uma grade, combinações de moedas, uma regra aplicada 40 vezes, o resto da divisão de 7 elevado a 222 por 1000, uma conversão de base, um problema da mochila e a contagem de números de quatro algarismos sob três restrições. Os tokens de raciocínio correspondem ao processamento oculto gerado antes da resposta e são cobrados como saída. O custo por resposta correta é o gasto total dividido pelo número de acertos, usando o preço de tabela:

ModeloNívelAcertosTokens de raciocínio, mediana (máximo)Custo por resposta correta
GLM 5.3low28/33143 (1,826)$0.00173
GLM 5.3high29/33226 (1,950)$0.00197
GLM 5.3max (padrão)33/33538 (7,733)$0.00468
GLM 5.3 Flashlow24/33120 (467)$0.00012
GLM 5.3 Flashhigh29/33196 (1,582)$0.00021
GLM 5.3 Flashmax (padrão)31/33419 (5,024)$0.00040
GLM 5.2max33/331,129 (21,917)$0.01173
DeepSeek V4.1 Flashlow33/33337 (6,797)$0.00102
DeepSeek V4.1 Flashmax33/33386 (10,769)$0.00138

Gráfico de barras do custo por resposta correta do GLM 5.3, GLM 5.3 Flash, GLM 5.2 e DeepSeek V4.1 Flash nos níveis low, high e max, com o total de respostas corretas entre 33. O GLM 5.3 só chega a 33 de 33 em max, a $0.00468; o GLM 5.2 em max custa $0.01173; o GLM 5.3 Flash é o mais barato, mas chega no máximo a 31 de 33

A diferença de 2.5x em relação ao GLM 5.2 vem do volume de raciocínio: mediana de 538 tokens contra 1,129, e execução mais longa de 7,733 contra 21,917. Os níveis menores economizam porque pulam verificações. Em low, o GLM 5.3 respondeu 216 duas vezes para a contagem de caminhos na grade (uma célula bloqueada reduz o resultado para 132) e errou uma vez cada nas combinações de moedas, no problema da mochila e na conversão de base. O GLM 5.3 Flash em low errou sempre a regra de 40 etapas e a contagem com restrições. Em comparação, o DeepSeek V4.1 Flash acertou 33 de 33 em todas as configurações.

No GLM 5.3, mantenha a configuração padrão para qualquer tarefa com cálculos ou várias etapas. Use low somente quando for barato detectar uma resposta errada. Em max, o GLM 5.3 custa 3.4x mais que o DeepSeek V4.1 Flash por resposta correta. O GLM 5.3 Flash custa menos de um terço, mas erra 2 de 33.

Ele inventa informações quando uma pergunta não tem resposta?

Não, mesmo com o raciocínio obrigatório. Fizemos cinco perguntas sobre entidades inventadas, então a única resposta correta era “não sei” (a cotação das ações da Verantis Dynamics, o ponto de fusão do Oridium-7, o vencedor do 1987 Pan-Continental Robotics Prize), usando o nível padrão e um limite de 16,384 tokens:

ModeloRespondeu que não sabiaInventou uma respostaAtingiu o limite, resposta vaziaTokens de raciocínioCusto por pergunta
GLM 5.35/50/50/5230 a 542$0.0022
GLM 5.3 Flash5/50/50/5238 a 625$0.0003
GLM 5.25/50/50/5134 a 1,559$0.0035
DeepSeek V4.1 Flash1/53/51/57,021 a 16,384$0.0139

Os dois modelos GLM 5.3 disseram que não tinham informações após algumas centenas de tokens de raciocínio. O DeepSeek V4.1 Flash raciocinou por 7,000 a 16,000 tokens e, na maioria das vezes, inventou algo (Andrew Martin, the robot protagonist of Isaac Asimov's The Bicentennial Man, won). Em nosso próprio estudo realizado um dia antes, mais execuções atingiram o limite, mas o modelo raramente respondeu que não sabia. Para consultas que podem legitimamente não retornar resultados, essa foi a maior diferença que medimos entre os dois modelos da categoria Flash.

O GLM 5.3 segue um schema JSON?

Não um schema estrito; use json_object. Com response_format definido como um json_schema estrito para extrair dados de uma fatura, o GLM 5.3 e o GLM 5.3 Flash retornaram HTTP 200 e ignoraram o schema nas 16 execuções. O JSON veio dentro de um bloco de código Markdown e continha chaves não solicitadas pelo schema (invoice_date, reference), por isso nenhum resultado pôde ser interpretado como o objeto pedido. A referência da API da Z.ai lista somente text e json_object; o problema é que o schema é aceito silenciosamente.

Com {"type": "json_object"} e os campos especificados no prompt, os dois modelos retornaram todos os valores corretos em 8 de 8 execuções, assim como o GLM 5.2 e o DeepSeek V4.1 Flash. Como o raciocínio permanece ativo, a extração usa uma mediana de 240 tokens de saída no GLM 5.3 e 140 no Flash, contra 25 no V4.1 Flash com o raciocínio desativado. Valide o resultado por conta própria usando seu schema.

Quanto custa uma imagem no GLM 5.3 Flash?

A contagem cresce com a área em pixels e ainda não atinge um teto em 2048x2048. Por isso, imagens grandes custam mais que no DeepSeek V4.1 Flash, apesar da tarifa menor. Enviamos arquivos PNG gerados ao GLM 5.3 Flash (o GLM 5.3 aceita somente texto) e descontamos os tokens do mesmo prompt sem imagem:

ImagemTokens do GLM 5.3 FlashCusto a $0.15/MTokens do DeepSeek V4.1 FlashCusto a $0.30/M
512x512363$0.000054184$0.000055
1024x10241,371$0.000206652$0.000196
2048x20485,478$0.000822994$0.000298

Gráfico de linhas dos tokens de entrada de imagem em relação ao tamanho de imagens quadradas: o GLM 5.3 Flash cresce com a área em pixels e chega a 5,478 tokens em 2048x2048; o DeepSeek V4.1 Flash permanece em 184 até 512x512 e chega a 994

Acima de 512 pixels, o GLM 5.3 Flash usa cerca de um token para cada 766 pixels. O valor de detail, o conteúdo da imagem e o formato do arquivo não alteraram a contagem. Os números do DeepSeek V4.1 Flash vêm do estudo feito no dia anterior. Reduza a resolução de capturas de tela e páginas de documentos antes do envio: em 2048x2048, o GLM 5.3 Flash custa 2.8x mais por imagem.

O que mais mudou em relação ao GLM 5.2?

A velocidade; o restante da integração quase não mudou. Em streaming, na mesma janela de medição e com low, o GLM 5.3 gerou de 59 a 64 tokens de saída por segundo, o GLM 5.3 Flash, de 70 a 82, o GLM 5.2, de 51 a 55, e o DeepSeek V4.1 Flash, de 124 a 161. Em um loop de function calling com dois turnos, todos os modelos fizeram uma chamada por turno. Os três modelos GLM contabilizam o mesmo número de tokens para textos em inglês, chinês e Python (737, 484 e 488), então os orçamentos de tokens continuam válidos.

A parte inicial repetida de um prompt é cobrada pela tarifa de cache, com contagem em blocos de 64 tokens (em um prompt de 1,153 tokens, 1,024 foram lidos do cache). Os dois modelos aceitam prompts próximos do limite de 1M tokens, embora o model card do Flash mencione 300,000 tokens: um prompt de 990,000 tokens, com um valor oculto próximo ao início, retornou esse valor (não testamos a recuperação de conteúdo perto do fim). Outro prompt com cerca de 1.07M tokens recebeu um erro 400, Prompt exceeds max length, em vez de ser truncado. Há uma incompatibilidade na migração: o GLM 5.3 Flash rejeita max_tokens acima de 131,072.

Como a Synthorai implementa esses modelos

O GLM 5.3, o GLM 5.3 Flash e o GLM 5.2 estão disponíveis no gateway como glm-5.3, glm-5.3-flash e glm-5.2, pelos preços de tabela da Z.ai, nos endpoints /v1/chat/completions e /v1/responses. O erro 1210 é repassado sem alterações. Assim, clientes que ainda enviam a opção do GLM 5.2 para desativar o raciocínio falham de forma explícita, em vez de usar max silenciosamente. O texto de raciocínio retorna em reasoning_content; imagens são enviadas ao GLM 5.3 Flash como partes de conteúdo image_url.

Perguntas frequentes

É possível desativar o raciocínio no GLM 5.3?

Não. O GLM 5.3 e o GLM 5.3 Flash retornam erro 400 com o código 1210 para todas as formas de desativação. Somente low, high e max são aceitos, e max é o padrão. Em nossos testes, low custou 63% menos por resposta correta, mas acertou 28 de 33, em vez de 33.

O GLM 5.3 é mais barato que o GLM 5.2?

Por token, não: ambos custam $1.40 pela entrada e $4.40 pela saída. Por resposta correta, sim: em max, o GLM 5.3 custou $0.00468, contra $0.01173 do GLM 5.2, porque usa cerca de metade do raciocínio.

O GLM 5.3 Flash pode substituir o GLM 5.3?

Sim, quando um erro numérico ocasional pode ser detectado nas etapas seguintes, por um décimo do preço: o GLM 5.3 Flash em max acertou 31 de 33 a $0.00040 por resposta correta, contra 33 de 33 a $0.00468 no GLM 5.3. Evite usar o Flash em low para cálculos com várias etapas, configuração em que ele acertou 24 de 33.

Veja também: níveis de raciocínio do GLM 5.2, chamadas de ferramentas do GLM 5.2, custo do DeepSeek V4.1 Flash, controles de raciocínio em LLMs, saídas estruturadas de LLMs.

← Voltar ao blog