Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GLM-5.2

Lançado em 2026-06-16

chatCódigoRaciocínioChamada de ferramentasCache de prompts

O GLM-5.2 é o modelo carro-chefe da Z.AI construído para a era das tarefas de longo horizonte, estendendo a janela de contexto para 1M tokens com até 128K de saída; a documentação enfatiza tornar o contexto de 1M realmente utilizável para trabalho em escala de projeto.

Entrada
texto $1.4/M
Saída
texto $4.4/M
Leitura de cache
$0.26/M
Contexto
1M
vs GPT-4o
~72% mais barato

Benchmarks

Acima da médiaNenhum melhor26 / 701 / 70
GLM-5.2 outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
SWE-Bench Pro
62.1%
GDPval-AA v2 Elo · 642-1861
1510
Harvey Lab-AA
91%
GPQA Diamond
91.2%
MCP-Atlas
82.6%

Publicado pelos fornecedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

O preço em contexto

Posição do preço entre 60 modelos comparáveis

Entrada$1.4/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$4.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$0.26/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 1.000.000
Saída máxima (especificação do fornecedor) 131.072

Cache de prompts

Modo automático

Raciocínio

Parâmetro do fornecedor thinking.type + reasoning_effort
Valores aceites thinking.type enabled · disabled; reasoning_effort none · minimal · low · medium · high · xhigh · max (none and minimal skip thinking, low and medium map to high, xhigh maps to max)
Valor predefinido enabled, com reasoning_effort em max: o único GLM com um controle de esforço, e ele já vem no topo da escala aplicado quando o pedido nada indica
Pode ser desativado Sim
Comportamento do raciocínio O trace retorna em reasoning_content; os traces dos turnos anteriores são limpos por padrão no endpoint padrão da API, e os blocos de raciocínio precisam ser devolvidos com os resultados das ferramentas para que o raciocínio intercalado funcione.
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto → texto
Parâmetros 744B no total · 40B ativos MoE
Licença MIT

Carro-chefe de longo horizonte (744B-A40B) com contexto utilizável de 1M tokens / saída máxima de 128K, níveis configuráveis de esforço de raciocínio e a eficiência de atenção esparsa IndexShare em contexto de 1M.

conforme documentação oficial da Z.ai ↗

Um prompt, medido pelo gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICAR exatamente 3 frases

GLM-5.2 passou · 3 sentences

Enabling reasoning means the LLM now generates thousands of invisible "thinking" tokens to systematically work through complex problems before producing a final answer. Because our cloud providers bill for these internal processing steps at the same rate as standard output, our billable token volume per query has doubled. While this increases our direct API costs, it drastically reduces error rates and manual review labor, ultimately lowering our total cost per resolved transaction.

saída 1223 tok (+1138 pensamento) latência 17.1 s

Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICAR a correção passa nos testes

GLM-5.2 falhou · 1/8 cases (fails [1])

```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 […]

saída 4097 tok (+4036 pensamento) latência 58.4 s

Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICAR JSON válido, esquema exato

GLM-5.2 passou · 5/5 fields, guidance "withheld"

```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld" } ```

saída 1947 tok (+1893 pensamento) latência 30.9 s

Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICAR 120 palavras, 0 palavras proibidas

GLM-5.2 passou · 120 words, 0 banned, 1 question

We are introducing Caching for our API Gateway, the smartest way to optimize your workflows. Why pay for the exact same response twice? Now, you can automatically store and reuse prompt results across multiple AI providers, drastically reducing latency and overall operational costs. If a user submits a duplicate query, the gateway serves the cached answer instantly, regardless of whether you route to OpenAI, Anthropic, or others. This directly translates to faster applications and significantly lower monthly API bills. You can easily configure your specific caching rules within the developer dashboard and watch your efficiency soar. Stop wasting your valuable tokens on completely redundant computations. Upgrade to the latest gateway version today and experience the future of intelligent prompt management.

saída 11125 tok (+10984 pensamento) latência 114.8 s

Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.

Use o GLM-5.2 em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="glm-5.2",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Sobre o GLM-5.2

  • Em relação ao GLM-5.1, a página oficial destaca execução de tarefas de longo horizonte mais estável, consistência mais forte em seguir padrões de engenharia em contextos estendidos, entendimento em escala de projeto com refatoração de múltiplos arquivos e loops completos de depuração no dispositivo para desenvolvimento mobile e de cliente, ao lado de desenvolvimento de mini-programas e de pequenos jogos e de reprodução de pesquisas.
  • A eficiência por trás da janela maior também é publicada: um esquema IndexShare permite que um indexador leve atenda a cada quatro camadas do transformer, cortando o compute por token em contexto de 1M, com uma camada aprimorada de predição de múltiplos tokens elevando a aceitação da decodificação especulativa.
  • Este é também o único modelo da linha com um controle reasoning_effort, um conjunto documentado de níveis que na prática se reduz a pular o raciocínio, uma configuração high e uma configuração máxima, com a API hospedada assumindo a máxima por padrão, de modo que uma requisição que não define nada é uma requisição que raciocina a fundo.
  • Fora isso, o raciocínio se comporta como no restante da linha GLM-5, retornando seu trace em um campo separado, e chamada de ferramentas, MCP, saída JSON e cache automático seguem iguais.
  • Os pesos têm licença MIT.
  • Quando você chama o GLM-5.2 na Synthorai, o endpoint compatível com OpenAI o torna uma atualização drop-in para cargas de trabalho de agente de contexto longo.

Perguntas frequentes

A API do GLM-5.2 é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $1.4/M de tokens de entrada, só esse crédito já cobre cerca de 89 requisições de ~8K tokens ao GLM-5.2.

Em que o GLM-5.2 é melhor?

Contexto estendido para 1M tokens utilizáveis; entendimento em escala de projeto com refatoração de múltiplos arquivos; loops de depuração no dispositivo para desenvolvimento mobile. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o GLM-5.2?

Na Synthorai, o GLM-5.2 custa $1.4 por milhão de tokens de entrada e $4.4 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.26/M.

O GLM-5.2 suporta cache de prompts?

Sim, automaticamente: prompts servidos pela Z.ai entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $0.26/M, contra $1.4/M sem cache. Guia de cache de prompts →

Como obtenho acesso ao GLM-5.2?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="glm-5.2" e pronto. Uma única chave de API cobre todos os modelos do gateway.

O GLM-5.2 é open source?

Sim, os pesos são publicados sob a MIT License (repositório oficial com link na seção Sobre). Ou dispense as GPUs: a versão hospedada aqui é pagamento por uso, sem infraestrutura para operar. Como rodar modelos de pesos abertos →

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →