Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GLM-5

Lançado em 2026-02-12

chatCódigoRaciocínioChamada de ferramentasCache de prompts

O GLM-5 é o modelo de base de nova geração da Z.AI construído para engenharia agêntica, visando engenharia de sistemas complexos e tarefas de agente de longo horizonte.

Entrada
texto $1/M
Saída
texto $3.2/M
Leitura de cache
$0.2/M
Contexto
200K
vs GPT-4o
~80% mais barato

Benchmarks

Acima da médiaNenhum melhor15 / 522 / 52
GLM-5 outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
SWE-Bench Pro
55.1%
Cybergym
43.2%
SkillsBench Avg@5
nenhum outro modelo pontuou mais alto 47.2%
GPQA Diamond
86%
BrowseComp
62%

Publicado pelos fornecedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

O preço em contexto

Posição do preço entre 60 modelos comparáveis

Entrada$1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$3.2/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$0.2/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 200.000
Saída máxima (especificação do fornecedor) 131.072

Cache de prompts

Modo automático

Raciocínio

Parâmetro do fornecedor thinking.type
Valores aceites enabled · disabled
Valor predefinido enabled, e no GLM-5 o próprio modelo determina se deve raciocinar aplicado quando o pedido nada indica
Pode ser desativado Sim
Comportamento do raciocínio O trace retorna em reasoning_content; os traces dos turnos anteriores são limpos por padrão (clear_thinking true), e os blocos de raciocínio intercalado devem ser preservados e devolvidos junto com os resultados das ferramentas.
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto → texto
Parâmetros 744B no total · 40B ativos MoE
Licença MIT
  • Carro-chefe para engenharia agêntica: MoE de 744B parâmetros (40B ativos), pré-treinado em 28,5T tokens com DeepSeek Sparse Attention
  • contexto de 200K / saída máxima de 128K

conforme documentação oficial da Z.ai ↗

Um prompt, medido pelo gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICAR exatamente 3 frases

GLM-5 passou · 3 sentences

Enabling reasoning forces the model to perform multiple hidden steps to "think" through a problem, drastically increasing the volume of data processed per query compared to a standard response. Because our billing is directly tied to this processing volume, the additional computational work required for higher accuracy has proportionally doubled our consumption. Essentially, the spike reflects a trade-off where we are paying a higher variable cost to secure significantly better analytical outcomes.

saída 1393 tok (+1308 pensamento) latência 36.0 s

Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICAR a correção passa nos testes

GLM-5 passou · 8/8 cases

Here is the fixed code: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` **Explanation:** The bug stems from initializing `best` and `cur` to zero, which causes the function to count the number of *transitions* between adjacent elements rather than the total number of items in the run, resulting in a return value that is always one less than the actual length (reporting 0 for a single element and 1 for a pair). By initializing the counters to 1 and resetting `cur` to 1 when a streak breaks, the logic correctly counts the items themselves; adding an explicit check for an empty list ensures the function handles the zero-element edge case correctly.

saída 2907 tok (+2694 pensamento) latência 73.7 s

Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICAR JSON válido, esquema exato

GLM-5 passou · 5/5 fields, guidance "withheld pending the Q4 close"

```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld pending the Q4 close" } ```

saída 3620 tok (+3561 pensamento) latência 91.8 s

Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICAR 120 palavras, 0 palavras proibidas

GLM-5 passou · 119 words, 0 banned, 1 question

We are thrilled to introduce Global Prompt Caching, a powerful new capability within our API gateway designed to optimize your AI operations. By intelligently storing prompt responses across every supported provider, this feature drastically reduces latency and cuts operational costs. Instead of processing identical requests repeatedly, our system serves cached results instantly, ensuring consistent performance even during high-traffic periods. Why pay full price for repeated inference on the same inputs? This update gives developers fine-grained control over cache lifetimes and hit rates, allowing for predictable budgeting and faster application response times. You can activate this functionality directly in your dashboard settings today. Start maximizing your efficiency now and deliver a snappier experience to your end-users without unnecessary API expenditure.

saída 715 tok (+571 pensamento) latência 18.9 s

Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.

Use o GLM-5 em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="glm-5",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Sobre o GLM-5

  • Em relação ao seu antecessor, a Z.AI escalou os parâmetros de 355B (32B ativados) para 744B (40B ativados) e os dados de pré-treinamento de 23T para 28,5T tokens, adicionando atenção esparsa e o framework de aprendizado por reforço assíncrono Slime.
  • Ele oferece uma janela de contexto de 200K, até 128K tokens de saída, modos de raciocínio (thinking), function calling, cache de contexto e pesos abertos, com a Z.AI descrevendo desempenho de código e agente open-source de ponta.
  • Além de código, a página do modelo nomeia o trabalho documental que a própria equipe mira: extração de dados estruturados de contratos e documentos financeiros, tradução profissional, inspeção de qualidade em atendimento ao cliente, e escrita de role-play ou storyboard que precisa se manter no personagem.
  • O raciocínio é definido por um objeto thinking cujo padrão enabled, nesta geração, significa que o modelo decide por conta própria se raciocina antes de responder, em vez de ser forçado a isso; o trace volta em um campo reasoning_content separado, transmitido antes da resposta, e os traces de turnos anteriores são removidos por padrão.
  • A chamada de ferramentas aceita até 128 funções com streaming incremental dos argumentos, ferramentas MCP externas se conectam diretamente, saída em objeto JSON é suportada e o cache de prefixos repetidos é automático.
  • Os pesos são publicados sob a licença MIT.
  • A Synthorai serve o GLM-5 pelo seu endpoint compatível com OpenAI, então os SDKs existentes funcionam sem alterações.

Perguntas frequentes

A API do GLM-5 é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $1/M de tokens de entrada, só esse crédito já cobre cerca de 125 requisições de ~8K tokens ao GLM-5.

Em que o GLM-5 é melhor?

Escalado para 744B parâmetros, 40B ativados; atenção esparsa mais aprendizado por reforço assíncrono; pesos abertos com janela de contexto de 200K. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o GLM-5?

Na Synthorai, o GLM-5 custa $1 por milhão de tokens de entrada e $3.2 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.2/M.

O GLM-5 suporta cache de prompts?

Sim, automaticamente: prompts servidos pela Z.ai entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $0.2/M, contra $1/M sem cache. Guia de cache de prompts →

Como obtenho acesso ao GLM-5?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="glm-5" e pronto. Uma única chave de API cobre todos os modelos do gateway.

O GLM-5 é open source?

Sim, os pesos são publicados sob a MIT License. Ou dispense as GPUs: a versão hospedada aqui é pagamento por uso, sem infraestrutura para operar. Como rodar modelos de pesos abertos →

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →