O GLM-5.2 é o modelo carro-chefe da Z.AI construído para a era das tarefas de longo horizonte, estendendo a janela de contexto para 1M tokens com até 128K de saída; a documentação enfatiza tornar o contexto de 1M realmente utilizável para trabalho em escala de projeto.
- Entrada
- texto $1.4/M
- Saída
- texto $4.4/M
- Leitura de cache
- $0.26/M
- Contexto
- 1M
- vs GPT-4o
- ~72% mais barato
Benchmarks
Publicado pelos fornecedores: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
O preço em contexto
Posição do preço entre 60 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Tokens
| Janela de contexto (especificação do fornecedor) | 1.000.000 |
|---|---|
| Saída máxima (especificação do fornecedor) | 131.072 |
Cache de prompts
| Modo | automático |
|---|
Raciocínio
| Parâmetro do fornecedor | thinking.type + reasoning_effort |
|---|---|
| Valores aceites | thinking.type enabled · disabled; reasoning_effort none · minimal · low · medium · high · xhigh · max (none and minimal skip thinking, low and medium map to high, xhigh maps to max) |
| Valor predefinido | enabled, com reasoning_effort em max: o único GLM com um controle de esforço, e ele já vem no topo da escala aplicado quando o pedido nada indica |
| Pode ser desativado | Sim |
| Comportamento do raciocínio | O trace retorna em reasoning_content; os traces dos turnos anteriores são limpos por padrão no endpoint padrão da API, e os blocos de raciocínio precisam ser devolvidos com os resultados das ferramentas para que o raciocínio intercalado funcione. |
| Parâmetro | reasoning_effort |
| Valores | minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima |
Modelo
| Modalidades | texto → texto |
|---|---|
| Parâmetros | 744B no total · 40B ativos MoE |
| Licença | MIT |
Carro-chefe de longo horizonte (744B-A40B) com contexto utilizável de 1M tokens / saída máxima de 128K, níveis configuráveis de esforço de raciocínio e a eficiência de atenção esparsa IndexShare em contexto de 1M.
conforme documentação oficial da Z.ai ↗
Um prompt, medido pelo gateway
GLM-5.2 passou · 3 sentences
Enabling reasoning means the LLM now generates thousands of invisible "thinking" tokens to systematically work through complex problems before producing a final answer. Because our cloud providers bill for these internal processing steps at the same rate as standard output, our billable token volume per query has doubled. While this increases our direct API costs, it drastically reduces error rates and manual review labor, ultimately lowering our total cost per resolved transaction.
saída 1223 tok (+1138 pensamento) latência 17.1 s
Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.
GLM-5.2 falhou · 1/8 cases (fails [1])
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 […]
saída 4097 tok (+4036 pensamento) latência 58.4 s
Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.
GLM-5.2 passou · 5/5 fields, guidance "withheld"
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld" } ```
saída 1947 tok (+1893 pensamento) latência 30.9 s
Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.
GLM-5.2 passou · 120 words, 0 banned, 1 question
We are introducing Caching for our API Gateway, the smartest way to optimize your workflows. Why pay for the exact same response twice? Now, you can automatically store and reuse prompt results across multiple AI providers, drastically reducing latency and overall operational costs. If a user submits a duplicate query, the gateway serves the cached answer instantly, regardless of whether you route to OpenAI, Anthropic, or others. This directly translates to faster applications and significantly lower monthly API bills. You can easily configure your specific caching rules within the developer dashboard and watch your efficiency soar. Stop wasting your valuable tokens on completely redundant computations. Upgrade to the latest gateway version today and experience the future of intelligent prompt management.
saída 11125 tok (+10984 pensamento) latência 114.8 s
Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.
Use o GLM-5.2 em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="glm-5.2",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "glm-5.2",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "glm-5.2",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("glm-5.2")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Sobre o GLM-5.2
- Em relação ao GLM-5.1, a página oficial destaca execução de tarefas de longo horizonte mais estável, consistência mais forte em seguir padrões de engenharia em contextos estendidos, entendimento em escala de projeto com refatoração de múltiplos arquivos e loops completos de depuração no dispositivo para desenvolvimento mobile e de cliente, ao lado de desenvolvimento de mini-programas e de pequenos jogos e de reprodução de pesquisas.
- A eficiência por trás da janela maior também é publicada: um esquema IndexShare permite que um indexador leve atenda a cada quatro camadas do transformer, cortando o compute por token em contexto de 1M, com uma camada aprimorada de predição de múltiplos tokens elevando a aceitação da decodificação especulativa.
- Este é também o único modelo da linha com um controle reasoning_effort, um conjunto documentado de níveis que na prática se reduz a pular o raciocínio, uma configuração high e uma configuração máxima, com a API hospedada assumindo a máxima por padrão, de modo que uma requisição que não define nada é uma requisição que raciocina a fundo.
- Fora isso, o raciocínio se comporta como no restante da linha GLM-5, retornando seu trace em um campo separado, e chamada de ferramentas, MCP, saída JSON e cache automático seguem iguais.
- Os pesos têm licença MIT.
- Quando você chama o GLM-5.2 na Synthorai, o endpoint compatível com OpenAI o torna uma atualização drop-in para cargas de trabalho de agente de contexto longo.
Perguntas frequentes
A API do GLM-5.2 é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $1.4/M de tokens de entrada, só esse crédito já cobre cerca de 89 requisições de ~8K tokens ao GLM-5.2.
Em que o GLM-5.2 é melhor?
Contexto estendido para 1M tokens utilizáveis; entendimento em escala de projeto com refatoração de múltiplos arquivos; loops de depuração no dispositivo para desenvolvimento mobile. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o GLM-5.2?
Na Synthorai, o GLM-5.2 custa $1.4 por milhão de tokens de entrada e $4.4 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.26/M.
O GLM-5.2 suporta cache de prompts?
Sim, automaticamente: prompts servidos pela Z.ai entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $0.26/M, contra $1.4/M sem cache. Guia de cache de prompts →
Como obtenho acesso ao GLM-5.2?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="glm-5.2" e pronto. Uma única chave de API cobre todos os modelos do gateway.
O GLM-5.2 é open source?
Sim, os pesos são publicados sob a MIT License (repositório oficial com link na seção Sobre). Ou dispense as GPUs: a versão hospedada aqui é pagamento por uso, sem infraestrutura para operar. Como rodar modelos de pesos abertos →
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.