GLM-5.2 è il modello di punta di Z.AI costruito per l'era dei compiti a lungo orizzonte, che estende la finestra di contesto a 1M di token con fino a 128K in output; la documentazione insiste sul rendere il contesto da 1M davvero utilizzabile per il lavoro su scala di progetto.
- Input
- testo $1.4/M
- Output
- testo $4.4/M
- Lettura cache
- $0.26/M
- Contesto
- 1M
- vs GPT-4o
- ~72% più economico
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.000.000 |
|---|---|
| Output massimo (specifica del vendor) | 131.072 |
Caching prompt
| Modalità | automatico |
|---|
Ragionamento
| Parametro del fornitore | thinking.type + reasoning_effort |
|---|---|
| Valori accettati | thinking.type enabled · disabled; reasoning_effort none · minimal · low · medium · high · xhigh · max (none and minimal skip thinking, low and medium map to high, xhigh maps to max) |
| Valore predefinito | enabled, con reasoning_effort su max: l'unico GLM con una manopola dell'effort, e di default è al massimo applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | La traccia viene restituita in reasoning_content; le tracce dei turni precedenti vengono cancellate di default sull'endpoint API standard, e i blocchi di thinking devono essere restituiti insieme ai risultati degli strumenti perché l'interleaved thinking funzioni. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo → testo |
|---|---|
| Parametri | 744B totali · 40B attivi MoE |
| Licenza | MIT |
Flagship a lungo orizzonte (744B-A40B) con contesto utilizzabile da 1M di token / 128K di output massimo, livelli di effort del thinking configurabili ed efficienza sparse-attention IndexShare a contesto da 1M.
Un solo prompt, misurato attraverso il gateway
GLM-5.2 superato · 3 sentences
Enabling reasoning means the LLM now generates thousands of invisible "thinking" tokens to systematically work through complex problems before producing a final answer. Because our cloud providers bill for these internal processing steps at the same rate as standard output, our billable token volume per query has doubled. While this increases our direct API costs, it drastically reduces error rates and manual review labor, ultimately lowering our total cost per resolved transaction.
out 1223 tok (+1138 ragionamento) latenza 17.1 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
GLM-5.2 mancato · 1/8 cases (fails [1])
```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 […]
out 4097 tok (+4036 ragionamento) latenza 58.4 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
GLM-5.2 superato · 5/5 fields, guidance "withheld"
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld" } ```
out 1947 tok (+1893 ragionamento) latenza 30.9 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
GLM-5.2 superato · 120 words, 0 banned, 1 question
We are introducing Caching for our API Gateway, the smartest way to optimize your workflows. Why pay for the exact same response twice? Now, you can automatically store and reuse prompt results across multiple AI providers, drastically reducing latency and overall operational costs. If a user submits a duplicate query, the gateway serves the cached answer instantly, regardless of whether you route to OpenAI, Anthropic, or others. This directly translates to faster applications and significantly lower monthly API bills. You can easily configure your specific caching rules within the developer dashboard and watch your efficiency soar. Stop wasting your valuable tokens on completely redundant computations. Upgrade to the latest gateway version today and experience the future of intelligent prompt management.
out 11125 tok (+10984 ragionamento) latenza 114.8 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa GLM-5.2 in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="glm-5.2",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "glm-5.2",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "glm-5.2",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("glm-5.2")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su GLM-5.2
- Rispetto a GLM-5.1, la pagina ufficiale evidenzia un'esecuzione più stabile dei compiti a lungo orizzonte, una coerenza più forte nel seguire gli standard di ingegneria su contesti estesi, la comprensione su scala di progetto con refactoring multi-file e cicli completi di debug on-device per lo sviluppo mobile e client, oltre allo sviluppo di mini-program e piccoli giochi e alla riproduzione della ricerca.
- Viene pubblicata anche l'efficienza che sta dietro alla finestra più lunga: uno schema IndexShare consente a un singolo indicizzatore leggero di servire ogni quattro layer del transformer, riducendo il calcolo per token a 1M di contesto, con un layer di multi-token prediction migliorato che alza l'accettazione dello speculative decoding.
- È anche l'unico modello della linea con un controllo reasoning_effort, un insieme documentato di livelli che nella pratica si riducono a saltare il thinking, a un'impostazione alta e a un'impostazione massima, con l'API ospitata che usa il massimo come valore predefinito: una richiesta che non imposta nulla è quindi una richiesta che ragiona a fondo.
- Per il resto il thinking si comporta come altrove nella linea GLM-5, restituendo la sua traccia in un campo separato, e tool calling, MCP, output JSON e caching automatico si mantengono.
- I pesi sono sotto licenza MIT.
- Quando si chiama GLM-5.2 su Synthorai, l'endpoint compatibile OpenAI ne fa un aggiornamento immediato per i carichi di lavoro di agent a contesto lungo.
FAQ
L'API di GLM-5.2 si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1.4/M token in input, quel credito da solo copre circa 89 richieste da ~8K token verso GLM-5.2.
In cosa eccelle GLM-5.2?
Contesto esteso a 1M di token utilizzabili; comprensione su scala di progetto con refactoring multi-file; loop di debugging on-device per lo sviluppo mobile. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa GLM-5.2?
Su Synthorai, GLM-5.2 costa $1.4 per milione di token in input e $4.4 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.26/M.
GLM-5.2 supporta il caching dei prompt?
Sì, in automatico: i prompt serviti da Z.ai vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.26/M contro $1.4/M senza cache. Guida al caching dei prompt →
Come ottengo l'accesso a GLM-5.2?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="glm-5.2" e hai finito: una sola chiave API copre tutti i modelli del gateway.
GLM-5.2 è open source?
Sì: i pesi sono pubblicati sotto MIT License (repository ufficiale linkato nella sezione «Informazioni»). Oppure salta le GPU: la versione hosted qui è con pagamento a consumo, senza infrastruttura da gestire. Eseguire modelli open-weight →
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.