GLM-5.1 è il modello di fondazione di punta di Z.AI progettato per i compiti a lungo orizzonte, descritto ufficialmente come in grado di lavorare in modo continuo e autonomo su un singolo compito fino a 8 ore, coprendo pianificazione, esecuzione, test, correzione e consegna.
- Input
- testo $1.4/M
- Output
- testo $4.4/M
- Lettura cache
- $0.26/M
- Contesto
- 200K
- vs GPT-4o
- ~72% più economico
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 200.000 |
|---|---|
| Output massimo (specifica del vendor) | 131.072 |
Caching prompt
| Modalità | automatico |
|---|
Ragionamento
| Parametro del fornitore | thinking.type |
|---|---|
| Valori accettati | enabled · disabled |
| Valore predefinito | enabled, ed è il modello a determinare automaticamente se pensare applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | La traccia viene restituita in reasoning_content; le tracce dei turni precedenti vengono cancellate di default (clear_thinking true), e i blocchi di interleaved thinking vanno conservati e restituiti insieme ai risultati degli strumenti. Nessun controllo reasoning_effort: è documentato solo per GLM-5.2. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo → testo |
|---|---|
| Parametri | 744B totali · 40B attivi MoE |
| Licenza | MIT |
- Flagship di nuova generazione per l'ingegneria agentica (744B-A40B): lavora in autonomia fino a 8 ore in una singola esecuzione attraverso migliaia di chiamate a strumenti
- 200K di contesto / 128K di output massimo
Usa GLM-5.1 in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="glm-5.1",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "glm-5.1",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.1",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "glm-5.1",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("glm-5.1")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su GLM-5.1
- Costruito su GLM-5, mette l'accento su un ciclo di sperimentazione, analisi e ottimizzazione anziché sulla generazione in un solo passaggio, abilitando esplorazione autonoma, miglioramento continuo e consegna stabile in ambienti di ingegneria complessi.
- Il modo in cui Z.AI inquadra l'aggiornamento riguarda la resistenza più che la capacità di picco: là dove il rilascio precedente si stabilizza presto dentro un ciclo agentico, GLM-5.1 è documentato come capace di sostenere l'ottimizzazione per centinaia di round e migliaia di chiamate agli strumenti, con un giudizio migliore sui problemi ambigui.
- Il modello offre una finestra di contesto da 200K con fino a 128K token di output, oltre a modalità thinking e function calling.
- I carichi di lavoro citati vanno oltre il codice, fino al dialogo generale, alla scrittura creativa, alla generazione di frontend e artifact e alla produttività da ufficio.
- Il thinking si commuta tramite lo stesso oggetto thinking del resto della linea e per impostazione predefinita lascia decidere al modello, con la traccia restituita in un campo reasoning_content separato; si noti che il controllo del reasoning effort aggiunto in seguito da Z.AI è documentato come esclusivo di GLM-5.2, quindi questo modello non ha una manopola per l'effort.
- Strumenti MCP, streaming, output JSON e caching automatico del prefisso sono tutti supportati, e i pesi sono pubblicati sotto la licenza MIT.
- Synthorai espone GLM-5.1 dietro il suo endpoint compatibile OpenAI per un'integrazione immediata.
FAQ
L'API di GLM-5.1 si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1.4/M token in input, quel credito da solo copre circa 89 richieste da ~8K token verso GLM-5.1.
In cosa eccelle GLM-5.1?
Lavoro autonomo fino a 8 ore; loop sperimenta-analizza-ottimizza anziché generazione in un solo passaggio; copertura dalla pianificazione a test e consegna. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa GLM-5.1?
Su Synthorai, GLM-5.1 costa $1.4 per milione di token in input e $4.4 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.26/M.
GLM-5.1 supporta il caching dei prompt?
Sì, in automatico: i prompt serviti da Z.ai vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.26/M contro $1.4/M senza cache. Guida al caching dei prompt →
Come ottengo l'accesso a GLM-5.1?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="glm-5.1" e hai finito: una sola chiave API copre tutti i modelli del gateway.
GLM-5.1 è open source?
Sì: i pesi sono pubblicati sotto MIT License. Oppure salta le GPU: la versione hosted qui è con pagamento a consumo, senza infrastruttura da gestire. Eseguire modelli open-weight →
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.