Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.
Questo modello è stato ritirato dal catalogo attivo. Le informazioni qui sotto sono d'archivio. Il vendor consiglia la migrazione a glm-5.2.

GLM-5.1

Rilasciato 2026-04-07

chatCodiceRagionamentoChiamata di strumentiCaching dei prompt

GLM-5.1 è il modello di fondazione di punta di Z.AI progettato per i compiti a lungo orizzonte, descritto ufficialmente come in grado di lavorare in modo continuo e autonomo su un singolo compito fino a 8 ore, coprendo pianificazione, esecuzione, test, correzione e consegna.

Input
testo $1.4/M
Output
testo $4.4/M
Lettura cache
$0.26/M
Contesto
200K
vs GPT-4o
~72% più economico

Il prezzo nel contesto

Posizione del prezzo tra 60 modelli comparabili

Input$1.4/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$4.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.26/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 200.000
Output massimo (specifica del vendor) 131.072

Caching prompt

Modalità automatico

Ragionamento

Parametro del fornitore thinking.type
Valori accettati enabled · disabled
Valore predefinito enabled, ed è il modello a determinare automaticamente se pensare applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento La traccia viene restituita in reasoning_content; le tracce dei turni precedenti vengono cancellate di default (clear_thinking true), e i blocchi di interleaved thinking vanno conservati e restituiti insieme ai risultati degli strumenti. Nessun controllo reasoning_effort: è documentato solo per GLM-5.2.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo → testo
Parametri 744B totali · 40B attivi MoE
Licenza MIT
  • Flagship di nuova generazione per l'ingegneria agentica (744B-A40B): lavora in autonomia fino a 8 ore in una singola esecuzione attraverso migliaia di chiamate a strumenti
  • 200K di contesto / 128K di output massimo

fonte: documentazione ufficiale Z.ai ↗

Usa GLM-5.1 in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="glm-5.1",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Informazioni su GLM-5.1

  • Costruito su GLM-5, mette l'accento su un ciclo di sperimentazione, analisi e ottimizzazione anziché sulla generazione in un solo passaggio, abilitando esplorazione autonoma, miglioramento continuo e consegna stabile in ambienti di ingegneria complessi.
  • Il modo in cui Z.AI inquadra l'aggiornamento riguarda la resistenza più che la capacità di picco: là dove il rilascio precedente si stabilizza presto dentro un ciclo agentico, GLM-5.1 è documentato come capace di sostenere l'ottimizzazione per centinaia di round e migliaia di chiamate agli strumenti, con un giudizio migliore sui problemi ambigui.
  • Il modello offre una finestra di contesto da 200K con fino a 128K token di output, oltre a modalità thinking e function calling.
  • I carichi di lavoro citati vanno oltre il codice, fino al dialogo generale, alla scrittura creativa, alla generazione di frontend e artifact e alla produttività da ufficio.
  • Il thinking si commuta tramite lo stesso oggetto thinking del resto della linea e per impostazione predefinita lascia decidere al modello, con la traccia restituita in un campo reasoning_content separato; si noti che il controllo del reasoning effort aggiunto in seguito da Z.AI è documentato come esclusivo di GLM-5.2, quindi questo modello non ha una manopola per l'effort.
  • Strumenti MCP, streaming, output JSON e caching automatico del prefisso sono tutti supportati, e i pesi sono pubblicati sotto la licenza MIT.
  • Synthorai espone GLM-5.1 dietro il suo endpoint compatibile OpenAI per un'integrazione immediata.

FAQ

L'API di GLM-5.1 si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1.4/M token in input, quel credito da solo copre circa 89 richieste da ~8K token verso GLM-5.1.

In cosa eccelle GLM-5.1?

Lavoro autonomo fino a 8 ore; loop sperimenta-analizza-ottimizza anziché generazione in un solo passaggio; copertura dalla pianificazione a test e consegna. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa GLM-5.1?

Su Synthorai, GLM-5.1 costa $1.4 per milione di token in input e $4.4 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.26/M.

GLM-5.1 supporta il caching dei prompt?

Sì, in automatico: i prompt serviti da Z.ai vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.26/M contro $1.4/M senza cache. Guida al caching dei prompt →

Come ottengo l'accesso a GLM-5.1?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="glm-5.1" e hai finito: una sola chiave API copre tutti i modelli del gateway.

GLM-5.1 è open source?

Sì: i pesi sono pubblicati sotto MIT License. Oppure salta le GPU: la versione hosted qui è con pagamento a consumo, senza infrastruttura da gestire. Eseguire modelli open-weight →

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →