Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.
Questo modello è stato ritirato dal catalogo attivo. Le informazioni qui sotto sono d'archivio.

GLM-5-Turbo

Rilasciato 2026-03-15

chatCodiceRagionamentoChiamata di strumentiCaching dei prompt

GLM-5-Turbo è un modello di fondazione di Z.AI profondamente ottimizzato per lo scenario di agent OpenClaw.

Input
testo $1.2/M
Output
testo $4/M
Lettura cache
$0.24/M
Contesto
205K
vs GPT-4o
~76% più economico

Il prezzo nel contesto

Posizione del prezzo tra 60 modelli comparabili

Input$1.2/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.24/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 200.000
Output massimo (specifica del vendor) 131.072

Caching prompt

Modalità automatico

Ragionamento

Parametro del fornitore thinking.type
Valori accettati enabled · disabled
Valore predefinito enabled, ed è il modello a determinare automaticamente se pensare applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento La traccia viene restituita in reasoning_content; le tracce dei turni precedenti vengono cancellate di default (clear_thinking true), e i blocchi di interleaved thinking vanno conservati e restituiti insieme ai risultati degli strumenti.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo → testo
  • Variante di GLM-5 ottimizzata per la velocità e disponibile solo via API, tarata sullo scenario agent OpenClaw: invocazione degli strumenti più affidabile e stabilità sui task di lunga durata
  • 200K di contesto / 128K di output massimo

fonte: documentazione ufficiale Z.ai ↗

Usa GLM-5-Turbo in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="glm-5-turbo",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Informazioni su GLM-5-Turbo

  • Rispetto al GLM-5 base, la documentazione ufficiale evidenzia quattro miglioramenti mirati: invocazione degli strumenti più precisa, scomposizione più forte delle istruzioni complesse, gestione consapevole del tempo per i compiti pianificati e persistenti e throughput più alto sulle catene logiche lunghe.
  • Fornisce una finestra di contesto da 200K e fino a 128K token di output, con modalità thinking, streaming, function calling, caching del contesto, output JSON strutturato e integrazione degli strumenti MCP.
  • Z.AI presenta il rilascio come un miglioramento della stabilità e dell'efficienza nei compiti di agent a catena lunga più che dell'intelligenza pura, ed elenca gli ambiti su cui è stato messo a punto: installazione e configurazione, sviluppo di codice, raccolta di informazioni, analisi dei dati, creazione di contenuti, produttività da ufficio, analisi finanziaria, ingegneria delle operations e ricerca.
  • Quell'elenco è il modo onesto di leggerlo: uno specialista dell'harness di agent più che un fratello generalista.
  • Il thinking segue la stessa convenzione di GLM-5, attivo per impostazione predefinita con il modello che decide se ragionare, e la traccia restituita separatamente dalla risposta.
  • Le skill esterne possono essere invocate accanto agli strumenti e gli argomenti delle chiamate agli strumenti possono essere trasmessi in streaming in modo incrementale.
  • Due cose lo distinguono dal resto della linea: Z.AI non pubblica il suo numero di parametri e, a differenza di GLM-5, 5.1 e 5.2, non ha un rilascio a pesi aperti.
  • È solo via API.
  • Su Synthorai, GLM-5-Turbo è richiamabile tramite la consueta API compatibile OpenAI.

FAQ

L'API di GLM-5-Turbo si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1.2/M token in input, quel credito da solo copre circa 104 richieste da ~8K token verso GLM-5-Turbo.

In cosa eccelle GLM-5-Turbo?

Profondamente ottimizzato per lo scenario di agent OpenClaw; invocazione degli strumenti e decomposizione delle istruzioni più precise; gestione consapevole del tempo di compiti pianificati e persistenti. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa GLM-5-Turbo?

Su Synthorai, GLM-5-Turbo costa $1.2 per milione di token in input e $4 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.24/M.

GLM-5-Turbo supporta il caching dei prompt?

Sì, in automatico: i prompt serviti da Z.ai vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.24/M contro $1.2/M senza cache. Guida al caching dei prompt →

Come ottengo l'accesso a GLM-5-Turbo?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="glm-5-turbo" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →