GLM-5 ist Z.AIs Foundation-Modell der neuen Generation, gebaut für agentisches Engineering, mit Fokus auf komplexes System-Engineering und langfristige Agent-Aufgaben.
- Eingabe
- Text $1/M
- Ausgabe
- Text $3.2/M
- Cache-Read
- $0.2/M
- Kontext
- 200K
- vs. GPT-4o
- ~80% günstiger
Benchmarks
Herstellerangaben: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Preis im Vergleich
Preisposition unter 60 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 200.000 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 131.072 |
Prompt Caching
| Modus | automatisch |
|---|
Thinking
| Anbieter-Parameter | thinking.type |
|---|---|
| Zulässige Werte | enabled · disabled |
| Standardwert | enabled; bei GLM-5 entscheidet das Modell selbst, ob es denkt gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Ja |
| Thinking-Verhalten | Die Spur wird in reasoning_content zurückgegeben; die Spuren früherer Turns werden standardmäßig gelöscht (clear_thinking true), und verschränkte Thinking-Blöcke sollten erhalten und gemeinsam mit den Tool-Ergebnissen zurückgegeben werden. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text → Text |
|---|---|
| Parameter | 744B gesamt · 40B aktiv MoE |
| Lizenz | MIT |
- Flaggschiff für agentisches Engineering: MoE mit 744B Parametern (40B aktiv), vortrainiert auf 28.5T Token mit DeepSeek Sparse Attention
- 200K Kontext / 128K max. Output
Ein Prompt, gemessen über das Gateway
GLM-5 bestanden · 3 sentences
Enabling reasoning forces the model to perform multiple hidden steps to "think" through a problem, drastically increasing the volume of data processed per query compared to a standard response. Because our billing is directly tied to this processing volume, the additional computational work required for higher accuracy has proportionally doubled our consumption. Essentially, the spike reflects a trade-off where we are paying a higher variable cost to secure significantly better analytical outcomes.
Ausgabe 1393 tok (+1308 Denken) Latenz 36.0 s
Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.
GLM-5 bestanden · 8/8 cases
Here is the fixed code: ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` **Explanation:** The bug stems from initializing `best` and `cur` to zero, which causes the function to count the number of *transitions* between adjacent elements rather than the total number of items in the run, resulting in a return value that is always one less than the actual length (reporting 0 for a single element and 1 for a pair). By initializing the counters to 1 and resetting `cur` to 1 when a streak breaks, the logic correctly counts the items themselves; adding an explicit check for an empty list ensures the function handles the zero-element edge case correctly.
Ausgabe 2907 tok (+2694 Denken) Latenz 73.7 s
Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.
GLM-5 bestanden · 5/5 fields, guidance "withheld pending the Q4 close"
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": "withheld pending the Q4 close" } ```
Ausgabe 3620 tok (+3561 Denken) Latenz 91.8 s
Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.
GLM-5 bestanden · 119 words, 0 banned, 1 question
We are thrilled to introduce Global Prompt Caching, a powerful new capability within our API gateway designed to optimize your AI operations. By intelligently storing prompt responses across every supported provider, this feature drastically reduces latency and cuts operational costs. Instead of processing identical requests repeatedly, our system serves cached results instantly, ensuring consistent performance even during high-traffic periods. Why pay full price for repeated inference on the same inputs? This update gives developers fine-grained control over cache lifetimes and hit rates, allowing for predictable budgeting and faster application response times. You can activate this functionality directly in your dashboard settings today. Start maximizing your efficiency now and deliver a snappier experience to your end-users without unnecessary API expenditure.
Ausgabe 715 tok (+571 Denken) Latenz 18.9 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.
GLM-5 in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="glm-5",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "glm-5",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "glm-5",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("glm-5")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über GLM-5
- Gegenüber dem Vorgänger skalierte Z.AI die Parameter von 355B (32B aktiviert) auf 744B (40B aktiviert) und die Vortrainingsdaten von 23T auf 28.5T Token und ergänzte Sparse Attention sowie das asynchrone Reinforcement-Learning-Framework Slime.
- Es bietet ein Kontextfenster von 200K, bis zu 128K Output-Token, Thinking-Modi, Function Calling, Context-Caching und offene Gewichte, wobei Z.AI Open-Source-Coding- und Agent-Leistung auf dem neuesten Stand beschreibt.
- Über Code hinaus benennt die Modellseite dokumentenlastige Arbeit, auf die das eigene Team zielt: das Extrahieren strukturierter Daten aus Verträgen und Finanzdokumenten, professionelle Übersetzung, Qualitätsprüfung im Kundenservice sowie Rollenspiel- oder Storyboard-Schreiben, das in der Rolle bleiben muss.
- Thinking wird über ein thinking-Objekt gesetzt, dessen Standardwert enabled für diese Generation bedeutet, dass das Modell selbst entscheidet, ob es vor der Antwort reasoniert, statt dazu gezwungen zu werden; die Spur kommt in einem separaten reasoning_content-Feld zurück, der Antwort vorangestreamt, und die Spuren früherer Turns werden standardmäßig entfernt.
- Tool Calling akzeptiert bis zu 128 Funktionen mit inkrementellem Streaming der Tool-Argumente, externe MCP-Tools lassen sich direkt anbinden, JSON-Objekt-Ausgabe wird unterstützt, und das Caching wiederholter Präfixe erfolgt automatisch.
- Die Gewichte sind unter der MIT-Lizenz veröffentlicht.
- Synthorai stellt GLM-5 über seinen OpenAI-kompatiblen Endpoint bereit, sodass bestehende SDKs unverändert funktionieren.
FAQ
Lässt sich die GLM-5 API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $1/M Input-Tokens deckt allein dieses Guthaben rund 125 Requests mit je ~8K Tokens gegen GLM-5 ab.
Worin ist GLM-5 am besten?
Auf 744B Parameter, 40B aktiviert, skaliert; Sparse Attention plus asynchrones Reinforcement Learning; offene Gewichte mit 200K-Kontextfenster. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet GLM-5?
GLM-5 kostet auf Synthorai $1 pro Million Input-Tokens und $3.2 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.2/M abgerechnet.
Unterstützt GLM-5 Prompt-Caching?
Ja, automatisch: Über Z.ai ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Input-Tokens werden mit $0.2/M statt $1/M (ungecacht) abgerechnet. Prompt-Caching-Guide →
Wie erhalte ich Zugang zu GLM-5?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="glm-5", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Ist GLM-5 Open Source?
Ja, die Gewichte sind unter der MIT-Lizenz veröffentlicht. Oder Sie sparen sich die GPUs: Die gehostete Version hier läuft mit nutzungsbasierter Abrechnung, ganz ohne eigene Infrastruktur. Open-Weight-Modelle betreiben →
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.