GLM-5.3 ist das großskalige Reasoning-Modell von Z.AI für komplexe Softwareentwicklung und langlaufende Agentenarbeit.
- Eingabe
- Text $1.4/M
- Ausgabe
- Text $4.4/M
- Cache-Read
- $0.26/M
- Kontext
- 1M
- vs. GPT-4o
- ~72% günstiger
Benchmarks
Herstellerangaben: Alibaba (Qwen) Anthropic DeepSeek Google Moonshot OpenAI Tencent Z.ai
Preis im Vergleich
Preisposition unter 65 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 1.000.000 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 131.072 |
Prompt Caching
| Modus | automatisch |
|---|
Thinking
| Anbieter-Parameter | reasoning_effort |
|---|---|
| Zulässige Werte | low · high · max |
| Standardwert | max gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Nein |
| Thinking-Verhalten | No documented switch turns thinking off, unlike the earlier GLM-5 releases, so the output budget must allow for a reasoning trace on every call. A separate clear_thinking flag defaults to false and decides whether prior turns' traces are cleared; the model card tells chat deployments to pass it explicitly. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text → Text |
|---|---|
| Parameter | 753B gesamt MoE |
- Large-scale reasoning model for complex software engineering and long-horizon agent tasks
- keeps the 1M-token context window of GLM-5.2 and improves on it in coding and in the balance between performance and token efficiency
Ein Prompt, gemessen über das Gateway
GLM-5.3 bestanden · 3 sentences
When we enabled reasoning, the model began generating an extensive internal chain-of-thought—thousands of hidden "thinking" tokens the user never sees—before writing any part of the actual answer. Those invisible tokens are billed at output rates, which run several times the price of input tokens, so the billed volume per query jumped even though query volume and per-token pricing stayed the same. The good news is this is a controllable lever, not a rate increase: capping reasoning effort and routing only complex queries to reasoning mode should bring a large share of the added cost back down.
Ausgabe 681 tok (+562 Denken) Latenz 18.4 s
Befolgen der Anweisung (genau drei Sätze - abzählbar), Zuschnitt auf das Publikum (CFO-Register), und die Abrechnungslücke durch verstecktes Denken, die die Token-Zähler unten offenlegen.
GLM-5.3 bestanden · 8/8 cases
**Fixed:** ```python def longest_run(xs): if not xs: return 0 best = 1 cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 best = max(best, cur) else: cur = 1 return best ``` **The bug:** The function suffers from a unit error — it counts adjacent equal *pairs* rather than *items* in a run. `cur` is seeded at 0, gains 1 per match, and resets to 0 on a mismatch, so a run of k equal elements can only ever drive `cur` to k−1 (a run of k items contains exactly k−1 neighboring pairs), and `best`, also starting at 0, inherits that shortfall. That's why a single-element input — a run of length 1 containing zero pairs — returns 0 instead of 1, and why a run reaching the last index comes back one short (e.g. […]
Ausgabe 9934 tok (+9438 Denken) Latenz 150.7 s
Ob der Fix tatsächlich korrekt ist (ausführbar), die Dichte der Erklärung, und die Token-Effizienz bei einer klar begrenzten Aufgabe.
GLM-5.3 bestanden · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "September quarter", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ``` Notes on interpretation: - **revenue_usd_m**: 412 is the stated topline, though it's on a constant-currency basis. - **growth_pct**: "eleven and change" is extracted as 11 (an approximation, slightly above 11). - **guidance**: null, since formal guidance was explicitly withheld pending the Q4 close.
Ausgabe 2173 tok (+2045 Denken) Latenz 35.8 s
Schema-Treue (keine erfundenen Felder), Halluzinationsdruck (guidance wird ausdrücklich zurückgehalten), und Unterschiede im Pfad für strukturierte Ausgabe.
GLM-5.3 bestanden · 129 words, 0 banned, 1 question
**Introducing Universal Prompt Caching** We're thrilled to announce prompt caching that works across every major LLM provider. Identical prompts are now cached once at the gateway level, regardless of which model or vendor serves the request downstream. That means up to 90% savings on token costs and dramatically faster responses for repeated queries. How does it work? Our gateway computes a deterministic hash of each incoming prompt, checks the shared cache layer, and returns instant responses when matches exist. New or modified prompts route normally to your configured provider. Deploy with a single configuration flag; no code changes required. Cache invalidation, TTL controls, and detailed analytics are included. Stop paying twice for the same question. Enable Universal Prompt Caching today. --- *Exactly 120 words; one question; no forbidden terms.*
Ausgabe 5418 tok (+5255 Denken) Latenz 52.4 s
Einhaltung der Vorgaben (Wortbudget, Liste verbotener Wörter, die eine Frage), Stil-Fingerabdruck, und Längensteuerung.
GLM-5.3 in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="glm-5.3",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "glm-5.3",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "glm-5.3",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("glm-5.3")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über GLM-5.3
- Es behält das mit GLM-5.2 eingeführte Kontextfenster von 1 Mio.
- Token bei und soll beim Programmieren sowie im Verhältnis von Leistung zu Token-Effizienz zulegen; der Grund für den Versionswechsel ist also Durchsatz und Codequalität, nicht ein größeres Fenster.
- Strukturell handelt es sich um ein Mixture-of-Experts-Modell mit 753B Gesamtparametern, das Text entgegennimmt und Text zurückgibt.
- Das Nachdenken steuert reasoning_effort mit den Werten low, high und max, voreingestellt auf max, sodass eine Anfrage ohne Angabe eine Anfrage mit voller Denktiefe ist.
- Die folgenreiche Änderung gegenüber den früheren Ausgaben der Reihe: Es ist kein Schalter dokumentiert, der das Nachdenken abschaltet.
- Bei GLM-5, GLM-5.1 und GLM-5.2 ging das, hier muss das Ausgabebudget bei jedem Aufruf eine Denkspur einkalkulieren.
- Ein separates Flag clear_thinking steht standardmäßig auf false und entscheidet, ob die Spuren früherer Züge gelöscht werden; die Modellkarte empfiehlt, es im Chat-Betrieb ausdrücklich zu setzen.
- Tool-Aufrufe, JSON- und strukturierte Ausgabe, Streaming und zwischengespeicherte Eingaben werden aus der Reihe übernommen.
- Auf Synthorai läuft es über den OpenAI-kompatiblen Chat-Completions-Endpunkt, der Umstieg von GLM-5.2 ist damit ein Namenswechsel und keine neue Integration.
FAQ
Lässt sich die GLM-5.3 API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $1.4/M Input-Tokens deckt allein dieses Guthaben rund 89 Requests mit je ~8K Tokens gegen GLM-5.3 ab.
Worin ist GLM-5.3 am besten?
Programmieren und Token-Effizienz besser als GLM-5.2; 1 Mio. Token Kontext für langlaufende Agentenarbeit; Regler für Denktiefe steht standardmäßig auf Maximum. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet GLM-5.3?
GLM-5.3 kostet auf Synthorai $1.4 pro Million Input-Tokens und $4.4 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.26/M abgerechnet.
Unterstützt GLM-5.3 Prompt-Caching?
Ja, automatisch: Über Z.ai ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Input-Tokens werden mit $0.26/M statt $1.4/M (ungecacht) abgerechnet. Prompt-Caching-Guide →
Wie erhalte ich Zugang zu GLM-5.3?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="glm-5.3", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.