GLM-5.1 ist Z.AIs Flaggschiff-Foundation-Modell für langfristige Aufgaben, offiziell beschrieben als fähig, bis zu 8 Stunden ununterbrochen und autonom an einer einzelnen Aufgabe zu arbeiten, von der Planung über Ausführung, Test und Fehlerbehebung bis zur Auslieferung.
- Eingabe
- Text $1.4/M
- Ausgabe
- Text $4.4/M
- Cache-Read
- $0.26/M
- Kontext
- 200K
- vs. GPT-4o
- ~72% günstiger
Preis im Vergleich
Preisposition unter 60 vergleichbaren Modellen
Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.
Spezifikationen & Limits
Tokens
| Kontextfenster (Herstellerangabe) | 200.000 |
|---|---|
| Max. Output (Anbieter-Spezifikation) | 131.072 |
Prompt Caching
| Modus | automatisch |
|---|
Thinking
| Anbieter-Parameter | thinking.type |
|---|---|
| Zulässige Werte | enabled · disabled |
| Standardwert | enabled; das Modell entscheidet selbst, ob es denkt gilt, wenn die Anfrage nichts angibt |
| Abschaltbar | Ja |
| Thinking-Verhalten | Die Spur wird in reasoning_content zurückgegeben; die Spuren früherer Turns werden standardmäßig gelöscht (clear_thinking true), und verschränkte Thinking-Blöcke sollten erhalten und gemeinsam mit den Tool-Ergebnissen zurückgegeben werden. Keine reasoning_effort-Steuerung: Sie ist ausschließlich für GLM-5.2 dokumentiert. |
| Parameter | reasoning_effort |
| Werte | minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt |
Modell
| Modalitäten | Text → Text |
|---|---|
| Parameter | 744B gesamt · 40B aktiv MoE |
| Lizenz | MIT |
- Flaggschiff der nächsten Generation für agentisches Engineering (744B-A40B): arbeitet in einem einzigen Durchlauf bis zu 8 Stunden autonom über Tausende von Tool-Aufrufen hinweg
- 200K Kontext / 128K max. Output
GLM-5.1 in 30 Sekunden nutzen
OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="glm-5.1",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "glm-5.1",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.1",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "glm-5.1",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("glm-5.1")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Über GLM-5.1
- Aufbauend auf GLM-5 betont es eine Schleife aus Experimentieren, Analysieren und Optimieren statt einer Generierung in einem Durchgang und ermöglicht autonome Exploration, kontinuierliche Verbesserung und stabile Auslieferung in komplexen Engineering-Umgebungen.
- Z.AI beschreibt das Upgrade als Frage der Ausdauer statt der Spitzenfähigkeit: Wo das vorherige Release in einer agentischen Schleife früh stagniert, ist GLM-5.1 dokumentiert als fähig, die Optimierung über Hunderte von Runden und Tausende von Tool-Aufrufen aufrechtzuerhalten, mit besserem Urteilsvermögen bei mehrdeutigen Problemen.
- Das Modell bietet ein Kontextfenster von 200K mit bis zu 128K Output-Token, dazu Thinking-Modi und Function Calling.
- Die benannten Workloads reichen über Code hinaus bis zu allgemeinem Dialog, kreativem Schreiben, Frontend- und Artefaktgenerierung sowie Büroproduktivität.
- Thinking wird über dasselbe thinking-Objekt wie im Rest der Reihe geschaltet und überlässt die Entscheidung standardmäßig dem Modell, wobei die Spur in einem separaten reasoning_content-Feld zurückkommt; zu beachten ist, dass die später von Z.AI ergänzte Steuerung des Reasoning-Aufwands als GLM-5.2-exklusiv dokumentiert ist, dieses Modell also keinen Effort-Regler hat.
- MCP-Tools, Streaming, JSON-Ausgabe und automatisches Prefix-Caching werden alle unterstützt, und die Gewichte sind unter der MIT-Lizenz veröffentlicht.
- Synthorai stellt GLM-5.1 hinter seinem OpenAI-kompatiblen Endpoint für die direkte Integration bereit.
FAQ
Lässt sich die GLM-5.1 API kostenlos testen?
Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $1.4/M Input-Tokens deckt allein dieses Guthaben rund 89 Requests mit je ~8K Tokens gegen GLM-5.1 ab.
Worin ist GLM-5.1 am besten?
Arbeitet autonom bis zu 8 Stunden; Experimentieren-Analysieren-Optimieren-Schleife statt einmaliger Generierung; deckt Planung bis Tests und Auslieferung ab. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.
Was kostet GLM-5.1?
GLM-5.1 kostet auf Synthorai $1.4 pro Million Input-Tokens und $4.4 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.26/M abgerechnet.
Unterstützt GLM-5.1 Prompt-Caching?
Ja, automatisch: Über Z.ai ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Input-Tokens werden mit $0.26/M statt $1.4/M (ungecacht) abgerechnet. Prompt-Caching-Guide →
Wie erhalte ich Zugang zu GLM-5.1?
Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="glm-5.1", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.
Ist GLM-5.1 Open Source?
Ja, die Gewichte sind unter der MIT-Lizenz veröffentlicht. Oder Sie sparen sich die GPUs: Die gehostete Version hier läuft mit nutzungsbasierter Abrechnung, ganz ohne eigene Infrastruktur. Open-Weight-Modelle betreiben →
Verwandte Modelle
Vergleichen
Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.