Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.
Dieses Modell wurde aus dem aktiven Katalog genommen; die folgenden Informationen sind archiviert. Der Anbieter empfiehlt die Migration zu glm-5.2.

GLM-5.1

Veröffentlicht 2026-04-07

chatCodeReasoningTool-AufrufePrompt Caching

GLM-5.1 ist Z.AIs Flaggschiff-Foundation-Modell für langfristige Aufgaben, offiziell beschrieben als fähig, bis zu 8 Stunden ununterbrochen und autonom an einer einzelnen Aufgabe zu arbeiten, von der Planung über Ausführung, Test und Fehlerbehebung bis zur Auslieferung.

Eingabe
Text $1.4/M
Ausgabe
Text $4.4/M
Cache-Read
$0.26/M
Kontext
200K
vs. GPT-4o
~72% günstiger

Preis im Vergleich

Preisposition unter 60 vergleichbaren Modellen

Eingabe$1.4/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Ausgabe$4.4/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Cache-Lesen$0.26/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

Der Balken zeigt, wo der Preis dieses Modells unter allen Modellen derselben Art auf Synthorai liegt. An beiden Enden stehen das günstigste und das teuerste Modell. Es sind Grundpreise; Rabatte für Batch, Region und Cache-Schreibvorgänge stehen auf der Preisseite.

Spezifikationen & Limits

Tokens

Kontextfenster (Herstellerangabe) 200.000
Max. Output (Anbieter-Spezifikation) 131.072

Prompt Caching

Modus automatisch

Thinking

Anbieter-Parameter thinking.type
Zulässige Werte enabled · disabled
Standardwert enabled; das Modell entscheidet selbst, ob es denkt gilt, wenn die Anfrage nichts angibt
Abschaltbar Ja
Thinking-Verhalten Die Spur wird in reasoning_content zurückgegeben; die Spuren früherer Turns werden standardmäßig gelöscht (clear_thinking true), und verschränkte Thinking-Blöcke sollten erhalten und gemeinsam mit den Tool-Ergebnissen zurückgegeben werden. Keine reasoning_effort-Steuerung: Sie ist ausschließlich für GLM-5.2 dokumentiert.
Parameter reasoning_effort
Werte minimal · low · medium · high die Parameteroberfläche des Gateways - das Anbieter-Mapping oben gilt

Modell

Modalitäten Text → Text
Parameter 744B gesamt · 40B aktiv MoE
Lizenz MIT
  • Flaggschiff der nächsten Generation für agentisches Engineering (744B-A40B): arbeitet in einem einzigen Durchlauf bis zu 8 Stunden autonom über Tausende von Tool-Aufrufen hinweg
  • 200K Kontext / 128K max. Output

laut Offizielle Z.ai-Dokumentation ↗

GLM-5.1 in 30 Sekunden nutzen

OpenAI-kompatibel: Tauschen Sie die base_url, behalten Sie Ihr SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="glm-5.1",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Über GLM-5.1

  • Aufbauend auf GLM-5 betont es eine Schleife aus Experimentieren, Analysieren und Optimieren statt einer Generierung in einem Durchgang und ermöglicht autonome Exploration, kontinuierliche Verbesserung und stabile Auslieferung in komplexen Engineering-Umgebungen.
  • Z.AI beschreibt das Upgrade als Frage der Ausdauer statt der Spitzenfähigkeit: Wo das vorherige Release in einer agentischen Schleife früh stagniert, ist GLM-5.1 dokumentiert als fähig, die Optimierung über Hunderte von Runden und Tausende von Tool-Aufrufen aufrechtzuerhalten, mit besserem Urteilsvermögen bei mehrdeutigen Problemen.
  • Das Modell bietet ein Kontextfenster von 200K mit bis zu 128K Output-Token, dazu Thinking-Modi und Function Calling.
  • Die benannten Workloads reichen über Code hinaus bis zu allgemeinem Dialog, kreativem Schreiben, Frontend- und Artefaktgenerierung sowie Büroproduktivität.
  • Thinking wird über dasselbe thinking-Objekt wie im Rest der Reihe geschaltet und überlässt die Entscheidung standardmäßig dem Modell, wobei die Spur in einem separaten reasoning_content-Feld zurückkommt; zu beachten ist, dass die später von Z.AI ergänzte Steuerung des Reasoning-Aufwands als GLM-5.2-exklusiv dokumentiert ist, dieses Modell also keinen Effort-Regler hat.
  • MCP-Tools, Streaming, JSON-Ausgabe und automatisches Prefix-Caching werden alle unterstützt, und die Gewichte sind unter der MIT-Lizenz veröffentlicht.
  • Synthorai stellt GLM-5.1 hinter seinem OpenAI-kompatiblen Endpoint für die direkte Integration bereit.

FAQ

Lässt sich die GLM-5.1 API kostenlos testen?

Ja, neue Konten erhalten 10 Test-Calls und bis zu $1 kostenloses Guthaben, keine Kreditkarte erforderlich. Bei $1.4/M Input-Tokens deckt allein dieses Guthaben rund 89 Requests mit je ~8K Tokens gegen GLM-5.1 ab.

Worin ist GLM-5.1 am besten?

Arbeitet autonom bis zu 8 Stunden; Experimentieren-Analysieren-Optimieren-Schleife statt einmaliger Generierung; deckt Planung bis Tests und Auslieferung ab. Das vollständige Bild finden Sie im Über-Abschnitt, direkt aus den offiziellen Release Notes des Anbieters.

Was kostet GLM-5.1?

GLM-5.1 kostet auf Synthorai $1.4 pro Million Input-Tokens und $4.4 pro Million Output-Tokens. Das ist der Listenpreis des Anbieters, ohne Plattform-Aufschlag. Gecachte Input-Tokens werden mit $0.26/M abgerechnet.

Unterstützt GLM-5.1 Prompt-Caching?

Ja, automatisch: Über Z.ai ausgelieferte Prompts werden ohne Codeänderungen gecacht. Gecachte Input-Tokens werden mit $0.26/M statt $1.4/M (ungecacht) abgerechnet. Prompt-Caching-Guide →

Wie erhalte ich Zugang zu GLM-5.1?

Richten Sie Ihr vorhandenes OpenAI SDK auf base_url="https://synthorai.io/v1", setzen Sie model="glm-5.1", fertig. Ein API-Key deckt jedes Modell auf dem Gateway ab.

Ist GLM-5.1 Open Source?

Ja, die Gewichte sind unter der MIT-Lizenz veröffentlicht. Oder Sie sparen sich die GPUs: Die gehostete Version hier läuft mit nutzungsbasierter Abrechnung, ganz ohne eigene Infrastruktur. Open-Weight-Modelle betreiben →

Verwandte Modelle

Vergleichen

Jeder Wert auf dieser Seite ist aus der Dokumentation des Anbieters übernommen, oben verlinkt, und trägt das Datum der Prüfung. Preise werden über den gesamten Katalog verglichen; Spezifikationswerte, die Anbieter unterschiedlich definieren, werden mit benanntem Unterschied gezeigt statt grafisch verglichen. Nichts hier wird von uns gemessen, und nichts wird bewertet.

API-Schlüssel abrufen Ihre Kosten vergleichen →