Neu Kostenlos registrieren, 10 Aufrufe gratis. Bis zu 1 $, ohne Karte.

Engineering-Blog

Echte Engineering-Probleme, auf die wir beim Bau eines LLM-API-Gateways gestoßen sind.

RSS
Hier starten

GLM 5.2 Reasoning Effort: die Einstellung, die Kosten 20x senkt

· glm · coding · llm-gateway · cost · reasoning

Dieselbe Coding-Antwort: $0.0031 mit korrekt gesetztem Reasoning Effort statt $0.062 mit dem unbegrenzten Default von GLM 5.2. 20-mal günstiger, 30-mal schneller. So wählst du die passende Stufe für jede Aufgabe.

Hier starten

Claude Fable 5 läuft nicht unter ZDR: 30 Tage Aufbewahrung Pflicht

· claude-fable-5 · data-retention · compliance

ZDR-Organisationen erhalten bei claude-fable-5 einen 400-Fehler: Weder in der Claude API noch in Bedrock, Vertex oder Foundry gibt es ein Opt-out. Was das für HIPAA/COPPA bedeutet und wie sich das Routing anpassen lässt.

Hier starten

LLM-Prompt-Caching: Leitfaden 2026, 50-90 % weniger Input-Kosten

· prompt-cache · series-overview · llm-architecture

So funktioniert Prompt-Caching bei Claude, GPT, Gemini und DeepSeek: 50-90 % weniger Input-Kosten und 3-10× kürzere TTFT. Architektur, Provider-Vergleich und Python-Code.

Alle Artikel45