Engineering-Blog
Echte Engineering-Probleme, auf die wir beim Bau eines LLM-API-Gateways gestoßen sind.
Hier starten
GLM 5.2 Reasoning Effort: die Einstellung, die Kosten 20x senkt
Dieselbe Coding-Antwort: $0.0031 mit korrekt gesetztem Reasoning Effort statt $0.062 mit dem unbegrenzten Default von GLM 5.2. 20-mal günstiger, 30-mal schneller. So wählst du die passende Stufe für jede Aufgabe.
Claude Fable 5 läuft nicht unter ZDR: 30 Tage Aufbewahrung Pflicht
ZDR-Organisationen erhalten bei claude-fable-5 einen 400-Fehler: Weder in der Claude API noch in Bedrock, Vertex oder Foundry gibt es ein Opt-out. Was das für HIPAA/COPPA bedeutet und wie sich das Routing anpassen lässt.
LLM-Prompt-Caching: Leitfaden 2026, 50-90 % weniger Input-Kosten
So funktioniert Prompt-Caching bei Claude, GPT, Gemini und DeepSeek: 50-90 % weniger Input-Kosten und 3-10× kürzere TTFT. Architektur, Provider-Vergleich und Python-Code.
Alle Artikel45
-
GPT-6 Astra: max kostet 2.3x so viel wie low, gleiche Antworten
11 Aufgaben gemessen: none scheitert 17 von 33 Mal, disabled deaktiviert nichts, max kostet 2.3x low, und Astra kostet pro richtiger Antwort 1.6x GPT-5.6 Sol.
-
LLM-API-Rate-Limits: 13 Anbieter, 2 SDKs ohne 429-Retry
Welche Token bei 13 LLM-APIs und Clouds auf RPM und TPM zählen, welche Header liefern, was ein 429 bedeuten kann und welche zwei SDKs nie erneut senden.
-
Long-Context-Preise: bis zu 6,7x, im Gateway unsichtbar
Bei neun Modellen berechnete ein Aggregator bis zu 6,7x über nicht genannten Grenzen. Ein Endpoint lag 1,25x über dem Listenpreis.
-
AI-API-Abrechnung: 17 Einheiten von Token bis PTU-Stunde
Ein API-Dollar wird auf 17 Arten gemessen: Token, Zeichen, Minuten, GB-Tage, Token-Stunden und PTU-Stunden. Ein Praxisleitfaden zu typischen Fallstricken im Billing-Code.
-
Bestes LLM für Übersetzungen: 9 Modelle, 400x Kosten
9 LLMs, 9 Sprachen, 8.455 Blindurteile: gpt-5.6-sol führt in 7 von 9, gemini-3.7-flash liegt bei Koreanisch gleichauf und gewinnt bei Italienisch; Kosten von $0.26 bis $104 pro 1 Mio. Zeichen.
-
LLM-Datenspeicherung und ZDR: Wer Ihre Prompts lesen kann
API-Anbieter löschen Logs nach rund 30 Tagen. Tracing-SaaS, Vektorspeicher und Gateway-Konsolen behalten Prompts bis zur Löschung. Was ZDR abdeckt.
-
LLM-Strukturausgaben: 4 von 12 APIs liefern valides, falsches JSON
Strukturausgaben bei 12 LLM-APIs: 100% schemavalides JSON, falsche Werte bei 4 Modellen mit Thinking, 30 bis 4,959 Prompt-Token pro Aufruf.
-
Welche APIs markieren KI-Inhalte? 16 APIs, 10 Gesetze
16 generative APIs gegen 10 Kennzeichnungsgesetze: 7 betten C2PA ein, 4 Chinas Label, keine beides. Audio und Video bleiben unmarkiert; kein C2PA-Manifest übersteht eine Größenänderung.
-
Voice-Agent-API-Kosten: 10 Minuten kosten $0.04 bis $0.57
Alle Schritte gemessen: STT für $0.002-0.006/min, TTS für $0.004-0.034 je Audiominute, LLM-Turns und GPT Realtime. Kaskade und Speech-to-Speech pro Anruf.
-
DeepSeek V4 Pro GA vs. Preview: 18-62 % weniger Thinking
deepseek-v4-pro-0813 gegen die Preview bei identischen Aufgaben: 18-62 % weniger Reasoning-Token, ein behobener 8.192-Token-Runaway und kein „Ich weiß es nicht“ mehr.
-
Gemini 3.7 Flash: Aufgaben kosten 2,5- bis 8-mal weniger
Messungen direkt nach Release: halber Preis bis 31. Dez., 26-77 % weniger Thinking als 3.6, kein Off-Schalter, Prefill 400. Aufgaben kosten 2,5- bis 8-mal weniger.
-
Wie viele Tokens kostet ein Bild? 15 APIs im Vergleich
Dasselbe 64px-Icon kostet bei GPT-5.6 6 Tokens, bei ByteDance Seed 1,298. Entscheidend für die Kosten ist der Tarif, nicht das Bild.
-
LLM-Denksteuerung: Was 13 Modelle beachten oder ignorieren
reasoning_effort und thinking_budget über 13 LLM-APIs hinweg: Drei Anbieter setzen Budgets bis auf das Token genau durch, andere ignorieren sie stillschweigend, ein Limit von 16 kann 97 verbrauchen.
-
Websuche und Webabruf per API: Was $0.01 bringen
So werden serverseitige Websuche und Webabruf abgerechnet: $0.01 Gebühr, 1.500-3.100 Ergebnistoken zum Modellpreis und mögliche Neusuche im zweiten Turn.
-
Qwen-Image 3.0 im Test: 9 Szenen für ein Bild zu $0.03
Erste Tests von qwen-image-3.0: $0.03 pro Bild, kostenlose Prompts bis 5.000 Token, neun Szenen in einem Bild und fehlerhafte Kleinschrift.
-
DeepSeek V4 Flash: Thinking beschädigt striktes JSON
Messungen vom ersten Tag: $0.14/$0.28, 1.024-Token-Cache-Seiten und ein Defekt: Thinking mit striktem json_schema verfälschte Integer in 8 von 13 Läufen.
-
Qwen 3.8 Max API-Preise: 16 Thinking-Tokens statt Abschalten
Messungen zu qwen3.8-max am ersten Tag bei $2/$6: Der Effort-Regler ist ein Budgetlimit, ohne Thinking bricht die Trefferquote auf 1/6 ein, 16 Tokens beheben das.
-
MCP-Tool-Overhead: 26 Tools kosten $0.03 pro Aufruf
MCP-Tools werden bei jedem Aufruf erneut als Input-Token berechnet: ein kleines Tool belegt bei Claude 401 Token, der GitHub-Server kostet $0.03/Aufruf, mit 2.7x Unterschied zwischen Modellfamilien.
-
Prompt-Cache-Schreibkosten: Wann lohnt sich der Faktor 1.25x?
Dieselbe Agent-Suite, derselbe Aufpreis: 6% Verlust bei RAG, 83% Ersparnis bei Batch. Entscheidend ist das Read:Write-Verhältnis.
-
Claude Opus 5 vs. Opus 4.8 im Praxistest: gleicher Preis, dreifache Kosten
Opus 5 und Opus 4.8 haben dieselben Listenpreise von $5/$25. Mit der Standardkonfiguration kostete Opus 5 bei identischen Aufgaben trotzdem 3.1x so viel. Wohin das Geld fließt und welche Einstellung die Lücke schließt.
-
Spracherkennungs-APIs: 14 Modelle von $0.002 bis $0.016 pro Minute
14 Spracherkennungs-APIs hinter einem Gateway: Minutenpreise, Streaming-Support, die effektiven Minutenkosten der tokenbasierten gpt-4o-Modelle und die in vielen Vergleichen fehlende chinesische ASR-Klasse.
-
Gemini 3.6 Flash: Thinking-Regler bewegt die Kosten um 30x
Gemini 3.6 Flash berechnet unsichtbare Reasoning-Tokens, und eine einzige Request-Einstellung kann die Kosten derselben Aufgabe um den Faktor 30 verändern. Gemessen an fünf Aufgabentypen - mit einem Haken.
-
Seedance-API-Preise im Praxistest: die Formel für Video-Token entschlüsselt
Seedance berechnet W×H×(24s+1)/1024 Video-Token. Wir haben die Formel exakt bestimmt: 720p wird als 1248×704 abgerechnet, und trotz des günstigeren Tarifs kostet 4k pro Sekunde 2.1x mehr. Gemessen.
-
GPT-5.6 Prompting Guide: Defaults kosten 1,5x und 10x mehr
Die Defaults von GPT-5.6 sind teuer: Ohne reasoning_effort fallen 1,5-mal so hohe Kosten an wie mit 'none'; nicht markierte Präfixe kosten das Zehnfache eines Cache Reads. Ein vermessenes Playbook für die Request-Struktur.
-
Kimi-K3-API-Preise im Praxistest: So lässt sich das standardmäßige Reasoning abschalten
Laut Kimi-K3-Dokumentation lässt sich Reasoning nicht deaktivieren. reasoning_effort:'none' funktioniert dennoch und senkt die Kosten einfacher Anfragen um den Faktor 6. Gemessen: Effort-Stufen, Cache-Untergrenze und Preise für 9 Sprachen.
-
GPT Realtime API Preise: Sprechen kostet 4x so viel wie Zuhören
gpt-realtime-2.1 berechnet $0.019/min fürs Zuhören und $0.077/min fürs Sprechen; Stille ist kostenlos, gecachte Wiederholungen kosten 1/80. Gemessene Minutenpreise, Cache-Mechanik und Szenariokosten.
-
LLM-Tokenverbrauch: 4 Tokens Antwort, 217 Tokens berechnet
Messungen mit GPT-5.6, Claude Fable 5, Qwen3.7-max und fünf weiteren Modellfamilien zeigen: Reasoning dominiert die Output-Kosten. So liest und begrenzt man jedes Usage-Feld.
-
Prompt-Caching-Mindestgrößen: Doku um 1,4-2,4x zu niedrig
Anbieter veröffentlichen eine Mindestzahl an Tokens für den Prompt Cache. Messungen über mehrere LLM-Familien zeigen: Automatische Caches benötigen 1.4-2.4-mal mehr als dokumentiert; Claudes expliziter Cache hält die Angaben exakt ein.
-
GPT-5.6-Kosten: 90 % Rabatt via Prompt Caching, Reasoning Effort
Die beiden Kostenhebel von GPT-5.6 im Test: Explizite Breakpoints senken den Preis für gecachten Input auf 10 % des regulären Tarifs. Ohne reasoning_effort lagen die Kosten 1,5-mal so hoch wie mit none.
-
Welches LLM ist für deine Sprache am günstigsten? Tokenizer-Kosten im Vergleich
GPT-5.5 berechnet für europäische Sprachen die wenigsten Tokens, Kimi für Chinesisch und DeepSeek für Japanisch; Claude Fable 5, Opus 4.8 und Sonnet 5 liegen beim 1.2- bis 2.3-Fachen. Gemessene Werte.
-
Claude Fable 5 für Agents: Tool-Call-Refusals, Kosten vs GLM 5.2
Claude Fable 5 in fünf Agent-Workloads im Vergleich zu glm-5.2, opus-4-8 und sonnet-5: Refusals mitten im Tool Call, adaptives Thinking und je nach Workload 5- bis 15-fache Kosten.
-
LangChain Prompt-Caching: Setups, die den Cache tatsächlich treffen
Die bequemste LangChain-Syntax deaktiviert Claudes Prompt-Cache unbemerkt. Gemessene Lösungen: cache_control in Content-Blöcken, richtige Variablenplatzierung und relevante Usage-Felder.
-
Der neue Tokenizer von Claude Sonnet 5: 41 % mehr Tokens pro Prompt
Der neue Tokenizer von Claude Sonnet 5 erzeugt für denselben Text rund 41 % mehr Tokens als Sonnet 4.6. Das wirkt sich im Gateway auf Kosten, Budgets und die Cache-Nutzung aus.
-
GLM 5.2 Tool Calls in Agent Loops: Was „OpenAI-kompatibel“ verschweigt
GLM 5.2 unterstützt die OpenAI API für Tool Calls, liefert dabei aber Text zusammen mit den Tool Calls und zeigt Reasoning im selben Turn. Ein Vergleich mit OpenAI und Anthropic.
-
Kosten von Transkriptions-APIs: 7 Modelle mit demselben Audiomaterial
Sieben Transkriptionsmodelle, ein mehrsprachiger Audiosatz und ein Gateway: Die Kosten pro Minute reichen von $0.0020 bis $0.0164, während die Genauigkeit kaum Unterschiede zeigt.
-
Bildgenerierungs-API-Kosten: 5 Modelle ($0.006-$0.039)
Fünf Bildmodelle, dieselben Prompts, ein Gateway: bei Standardeinstellungen $0.006 bis $0.039 pro Bild. Dazu kommt ein Qualitätsregler, der die Kosten eines Modells um den Faktor 36 verändert. Gemessene Werte.
-
Prompt-Caching bei Open-Weight-LLMs: Warum der Provider über Treffer entscheidet
Bei Open-Weight-LLMs ist Prompt-Caching in der Inference Engine gelöst, scheitert aber am Routing. Eine Analyse über fünf Schichten, gemessen mit DeepSeek, Qwen und Kimi.
-
Claude Fable 5 Caching: gleicher Vertrag, 2,9x vs Opus 4.6
Claude Fable 5 ist jetzt auf Synthorai verfügbar. Gemessene Werte zu Prompt Caching, TTL, Tokenisierung und Kosten gegenüber Opus 4.6/4.8: gleicher Cache-Vertrag, neuer Tokenizer, rund 2,9-fache Kosten.
-
Provider-Drift: Wie Default-Routing die LLM-Kosten in die Höhe treibt
Beim Default-Routing eines Multi-Provider-Gateways verteilen sich identische Requests auf Upstreams mit getrennten Caches. Die Hit-Rate bricht ein und die Rechnung steigt.
-
Lügt dein LLM-Gateway beim Cache? Ein 5-Minuten-Audit
Gateways können Cache-Treffer melden und trotzdem den vollen Preis berechnen. Ein einziges Skript prüft automatisches Caching (DeepSeek) und markerbasiertes Caching (Claude) in fünf Minuten.
-
Claude Opus 4.8 auf Synthorai: Caching und TTL im Vergleich zu 4.7/4.6
Claude Opus 4.8 ist jetzt auf Synthorai verfügbar. Gemessenes Verhalten von Prompt Caching und TTL im Vergleich zu Opus 4.7/4.6: Was gleich bleibt und warum die Tokenisierung erneut geprüft werden sollte.
-
Bestes LLM je Anwendungsfall 2026: Kostenmatrix Chat, RAG, Agents
Chat, RAG oder Agents? Wähle das günstigste Modell, das die Anforderungen erfüllt - mit gemessenen Kostenschätzungen für eine Agent-Aufgabe mit 15 Schritten und RAG mit 100K Abfragen pro Tag sowie einer Entscheidungsmatrix.
-
LLM-Prompt-Caching mit Python: ein praxisnahes Code-Tutorial
Gemessene Einsparungen durch Prompt-Caching bei Claude, GPT-5, Gemini 2.5, DeepSeek-v4 und Qwen3 über Synthorais OpenAI-kompatibles Gateway. Mit echten Werten für usage.cost und TTFT.
-
Welcher LLM-Prompt-Cache ist am günstigsten? 5 Anbieter im Vergleich (2026)
Claude, GPT-5.x, Gemini, DeepSeek und Qwen bieten fünf unterschiedliche Cache-Modelle: explizit oder automatisch, TTLs von 5 Minuten oder 1 Stunde und Lesezugriffe zum 0.1- bis 0.5-Fachen des Basistarifs. Direkt miteinander verglichen und gemessen.
-
So funktioniert LLM-Prompt-Caching: KV-Cache und TTL erklärt
Wie LLM-Prompt-Caching tatsächlich funktioniert: die Transformer-Attention hinter der Wiederverwendung von K/V, der für die TTL entscheidende Kompromiss zwischen Speicher und Rechenleistung sowie die Auswirkungen auf Kosten und TTFT.
Zu diesem Thema noch keine Artikel.