Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Blog d'ingénierie

Les vrais problèmes d'ingénierie rencontrés en construisant une passerelle d'API LLM.

RSS
Commencer ici

GLM 5.2 Reasoning Effort : le réglage qui divise les coûts par 20

· glm · coding · llm-gateway · cost · reasoning

Même réponse de code : $0.0031 avec le bon niveau de reasoning effort, contre $0.062 avec le réglage par défaut sans limite de GLM 5.2. 20 fois moins cher et 30 fois plus rapide. Voici comment régler ce paramètre selon la tâche.

Commencer ici

Claude Fable 5 : pas de ZDR, conservation de 30 jours obligatoire

· claude-fable-5 · data-retention · compliance

Les organisations en ZDR reçoivent une erreur 400 avec claude-fable-5 : aucune dérogation possible sur l'API Claude, Bedrock, Vertex ou Foundry. Conséquences pour HIPAA et COPPA, et solution de routage.

Commencer ici

Prompt caching LLM : guide complet 2026, -50 à -90 % en entrée

· prompt-cache · series-overview · llm-architecture

Fonctionnement de la mise en cache des prompts avec Claude, GPT, Gemini et DeepSeek : coût d’entrée réduit de 50 à 90 % et TTFT divisé par 3 à 10. Architecture, comparatif des fournisseurs et code Python.

Tous les articles45