🎁 Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Blog d'ingénierie

Les vrais problèmes d'ingénierie rencontrés en construisant une passerelle d'API LLM.

RSS
GLM 5.2 Reasoning Effort : le réglage qui divise les coûts par 20 (mesures à l’appui)
★ À la une

GLM 5.2 Reasoning Effort : le réglage qui divise les coûts par 20 (mesures à l’appui)

24 juin 2026 · glm · coding · llm-gateway · cost · reasoning

Même réponse de code : $0.0031 avec le bon niveau de reasoning effort, contre $0.062 avec le réglage par défaut sans limite de GLM 5.2. 20 fois moins cher et 30 fois plus rapide. Voici comment régler ce paramètre selon la tâche.

Claude Fable 5 ne fonctionne pas avec le ZDR : une conservation de 30 jours est obligatoire
★ À la une

Claude Fable 5 ne fonctionne pas avec le ZDR : une conservation de 30 jours est obligatoire

12 juin 2026 · claude-fable-5 · data-retention · compliance

Les organisations en ZDR reçoivent une erreur 400 avec claude-fable-5 : aucune dérogation possible sur l'API Claude, Bedrock, Vertex ou Foundry. Conséquences pour HIPAA et COPPA, et solution de routage.

Mise en cache des prompts LLM : le guide complet 2026 (réduisez le coût d’entrée de 50 à 90 %)
★ À la une

Mise en cache des prompts LLM : le guide complet 2026 (réduisez le coût d’entrée de 50 à 90 %)

26 mai 2026 · prompt-cache · series-overview · llm-architecture

Fonctionnement de la mise en cache des prompts avec Claude, GPT, Gemini et DeepSeek : coût d’entrée réduit de 50 à 90 % et TTFT divisé par 3 à 10. Architecture, comparatif des fournisseurs et code Python.