Blog d'ingénierie
Les vrais problèmes d'ingénierie rencontrés en construisant une passerelle d'API LLM.
Commencer ici
GLM 5.2 Reasoning Effort : le réglage qui divise les coûts par 20
Même réponse de code : $0.0031 avec le bon niveau de reasoning effort, contre $0.062 avec le réglage par défaut sans limite de GLM 5.2. 20 fois moins cher et 30 fois plus rapide. Voici comment régler ce paramètre selon la tâche.
Claude Fable 5 : pas de ZDR, conservation de 30 jours obligatoire
Les organisations en ZDR reçoivent une erreur 400 avec claude-fable-5 : aucune dérogation possible sur l'API Claude, Bedrock, Vertex ou Foundry. Conséquences pour HIPAA et COPPA, et solution de routage.
Prompt caching LLM : guide complet 2026, -50 à -90 % en entrée
Fonctionnement de la mise en cache des prompts avec Claude, GPT, Gemini et DeepSeek : coût d’entrée réduit de 50 à 90 % et TTFT divisé par 3 à 10. Architecture, comparatif des fournisseurs et code Python.
Tous les articles45
-
GPT-6 Astra : max coûte 2.3x low, mêmes réponses
Mesuré sur 11 tâches vérifiées : none échoue 17 fois sur 33, disabled ne désactive rien, max coûte 2.3x low et Astra 1.6x GPT-5.6 Sol par bonne réponse.
-
Rate limits des API LLM : 13 acteurs, 2 SDK sans retry 429
Tokens comptés dans les RPM et TPM de 13 API et clouds LLM, headers renvoyés, quatre sens possibles d'un 429 et deux SDK sans retry.
-
Tarifs du contexte long: jusqu'à 6,7x, invisibles sur les gateways
Chez un agrégateur, neuf modèles à paliers ont coûté jusqu'à 6,7x le tarif affiché, et un endpoint 1,25x son prix. Voici comment rester sous les seuils.
-
Facturation des API IA : 17 unités, du token à l'heure PTU
Un même dollar d'API se mesure de 17 façons : tokens, caractères, minutes, GB-jours, token-heures ou PTU-heures. Les pièges à éviter dans le code de facturation.
-
Meilleur LLM de traduction : 9 modèles, coûts multipliés par 400
9 LLM, 9 langues, 8 455 verdicts à l'aveugle : gpt-5.6-sol domine dans 7 langues, gemini-3.7-flash l'égale en coréen et en italien. Coût : $0.26 à $104 par million de caractères.
-
Conservation des données LLM et ZDR : qui lit vos prompts
Les fournisseurs effacent les logs API après environ 30 jours. Le tracing SaaS, la mémoire vectorielle et la console de gateway gardent les prompts jusqu'à leur suppression. Ce que couvre vraiment la ZDR.
-
Sorties structurées LLM: JSON valide mais faux sur 4 API sur 12
Mesure des sorties structurées sur 12 API LLM: JSON conforme au schéma dans 100% des cas, mais valeurs fausses sur 4 modèles avec thinking activé, et de 30 à 4,959 prompt tokens facturés pour le même appel.
-
Quels API marquent l’IA ? 16 testées face à 10 lois
16 API génératives face à 10 lois : 7 intègrent C2PA, 4 le marquage chinois, aucune les deux. Rien en audio/vidéo, et aucun manifeste ne survit au redimensionnement.
-
Coût API d’un agent vocal : $0.04 à $0.57 pour 10 minutes
Mesure de chaque étape : STT à $0.002-0.006/min, TTS à $0.004-0.034 par minute audio, échanges LLM et GPT Realtime. Cascade et speech-to-speech, coût par appel.
-
DeepSeek V4 Pro GA vs Preview : 18 à 62 % de réflexion en moins
deepseek-v4-pro-0813 face à la Preview sur les mêmes tâches : 18 à 62 % de tokens de raisonnement en moins, un emballement à 8 192 tokens corrigé et la disparition du « je ne sais pas ».
-
Gemini 3.7 Flash : tâches facturées 2,5 à 8x moins que 3.6
Tests de gemini-3.7-flash au lancement : tarif réduit de moitié jusqu'au 31 décembre, 26 à 77 % de réflexion en moins, désactivation supprimée et prefill en 400.
-
Combien de tokens par image ? 15 API mesurées : de 6 à 1 298
Une même icône de 64px coûte 6 tokens sur GPT-5.6 et 1 298 sur ByteDance Seed. Trois modes de facturation, trois règles documentées contredites par les mesures.
-
Contrôles de raisonnement LLM : comportement de 13 modèles
reasoning_effort et thinking_budget sur 13 API de LLM : trois fournisseurs appliquent les budgets au token près, d'autres les ignorent silencieusement, un plafond de 16 peut en consommer 97.
-
API de recherche et de fetch web : que vaut vraiment $0.01
Facturation de la recherche et du fetch web côté serveur : $0.01, 1 500 à 3 100 tokens de résultats au tarif du modèle, puis une relance possible.
-
API Qwen-Image 3.0 : 9 scènes dans une image à $0.03
Tests de qwen-image-3.0 dès sa sortie : $0.03 par image, prompts gratuits jusqu’à 5,000 tokens, vraie grille 9-en-1 et petits caractères mal orthographiés.
-
Coût de DeepSeek V4 Flash : le mode thinking corrompt le JSON
Mesures du 0731 au premier jour : tarifs $0.14/$0.28, pages de cache de 1 024 tokens et entiers corrompus avec thinking et json_schema strict.
-
Prix de l’API Qwen 3.8 Max : 16 tokens battent le mode sans réflexion
Mesures dès le premier jour de qwen3.8-max à $2/$6 : un réglage d’effort qui plafonne en réalité le budget, une précision qui chute à 1/6 sans réflexion et une correction avec 16 tokens.
-
Surcoût des outils MCP : 26 outils, $0.03 par appel
Chaque outil MCP est refacturé en tokens d’entrée à chaque appel : 401 tokens pour un petit outil sur Claude, $0.03/appel pour GitHub, avec un écart de 2.7x selon les familles.
-
Coût d’écriture du prompt cache : quand le surcoût paie
Une suite d’agents mesurée, un surcoût : 6% de perte en RAG, 83% d’économie en batch. Tout dépend du ratio lecture:écriture, mesurable avant la facture.
-
Claude Opus 5 face à Opus 4.8, mesures à l’appui : même tarif, coût multiplié par 3
Opus 5 et Opus 4.8 affichent le même tarif de $5/$25, mais avec la configuration par défaut, Opus 5 nous a coûté 3,1 fois plus cher sur des tâches identiques. Voici où part la différence et le paramètre qui la supprime.
-
API de transcription audio : 14 modèles, de $0.002 à $0.016 la minute
14 API de transcription audio derrière une même passerelle : tarifs à la minute, prise en charge du streaming, coût à la minute des modèles gpt-4o facturés au token et offre ASR chinoise souvent absente des comparatifs.
-
Gemini 3.6 Flash : le réglage qui fait varier le coût jusqu'à 30x
Gemini 3.6 Flash facture des tokens de raisonnement invisibles, et un seul paramètre de requête peut multiplier par 30 le coût d’une même tâche. Mesures sur cinq types de tâches, avec un piège à connaître.
-
Tarification de l’API Seedance : la formule des tokens vidéo vérifiée par la mesure
Seedance facture W×H×(24s+1)/1024 tokens vidéo ; nous avons retrouvé la formule exacte. Le 720p est facturé en 1248×704, et malgré son tarif réduit, la 4k coûte 2.1x plus cher par seconde. Mesures à l’appui.
-
Guide du prompting GPT-5.6 : deux réglages par défaut à 1,5x et 10x
Les réglages par défaut de GPT-5.6 coûtent cher : sans reasoning_effort, la facture est 1,5x supérieure à 'none' ; les préfixes non marqués coûtent 10x plus cher que les lectures en cache. Guide pratique fondé sur des mesures pour structurer les requêtes.
-
Tarifs de l’API Kimi K3, mesures à l’appui : désactivez le raisonnement permanent
La documentation de Kimi K3 affirme que le raisonnement ne peut pas être désactivé. Pourtant, reasoning_effort:'none' fonctionne et divise par 6 le coût des requêtes simples. Mesures : niveaux d’effort, seuil du cache et tarifs dans 9 langues.
-
Prix de l'API GPT Realtime : parler coûte 4x plus qu'écouter
gpt-realtime-2.1 facture $0.019/min en écoute et $0.077/min en parole ; le silence est gratuit, la relecture en cache coûte 1/80e du prix. Tarifs mesurés en $/min, fonctionnement du cache et coûts par scénario.
-
Consommation de tokens des LLM : pourquoi une réponse de 4 tokens en facture 217
Mesures sur GPT-5.6, Claude Fable 5, Qwen3.7-max et cinq autres familles : le raisonnement domine la facture en sortie. Comment lire chaque champ d’usage et les plafonner.
-
Seuils du prompt cache : la doc les sous-estime de 1,4 à 2,4x
Les fournisseurs publient un nombre minimal de tokens pour le cache de prompts. Nos mesures sur plusieurs familles de LLM montrent que le cache automatique en exige 1,4 à 2,4 fois plus ; le cache explicite de Claude respecte exactement la documentation.
-
Coûts GPT-5.6 : 90 % de remise, prompt caching et reasoning effort
Les deux leviers de coût de GPT-5.6, mesures à l’appui : des breakpoints explicites facturent l’input en cache à 10 % du tarif, et ne pas envoyer reasoning_effort coûte 1.5x plus cher que none.
-
Quel LLM est le moins cher par langue ? Coûts de tokenisation
GPT-5.5 facture le moins de tokens pour les langues européennes, Kimi pour le chinois et DeepSeek pour le japonais ; Claude Fable 5, Opus 4.8 et Sonnet 5 consomment 1.2-2.3x plus. Mesures à l’appui.
-
Claude Fable 5 pour agents : refus de tool calls, coût vs GLM 5.2
Claude Fable 5 sur cinq types de workloads agentiques face à glm-5.2, opus-4-8 et sonnet-5 : refus pendant les appels d’outils, réflexion adaptative et coût variant de 5 à 15 fois selon le profil.
-
Prompt caching LangChain : configs qui touchent vraiment le cache
La syntaxe la plus pratique de LangChain désactive silencieusement le cache de prompts de Claude. Correctifs mesurés : cache_control dans les blocs de contenu, placement des variables et champs d’usage.
-
Nouveau tokenizer de Claude Sonnet 5 : +41 % de tokens par prompt
Avec le nouveau tokenizer de Claude Sonnet 5, un même texte produit environ 41 % de tokens de plus qu’avec Sonnet 4.6, ce qui change les coûts, les budgets et l’éligibilité au cache sur la gateway.
-
Appels d'outils GLM 5.2 : ce que masque la compatibilité OpenAI
GLM 5.2 utilise l’API d’appel d’outils d’OpenAI, mais renvoie du texte avec les appels et expose le raisonnement pendant le même tour. Comparaison avec OpenAI et Anthropic.
-
Coût des API de transcription : 7 modèles testés sur le même audio
Sept modèles de transcription, un même jeu d'enregistrements multilingues et une seule gateway : le coût par minute va de $0.0020 à $0.0164, sans différence notable de précision.
-
Coût des API de génération d'images : 5 modèles ($0.006-$0.039)
Cinq modèles d’images, les mêmes prompts et une seule gateway : de $0.006 à $0.039 par image avec les réglages par défaut, plus un paramètre de qualité qui multiplie par 36 la facture d’un modèle. Mesures à l’appui.
-
Cache de prompt des LLM à poids ouverts : la loterie des fournisseurs
Pour les LLM à poids ouverts, le cache de prompt est maîtrisé dans le moteur d’inférence, mais mis à mal par le routage. Cartographie en cinq couches, avec des mesures sur DeepSeek, Qwen et Kimi.
-
Cache de Claude Fable 5 : même contrat, 2,9x vs Opus 4.6
Claude Fable 5 est disponible sur Synthorai. Mesures du prompt caching, des TTL, de la tokenisation et du coût par rapport à Opus 4.6/4.8 : même contrat de cache, nouveau tokenizer, facture multipliée par environ 2,9.
-
Dérive des fournisseurs : quand le routage par défaut gonfle le coût des LLM
Avec le routage par défaut d'une gateway multi-fournisseurs, des requêtes identiques sont réparties entre plusieurs backends aux caches distincts. Le taux de hit s'effondre et la facture grimpe.
-
Votre gateway LLM ment-il sur le cache ? Audit en 5 minutes
Un gateway peut signaler des cache hits tout en facturant le plein tarif. Un seul script audite en cinq minutes le cache automatique (DeepSeek) et le cache par marqueurs (Claude).
-
Claude Opus 4.8 sur Synthorai : cache et TTL face aux versions 4.7/4.6
Claude Opus 4.8 est disponible sur Synthorai. Mesure du prompt caching et du comportement des TTL face à Opus 4.7/4.6 : ce qui ne change pas et l’évolution du tokenizer à vérifier.
-
Meilleur LLM selon le cas d’usage (2026) : matrice des coûts pour chat, RAG et agents
Chat, RAG ou agents ? Choisissez le modèle le moins cher qui reste performant, avec des estimations de coûts mesurées (tâche agent en 15 étapes, RAG à 100K requêtes/jour) et une matrice de décision.
-
Mise en cache des prompts LLM en Python : tutoriel avec du code fonctionnel
Économies mesurées grâce au cache de prompts sur Claude, GPT-5, Gemini 2.5, DeepSeek-v4 et Qwen3 via la gateway compatible OpenAI de Synthorai. Coûts usage.cost et TTFT réels.
-
Quel cache de prompt LLM coûte le moins cher ? Comparatif de 5 fournisseurs (2026)
Claude, GPT-5.x, Gemini, DeepSeek et Qwen proposent cinq formes de cache : explicite ou automatique, TTL de 5 minutes ou 1 heure, lectures facturées de 0.1x à 0.5x. Comparatif avec mesures à l'appui.
-
Fonctionnement du cache de prompt des LLM : cache KV et TTL
Comment fonctionne réellement le cache de prompt des LLM : les calculs d’attention des Transformers qui permettent de réutiliser K/V, le compromis mémoire-calcul qui détermine le TTL, et les gains en coût et en TTFT.
Aucun article sur ce sujet pour l’instant.