Facturation des API IA : 17 unités, du token à l'heure PTU
Sommaire
- Quelles unités les API d’IA facturent-elles ?
- Quelles unités mesurent la consommation ?
- Quelles unités facturent plutôt du temps ou de la capacité ?
- Qu’est-ce qui modifie le tarif sans changer l’unité ?
- Que sont les crédits et les CCU ?
- Quelles règles d’arrondi et quels minimums posent problème ?
- Comment comparer les coûts entre différentes unités ?
- Comment une gateway normalise toutes ces unités
- FAQ
Les API d’IA mesurent leur usage avec au moins 17 unités distinctes : tokens de texte, tokens de raisonnement, tokens en cache, tokens d’entrée multimédia, tokens audio temps réel, caractères, minutes et secondes de contenu multimédia, objets générés, requêtes, pages, GPU-secondes, container-heures, GB-jours, token-heures, PTU-heures, tokens d’entraînement et crédits synthétiques. Pour estimer le coût d’un produit multimodal, il faut convertir plusieurs de ces unités. C’est généralement dans ces conversions que les budgets dérapent. Cette page sert de guide pratique : chaque unité, son mode de calcul et le piège associé.
TL;DR
- Les API d’IA facturent au moins 17 unités distinctes réparties en quatre couches : consommation, temps et capacité, modificateurs tarifaires et enveloppes synthétiques.
- Une minute audio peut être facturée de deux façons : de $0.0020 à $0.0164 par minute audio avec un service dédié de transcription, ou 1 token audio par tranche de 100 ms entendue avec gpt-realtime-2.1.
- Le stockage utilise à lui seul deux compteurs : OpenAI file search facture $0.10 par GB-jour, tandis que la mise en cache du contexte chez Gemini coûte $0.50 par million de tokens et par heure.
- Les modificateurs changent les tarifs, pas les unités : le batch divise le prix par deux, les heures creuses de DeepSeek le divisent encore par deux, et l’inférence Claude limitée aux États-Unis coûte 1.1x.
Quelles unités les API d’IA facturent-elles ?
Dix-sept, dans l’ordre suivi par les sections ci-dessous : unités de consommation (1 à 10), unités de temps et de capacité (11 à 16), puis enveloppes synthétiques (17). Une couche supplémentaire modifie les tarifs sans changer les unités. Le tableau sert de référence, et chaque ligne renvoie vers l’analyse détaillée.
| # | Unité | Où la trouve-t-on ? | Le piège |
|---|---|---|---|
| 1 | Tokens de texte | Toutes les API de chat | Un même texte produit des décomptes différents selon le tokenizer, avec environ 30 % de tokens en plus d’une génération de tokenizer à l’autre |
| 2 | Tokens de raisonnement | Modèles de raisonnement | Facturés comme une sortie que vous ne voyez jamais, jusqu’à 88 à 99,3 % de certaines réponses |
| 3 | Tokens en cache | Prompt caching | Surcoût d’écriture selon le TTL, remise à la lecture et minimums propres à chaque fournisseur |
| 4 | Tokens d’entrée multimédia | Entrées image, audio et PDF | Trois méthodes de conversion pour une même image, les PDF étant facturés au tarif des images |
| 5 | Tokens audio temps réel | Dialogue vocal | 1 token par tranche de 100 ms entendue, 1 par tranche de 50 ms prononcée |
| 6 | Caractères | TTS, guardrails | La parole en chinois coûte 3 à 7x moins cher qu’en anglais par minute audio |
| 7 | Minutes/secondes multimédias | Reconnaissance vocale, génération vidéo et musicale | Écart tarifaire de 8x par minute audio entre des modèles à la précision presque identique |
| 8 | Objets générés | Génération d’images, évaluation humaine | À résolution identique, un réglage de qualité fait varier de 36x le prix d’une image |
| 9 | Requêtes | Recherche web, grounding, file search | $0.01 par recherche, plus les tokens injectés facturés au tarif d’entrée du modèle |
| 10 | Pages | OCR, traitement documentaire par IA | Mistral facture par lot de 1 000 pages, avec en plus les remises batch et cache |
| 11 | GPU-secondes | Hébergeurs serverless de modèles | Le tarif dépend de la carte, de $0.000225/s (T4) à $0.001525/s (H100) |
| 12 | Container-heures/heures de session | Exécution de code, agents managés | Minimum de 5 minutes et facturation du préchargement des fichiers, même si l’outil ne s’exécute jamais |
| 13 | GB-jours | Stockage de fichiers et de vecteurs | $0.10 par GB-jour après le premier gigaoctet gratuit |
| 14 | Token-heures | Stockage du cache de contexte | Gemini facture $0.50 par million de tokens et par heure, un tarif qui doublera en 2027 |
| 15 | PTU-heures/heures d’unité de modèle | Capacité provisionnée | Les tokens en cache ne consomment aucune capacité, et les sorties pèsent davantage que les entrées |
| 16 | Tokens d’entraînement | Fine-tuning | Le nombre d’epochs multiplie la facture, tandis que certains modèles facturent plutôt $100 par heure |
| 17 | Crédits/CCU | Marketplaces, abonnements | Un coefficient appliqué à la grille tarifaire réelle, avec 100 CCU = $1.00 sur AWS Marketplace |
Quelles unités mesurent la consommation ?
Dix des dix-sept unités mesurent la consommation : le compteur tourne lorsque vous utilisez le service, et chaque modalité compte un élément différent.
La famille des tokens (unités 1 à 5). Le token de texte sert de référence, mais il n’est pas universel. Chaque famille de modèles utilise son propre tokenizer. Un même texte produit donc des décomptes différents, et Anthropic indique que son tokenizer des versions 4.7 et ultérieures génère environ 30 % de tokens supplémentaires par rapport au précédent. Les tokens de raisonnement sont des tokens de sortie généralement invisibles. Nous avons mesuré 81 tokens facturés pour une réponse de 10 tokens, dont 88 % consacrés au raisonnement. Le prix des tokens en cache dépend de l’opération et de la durée de vie du cache (TTL). Sur l’API Claude, l’écriture dans un cache de 5 minutes coûte 1.25x le tarif d’entrée de base, celle dans un cache d’une heure 2x, et une lecture 0.1x. Les entrées multimédias sont converties en tokens selon des formules propres à chaque fournisseur. Une image de 1024x1024 est facturée respectivement 693, 1 089 et 1 372 tokens sur GPT-5.6, Gemini et Claude. Gemini compte 25 tokens par seconde d’audio et 5 792 tokens par seconde de vidéo 720p, et facture les PDF au tarif des tokens d’image. Le dialogue vocal en temps réel possède son propre token : gpt-realtime-2.1 facture exactement 1 token audio par tranche de 100 ms de parole utilisateur et 1 par tranche de 50 ms de parole du modèle.
Caractères et temps (unités 6 et 7). La synthèse vocale (TTS) est facturée au caractère. OpenAI affiche des tarifs de $15 à $30 par million de caractères. C’est pourquoi la parole en chinois coûte 3 à 7x moins cher qu’en anglais par minute audio : à durée orale identique, elle utilise moins de caractères. Les guardrails de Bedrock définissent leur propre unité de caractères, une “unité de texte” allant jusqu’à 1 000 caractères. Les modèles dédiés de transcription facturent à la minute audio, avec des tarifs de $0.0020 à $0.0164 pour les modèles que nous avons mesurés. La génération vidéo facture à la seconde selon la résolution, tandis que Gemini facture la musique au morceau.
Objets, requêtes et pages (unités 8 à 10). La génération d’images est facturée par image selon un niveau tarifaire, ou par token de sortie. L’option la moins chère dépend du volume : le tarif par token est plus avantageux en dessous d’environ 1 000 tokens de sortie, tandis que le forfait par image l’emporte au-dessus. Les outils exécutés côté serveur sont facturés par requête. La recherche web coûte $0.01 par recherche sur les trois interfaces que nous avons mesurées, puis les résultats sont à nouveau facturés comme tokens d’entrée, soit 1 500 à 3 100 par recherche. Le search grounding de Gemini, qui permet au modèle d’interroger Google Search pendant une requête, ajoute un palier de quota : 5 000 requêtes gratuites par mois, puis $14 par lot de 1 000. L’OCR est facturé à la page. L’évaluation de modèles sur Bedrock coûte $0.21 par tâche humaine terminée. C’est la seule unité de cet inventaire exprimée en personnes.
Quelles unités facturent plutôt du temps ou de la capacité ?
Six unités facturent l’immobilisation de ressources, même lorsqu’aucun token ne circule. C’est à ce niveau que les estimations de coûts se trompent le plus, car le compteur continue de tourner alors que le code ne fait rien.
- GPU-secondes. Les hébergeurs serverless facturent le temps d’exécution du modèle selon la classe de matériel. Sur Replicate, une T4 coûte $0.000225 par seconde et une H100 $0.001525. Le prix dépend de la carte, pas de la sortie.
- Container-heures et heures de session. L’exécution de code chez Anthropic coûte $0.05 par container-heure au-delà de 1 550 heures gratuites par mois, avec un minimum de 5 minutes par exécution. L’interpréteur de code d’OpenAI est facturé par session de 20 minutes selon la quantité de mémoire, de $0.03 pour 1 GB à $1.92 pour 64 GB. Les agents managés de Claude coûtent $0.08 par heure de session, calculée à la milliseconde et uniquement pendant l’exécution.
- GB-jours et token-heures. Deux compteurs de stockage pour une même idée. Le stockage d’OpenAI file search coûte $0.10 par GB-jour, avec 1 GB gratuit. Le stockage explicite du cache de contexte Gemini est facturé $0.50 par million de tokens et par heure, puis $1.00 en 2027. Un cache oublié devient un abonnement dont vous ignoriez l’existence.
- PTU-heures et unités de modèle. La capacité provisionnée est facturée par unité-heure, quel que soit le trafic. Les provisioned throughput units (PTU) d’Azure forment un quota indépendant du modèle, avec une taille minimale de déploiement propre à chaque modèle. Les tokens de sortie consomment plus de capacité que les tokens d’entrée, et les tokens en cache n’en consomment aucune. Un taux élevé de cache hits réduit donc le nombre de PTU nécessaire. Bedrock commercialise le même principe sous forme d’unités de modèle avec des engagements de 1 ou 6 mois.
- Tokens d’entraînement. Le fine-tuning est facturé selon le nombre de tokens des données d’entraînement, multiplié par le nombre d’epochs. Certains modèles utilisent toutefois le temps réel écoulé : OpenAI affiche pour certains d’entre eux $100 par heure d’entraînement.
Qu’est-ce qui modifie le tarif sans changer l’unité ?
Sept facteurs modifient le prix d’une unité sans toucher à l’unité elle-même : le mode batch, le niveau de service, l’heure, la longueur du contexte, la zone géographique, les réglages de qualité et les quotas gratuits. Un code de facturation qui n’enregistre qu’un prix par modèle se trompe sur chacun d’eux. Le même token n’a pas le même prix selon la manière, le moment et l’endroit où il est traité.
| Modificateur | Effet | Exemple |
|---|---|---|
| Mode batch | 50 % de remise sur les entrées et sorties | API batch d’Anthropic et d’OpenAI, ainsi que l’OCR de Mistral |
| Niveau de service | Supplément pour la rapidité | Niveau rapide d’OpenAI à 2x le tarif standard, niveau flex à prix réduit |
| Heure | Remise en heures creuses | DeepSeek : les heures creuses coûtent moitié moins cher, les heures pleines étant 01:00-04:00 et 06:00-10:00 UTC en semaine |
| Longueur du contexte | Changement de tarif à partir d’un seuil | Les tarifs de Gemini augmentent au-delà de 200k tokens de prompt, tandis que Claude 4.6+ conserve un tarif fixe sur toute la fenêtre de 1M |
| Zone géographique | Supplément lié à la résidence des données | Claude inference_geo: "us" applique 1.1x à chaque catégorie de tokens, et les endpoints régionaux des modèles Claude sur Bedrock et Google Cloud coûtent 10 % de plus que les endpoints globaux |
| Réglages de qualité | Même unité, consommation différente | Pour une image de 1024x1024, la qualité de gpt-image fait varier la facture de 196 à 7 024 tokens |
| Quotas gratuits | Changement brutal de tarif à partir d’un seuil | Grounding : 5 000 requêtes gratuites par mois, exécution de code : 1 550 heures gratuites par mois |
Les coefficients se cumulent. Anthropic indique que les coefficients liés au cache se combinent avec la remise batch et le supplément de résidence. Un token mis en cache, traité en batch et limité aux États-Unis reçoit donc trois facteurs à la fois.
Que sont les crédits et les CCU ?
Ce sont des enveloppes synthétiques appliquées aux compteurs réels lorsqu’une facture doit tenir sur une seule ligne. Lorsque Claude est facturé via AWS ou Azure Marketplace, l’usage est d’abord valorisé en dollars selon les tarifs unitaires habituels, puis converti en Claude Consumption Units à raison de 100 CCU par dollar. Les remises réduisent le nombre de CCU comptabilisés, pas le prix du CCU. Les abonnements utilisent le même mécanisme avec des crédits, et la frontière peut exister au sein d’une seule entreprise. ElevenLabs mesure ses abonnements en crédits, tout en précisant que l’usage de l’API est facturé en dollars américains, et non en crédits. Face à une unité synthétique, il faut identifier le compteur de consommation ou de capacité sous-jacent, ainsi que son taux de conversion.
Quelles règles d’arrondi et quels minimums posent problème ?
Voici toutes les règles de quantification, réunies ici car chacune est documentée à un endroit différent :
- Les containers d’exécution de code facturent un minimum de 5 minutes. L’ajout de fichiers à une requête déclenche aussi la facturation du temps d’exécution, même si l’outil n’est jamais appelé.
- Les sessions d’interpréteur de code sont arrondies à des blocs de 20 minutes selon le niveau de RAM.
- Le dialogue vocal en temps réel est découpé en 100 ms entendues / 50 ms prononcées par token audio. Avec la détection côté serveur de l’activité vocale (VAD), 60 secondes de silence n’ont rien coûté, tandis que l’annulation d’une réponse orale après 2 secondes en a facturé 4.
- Pour la génération d’images avec
n=4, le prompt est refacturé quatre fois. Cette interface ne propose aucun prompt caching. - Les tokens vidéo appliquent un +1 frame dans la formule et des dimensions encodées différentes de celles annoncées : le 720p est facturé comme du 1248x704.
- Les caches de prompt imposent une longueur minimale propre à chaque fournisseur. En dessous de ce seuil, vous payez le surcoût d’écriture sans rien mettre en cache.
- Les unités de texte des guardrails sont arrondies à l’unité supérieure par tranche de 1 000 caractères.
- Les définitions d’outils sont facturées comme entrée avant tout appel. Le prompt système de tool use d’Anthropic ajoute 286 à 804 tokens selon le modèle et le choix d’outil, et un ensemble complet d’outils de computer use en ajoute environ 4 500.
Comment comparer les coûts entre différentes unités ?
Ramenez tout au coût en dollars par interaction utilisateur. C’est la seule unité vers laquelle tous les compteurs peuvent être convertis.
C’est exactement ce que nous avons fait dans notre étude sur les agents vocaux. Une chaîne en cascade facturant des minutes audio (STT), des tokens (LLM) et des caractères (TTS) revenait à $0.0037 à $0.025 par minute de conversation, contre $0.057 pour gpt-realtime-2.1 et $0.016 pour sa version mini. Le supplément du temps réel et le gain de latence deviennent ainsi comparables dans un même chiffre. La méthode s’applique partout : choisissez une interaction, par exemple un ticket de support, un document ou une minute de conversation. Mesurez chaque étape dans son unité native, appliquez son tarif actuel, puis comparez. Comparer directement des $/1M tokens à des $/minute audio n’a aucun sens. Comparer des $/interaction est un simple calcul.
Comment une gateway normalise toutes ces unités
Synthorai calcule le prix au moment de la requête et conserve l’unité native avec le montant en dollars. Chaque requête produit un enregistrement d’usage contenant les relevés natifs, par exemple les tokens par catégorie, les secondes, les caractères et le nombre de requêtes, ainsi que la version du tarif appliqué et le coût calculé. Chaque ligne de facture peut donc toujours être décomposée en unité multipliée par tarif. C’est la même conversion qu’effectue un CCU à la frontière d’une marketplace, mais elle est réalisée pour chaque enregistrement et reste vérifiable. Cette approche fonctionne aussi avec le mode zero-retention : l’enregistrement d’usage n’a besoin que des relevés et d’un hash du contenu, jamais du payload. Lorsqu’un fournisseur modifie ses tarifs, la version du prix indique quelle grille a servi à valoriser chaque enregistrement historique. Le rapprochement de fin de mois devient alors un audit, pas une discussion.
FAQ
Les tokens audio sont-ils identiques aux tokens de texte ?
Non. Les tokens audio temps réel utilisent un compteur et des tarifs distincts. Sur gpt-realtime-2.1, un token couvre 100 ms de parole entendue ou 50 ms de parole prononcée, soit $0.0192 par minute d’écoute et $0.0768 par minute de parole. Même au sein d’un seul modèle, les compteurs audio et texte ont des grilles tarifaires séparées.
Pourquoi une même image produit-elle des nombres de tokens différents selon le fournisseur ?
Parce que les méthodes de conversion diffèrent, pas l’image. Les formules par patch, les tuiles plafonnées et les forfaits fixes coexistent. Une image de 1024x1024 a produit 693 tokens sur GPT-5.6, 1 089 sur Gemini et 1 372 sur Claude. Le format du fichier et son contenu n’ont modifié le résultat d’aucun token.
Les tokens en cache sont-ils comptés comme tokens d’entrée ?
Ils sont mesurés séparément et facturés selon l’opération. Les écritures en cache coûtent plus cher que l’entrée de base, soit 1.25x ou 2x selon le TTL sur l’API Claude, tandis que les lectures bénéficient d’une remise à 0.1x. Avec une capacité provisionnée, la distinction compte deux fois : les tokens en cache ne consomment aucune capacité PTU. La mise en cache réduit donc la facture et la capacité à réserver.
Pour la parole, le tarif au caractère est-il moins cher que le tarif à la minute ?
Cela dépend de la langue. Avec un TTS facturé au caractère, la parole en chinois coûte 3 à 7x moins cher par minute audio que l’anglais, car le chinois concentre davantage de parole dans moins de caractères. Un tarif à la minute ne dépend pas de la langue. Pour la transcription, les modèles facturés à la minute que nous avons testés coûtaient de $0.0020 à $0.0164 par minute audio, avec une précision presque identique sur une parole claire.
Les définitions d’unités et les tarifs cités proviennent des pages tarifaires des fournisseurs consultées le 2026-08-30, ainsi que de nos propres mesures accessibles via les liens. Les prix changent vite, les structures d’unités plus lentement. Vérifiez néanmoins la source liée avant d’intégrer un chiffre au code de facturation.
Études associées avec mesures : anatomie des tokens, mise en cache des prompts, minimums du cache, tokens d’entrée image, génération d’images, transcription, reconnaissance vocale, dialogue vocal en temps réel, génération vidéo, recherche web, agents vocaux, tokenizers, coût par langue.