Nouveau tokenizer de Claude Sonnet 5 : +41 % de tokens par prompt
Sommaire
claude-sonnet-5 est disponible sur la gateway Synthorai et, pour l’instant, son prix est bas : $2 / $10 par million de tokens en entrée / sortie, soit 2,5× moins qu’Opus 4.8 et moins que Sonnet 4.6. Mais ce tarif est temporaire. Il s’agit d’un tarif de lancement valable jusqu’au 31 août 2026 ; le 1er septembre, il passera à $3 / $15, soit le même prix affiché que Sonnet 4.6.
Si vous utilisez le cache avec les modèles Claude, le fonctionnement du cache et le contrat TTL restent strictement identiques. Côté coût, il faut toutefois regarder au-delà du tarif unitaire, car Sonnet 5 ne compte pas les tokens comme Sonnet 4.6. Son nouveau tokenizer produit environ 41 % de tokens d’entrée en plus pour un même texte anglais. Or la facturation et les limites reposent sur ce nombre de tokens. Le tarif affiché ne raconte donc que la moitié de l’histoire.
TL;DR
- Claude Sonnet 5 coûte $2/$10 par million de tokens en entrée/sortie jusqu’au 31 août 2026 ; le 1er septembre, le tarif repasse à $3/$15, soit le même prix affiché que Sonnet 4.6.
- Un texte identique produit 2 245 tokens avec Sonnet 5 contre 1 594 avec Sonnet 4.6 : 41 % de plus, exactement comme Opus 4.8.
- Au tarif standard, un même prompt en anglais coûte environ 41 % plus cher avec Sonnet 5 qu’avec Sonnet 4.6.
- Le fonctionnement du cache ne change pas, avec environ 90 % de réduction à la lecture ; un tour avec un cache chaud a coûté $0.0017 contre $0.0043 avec Opus 4.8.
Avant même de parler de modification du code ou de qualité du modèle, ce changement de comptage a plusieurs conséquences :
- Coût par prompt. Au tarif standard, un même prompt en anglais coûte environ 41 % plus cher qu’avec Sonnet 4.6, puisque le même texte est facturé avec davantage de tokens au même prix unitaire.
- Toutes les estimations fondées sur les tokens. Un budget par appel ou un comptage via un tokenizer local calibré sur 4.6 sous-estime la consommation d’environ 40 % avec Sonnet 5. Mesurez le champ
usageréel plutôt que de vous fier à une estimation locale. - Marge dans la fenêtre de contexte. Un même document occupe environ 41 % de fenêtre en plus. Les appels long context et RAG peuvent donc contenir moins de texte réel par requête.
- Rate limits. Pour une même charge, une limite en tokens par minute s’épuise environ 41 % plus vite, ce qui réduit le débit.
- Éligibilité au cache, avec un léger avantage. Le seuil minimal de 1 024 tokens devient plus facile à atteindre. Un préfixe juste en dessous avec 4.6 peut donc devenir éligible au cache avec Sonnet 5.
La suite chiffre chacun de ces effets : prix, intérêt économique du cache et évolution du nombre de tokens.
Prix, cache, TTL et nombres de tokens mesurés sur
https://synthorai.io/via l’API Anthropic native/v1/messages, le 2026-07-01. Les prix par token sont calculés à partir du coût indiqué dansusagesur des appels réels ; les tarifs de lancement et standard, ainsi que l’échéance du 31 août, viennent de l’annonce d’Anthropic. Refaites les mesures avec votre propre prompt avant de les citer.
Disponibilité
import os
from anthropic import Anthropic
anth = Anthropic(
api_key=os.environ["SYNTHORAI_KEY"],
base_url="https://synthorai.io/", # SDK appends /v1/messages
)
msg = anth.messages.create(
model="claude-sonnet-5", # the only line that changes
max_tokens=512,
system=[
{"type": "text", "text": SYSTEM_PROMPT,
"cache_control": {"type": "ephemeral"}},
],
messages=[{"role": "user", "content": question}],
)
print(msg.usage) # cache_creation_input_tokens, cache_read_input_tokens, cost
Il suffit de remplacer le champ model ; le reste du chemin de mise en cache ne change pas. Le fonctionnement de cache_control est détaillé dans le tutoriel sur le cache ; l’architecture qui justifie l’existence de ce cache est présentée dans la première partie de la série.
Prix : bas aujourd’hui, aligné sur Sonnet 4.6 en septembre
Voici les tarifs par token sur la gateway, calculés à partir du coût indiqué dans usage lors d’appels simples, sans cache :
| Modèle | Entrée ($/M) | Sortie ($/M) |
|---|---|---|
claude-sonnet-5 (lancement, jusqu’au 31 août) | $2.00 | $10.00 |
claude-sonnet-5 (standard, à partir du 1er septembre) | $3.00 | $15.00 |
claude-sonnet-4-6 | $3.00 | $15.00 |
claude-opus-4-8 | $5.00 | $25.00 |
Le tarif de lancement constitue une vraie réduction. Face à Opus 4.8, l’avantage reste durable : même au tarif standard de $3 / $15, Sonnet 5 reste moins cher qu’Opus. Comme les deux modèles partagent le même tokenizer, ce que nous détaillerons plus loin, la comparaison reste directe aux deux niveaux de prix.
Face à Sonnet 4.6, la réduction est temporaire. Le 1er septembre, le prix affiché sera identique. Tout budget reposant sur l’idée que « Sonnet 5 coûte moins cher que 4.6 » expirera donc avec la promotion. Et comme le montre la section suivante, à prix unitaire égal, Sonnet 5 coûte en réalité plus cher pour un même texte.
Nous ne publions pas de benchmarks de capacité que nous n’avons pas exécutés. C’est à vous d’évaluer si la qualité de Sonnet 5 justifie son surcoût par rapport à 4.6.
Cache et TTL : aucun changement nécessaire
Le contrat de mise en cache est identique à celui des autres modèles Claude. Nous avons exécuté une séquence d’écriture à froid puis de lecture à chaud avec un préfixe stable de 2,2K tokens. Le message utilisateur changeait à chaque appel afin qu’aucun cache au niveau de la réponse ne fausse le résultat. Coût par tour avec un cache chaud, au tarif de lancement actuel :
| Modèle | Tour à froid (écriture du cache) | Tour à chaud (lecture du cache) | Froid → chaud |
|---|---|---|---|
claude-sonnet-5 (lancement) | $0.0069 | $0.0017 | 4.0× |
claude-sonnet-4-6 | $0.0079 | $0.0024 | 3.3× |
claude-opus-4-8 | $0.0172 | $0.0043 | 4.0× |
Les mêmes règles que pour la gamme Opus s’appliquent :
- Réduction à la lecture ≈ 90 %. Une lecture depuis un cache chaud coûte environ 10 % du prix d’entrée, ce qui correspond à l’économie « jusqu’à 90 % » annoncée par Anthropic pour les lectures en cache. Le seuil de rentabilité est atteint dès la première lecture.
- Le TTL de 1 heure fonctionne de la même manière.
cache_control: {"type": "ephemeral", "ttl": "1h"}est accepté avec Sonnet 5. L’objetusagesépare toujours les catégories aveccache_creation.ephemeral_5m_input_tokensetephemeral_1h_input_tokens. Le surcoût d’une écriture pour 1 heure est d’environ 2× par rapport à une entrée sans cache, contre environ 1,25× pour une écriture de 5 minutes ; les lectures restent à ≈10 % quel que soit le TTL.
Les montants des tours à chaud du tableau utilisent le tarif de lancement. À partir du 1er septembre, multipliez ceux de Sonnet 5 par 1,5× ($2 → $3 en entrée, $10 → $15 en sortie). Un tour avec un cache chaud facturé $0.0017 aujourd’hui coûtera environ $0.0026 en septembre. Il restera moins cher que les $0.0043 d’Opus 4.8, mais plus que Sonnet 4.6.
Le piège du nombre de tokens
La hausse de septembre a un double effet. Un même texte système produit environ 41 % de tokens d’entrée en plus avec Sonnet 5 qu’avec Sonnet 4.6.
| Modèle | Tokens d’entrée (texte identique) | Coût d’entrée au tarif standard |
|---|---|---|
claude-sonnet-4-6 | 1,594 | $0.0048 |
claude-sonnet-5 | 2,245 | $0.0067 |
claude-opus-4-8 | 2,245 | $0.0112 |
Avec Sonnet 5, ce même prompt en anglais produit 2 245 tokens, soit exactement le nombre remonté par Opus 4.8 et nettement plus que les 1 594 de Sonnet 4.6. Sonnet 5 utilise le tokenizer plus récent adopté par la gamme Opus à partir de 4.7.
En combinant le tarif et le nombre de tokens, le résultat est simple :
- Pendant la période de lancement, la hausse de 41 % du nombre de tokens est compensée par un tarif inférieur de 33 % ($2 contre $3). Le même prompt sans cache coûte donc à peu près autant qu’avec 4.6, tandis que les tours à chaud coûtent moins cher grâce au tarif réduit en sortie.
- À partir du 1er septembre, le tarif unitaire sera le même que pour 4.6, mais pas le nombre de tokens. Un même prompt en anglais coûtera environ 41 % plus cher avec Sonnet 5 qu’avec Sonnet 4.6 ($0.0067 contre $0.0048 pour ce préfixe), simplement parce que le même texte est compté avec davantage de tokens au même tarif unitaire.
Ce piège n’existe pas face à Opus 4.8 : les deux modèles utilisent le même tokenizer (2 245 = 2 245). Sonnet 5 est donc clairement moins cher, aussi bien au tarif de lancement (2,5×) qu’au tarif standard (1,67×).
Dimensionnez donc votre budget sur la facture de septembre, pas celle de juillet : le tarif par token augmentera de 1,5× le 1er septembre, tandis que le nombre de tokens plus élevé s’applique déjà. Lisez également cache_creation_input_tokens et cache_read_input_tokens dans la réponse réelle au lieu d’utiliser un tokenizer local qui peut encore reposer sur l’ancien vocabulaire.
Sonnet 5 face à Opus 4.8 : un avantage durable
C’est la comparaison que ce lancement change durablement. Sonnet 5 et Opus 4.8 utilisent le même tokenizer : quel que soit le prompt, le nombre de tokens est identique et l’écart de coût vient uniquement du tarif. Sonnet 5 est 2,5× moins cher au tarif de lancement et 1,67× moins cher au tarif standard, pour les tours à froid comme à chaud, en entrée comme en sortie. Un tour avec un cache chaud coûte aujourd’hui $0.0017 contre $0.0043 ; même en septembre, il coûtera environ $0.0026 contre $0.0043.
Pour une boucle d’agent à fort volume utilisant le cache et répétant le même préfixe à chaque tour, cet écart s’accumule. La décision reste classique : exécutez vos propres evals. Si Sonnet 5 atteint votre niveau de qualité requis, le calcul économique de la gateway reste favorable au-delà du mois d’août. Sinon, Opus 4.8 reste accessible en modifiant un seul champ model, sans toucher au code de mise en cache.
Checklist de migration
- ✅ Le code de mise en cache reste strictement identique. Les marqueurs
cache_control, le nombre de breakpoints,ttl: "1h"et les noms des champsusagesont les mêmes que pour la gamme Opus. - ✅ Les choix de TTL restent les mêmes. 5m pour les charges temps réel ou de session, 1h pour les charges en rafales ou les agents avec des pauses.
- ✅ Les réductions et surcoûts restent les mêmes. ≈90 % de réduction à la lecture, écriture à ≈1,25× pour 5m et à ≈2× pour 1h.
- ⚠️ Intégrez le 1er septembre au budget. Le tarif de lancement prend fin le 31 août ; Sonnet 5 passera à $3 / $15. Anticipez la hausse de 1,5× avant son entrée en vigueur.
- ⚠️ Remesurez le nombre de tokens si vous migrez depuis 4.6 ou une version antérieure. Un même texte produit environ 41 % de tokens en plus avec Sonnet 5. Au tarif standard, le même prompt revient donc plus cher qu’avec 4.6, et non moins cher.
- ⚠️ Fiez-vous à l’objet
usageréel. Lisez les champs*_input_tokensetcostdans la réponse au lieu d’utiliser une estimation mise en cache provenant de l’ancienne génération.
Conclusion
Sonnet 5 est une très bonne affaire, mais pour une durée limitée. Face à Opus 4.8, il reste durablement 1,67–2,5× moins cher et ne demande aucune adaptation du chemin de mise en cache. C’est donc le premier modèle à évaluer pour toute charge Opus où la qualité n’est pas critique. Face à Sonnet 4.6, l’avantage se limite au tarif de lancement : le 1er septembre, le prix sera identique à celui de 4.6, et le nouveau tokenizer rendra le même prompt plus cher. Profitez de la réduction, mais dimensionnez votre budget avec les chiffres de septembre. Vérifiez aussi le nombre de tokens dans l’objet usage réel avant de transmettre des prévisions à l’équipe finance.
Pour un guide complet sur la mise en cache des prompts, consultez la série qui commence par Fonctionnement du KV Cache et du TTL, ainsi que le tutoriel Python prêt à l’emploi.
FAQ
Sonnet 5 est-il moins cher que Sonnet 4.6 ? Uniquement pendant la période de lancement. Jusqu’au 31 août 2026, son tarif est de $2 / $10 contre $3 / $15 pour 4.6. À partir du 1er septembre, il passera à $3 / $15, soit le même tarif. Comme un même texte compte environ 41 % de tokens en plus avec Sonnet 5, le même prompt coûtera davantage qu’avec 4.6 au tarif standard.
Quand le tarif de lancement prend-il fin ? Le 31 août 2026, d’après l’annonce d’Anthropic. Le 1er septembre, le tarif passera à $3 par million de tokens en entrée et $15 par million de tokens en sortie.
Combien Sonnet 5 coûte-t-il de moins qu’Opus 4.8 ? 2,5× de moins au tarif de lancement et 1,67× de moins au tarif standard, aussi bien en entrée qu’en sortie. Les deux modèles utilisent le même tokenizer : le nombre de tokens est donc identique et seule la différence de tarif entre en jeu, aux deux niveaux de prix.
Dois-je modifier mon code cache_control ?
Non. La syntaxe des marqueurs, la limite de breakpoints et les options de TTL sont identiques à celles de la gamme Opus. Modifiez uniquement le champ model. Les lectures à chaud coûtent ≈10 % du prix d’entrée ; une écriture pour 1 heure coûte ≈2× le prix sans cache, contre ≈1,25× pour 5 minutes.
Sonnet 5 peut-il remplacer directement Opus 4.8 ? Pour le cache, le TTL et les coûts, la migration est triviale et Sonnet 5 est moins cher aux deux tarifs. Pour la qualité, exécutez vos propres evals ; nous ne publions pas de benchmarks de capacité que nous n’avons pas exécutés. Pour les affirmations relatives à la qualité du modèle, consultez la model card d’Anthropic.
Vérification : les prix, le cache, le TTL et les nombres de tokens ont été mesurés sur https://synthorai.io/ le 2026-07-01, via l’API Anthropic native /v1/messages, avec un seul tenant. Les prix par token sont calculés à partir du coût indiqué dans usage lors d’appels simples ; le coût par tour correspond à la médiane d’un petit échantillon utilisant un préfixe de 2,2K tokens en cache et reflète le tarif de lancement actuel. Le tarif de lancement et son échéance au 31 août 2026 viennent de l’annonce de Sonnet 5 par Anthropic ; les ratios de réduction et de surcoût ont été vérifiés avec la documentation d’Anthropic sur le Prompt Caching. Vos chiffres varieront selon le prompt, la région et la charge.