Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

Claude Sonnet 4.6

Date de sortie : 2026-02-17

chatCodeRaisonnementAppel d'outilsVisionMise en cache des prompts

Claude Sonnet 4.6 est la génération qui a apporté la capacité de grand contexte au palier Sonnet : par rapport à Sonnet 4.5, il étend la fenêtre de contexte de 200K à 1M de tokens, double la sortie maximale à 128K tokens et ajoute la réflexion adaptative aux côtés de la réflexion étendue.

Entrée
texte image $3/M
Sortie
texte $15/M
Lecture de cache
$0.3/M
Contexte
1M
vs GPT-4o
~40% moins cher
Coupure des connaissances
2025-08

Benchmarks

Au-dessus de la moyenneseulement 2 comparables
Claude Sonnet 4.6 autres modèles mesurés moyenne des modèles comparés aucun autre modèle n'a fait mieux
Terminal Bench 2.0 Terminus 2, max
59.1%
OSWorld-Verified
72.5%
GDPval-AA v2 Elo, max · 1606-1633
1633
MMMLU max
89.3%
MCP-Atlas max
61.3%
MMMU-Pro no tools, max
74.5%

Chiffres publiés par les fournisseurs : Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI

Le prix en contexte

Position du prix parmi 60 modèles comparables

Entrée$3/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Sortie$15/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lecture en cache$0.3/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Tokens

Fenêtre de contexte (spécification du fournisseur) 1 000 000
Sortie max (spéc. fournisseur) 128 000
Coupure des connaissances 2025-08
Données d'entraînement jusqu'à 2026-01 connaissances jusqu'à 2025-08

Mise en cache

Mode explicite (sur activation)
Préfixe min. 1 024
Durée de vie 5 min par défaut, 1 heure en option
Coût d'écriture 1.25x (5m) / 2x (1h)

Raisonnement

Paramètre du fournisseur thinking.type + output_config.effort (budget_tokens still accepted, deprecated)
Valeurs acceptées thinking.type adaptive · enabled (deprecated) · disabled; effort low · medium · high · max (no xhigh)
Valeur par défaut réflexion désactivée ; effort high appliquée si la requête ne précise rien
Désactivable Oui
Comportement du raisonnement La réflexion adaptative s'entrelace automatiquement entre les appels d'outils sans en-tête bêta ; en mode manuel « enabled », l'en-tête interleaved-thinking-2025-05-14 fonctionne toujours mais est déprécié ; les blocs de réflexion des tours précédents sont conservés dans le contexte et facturés en entrée.
Paramètre reasoning_effort
Valeurs minimal · low · medium · high la surface de paramètres de la passerelle - le mappage fournisseur ci-dessus s'applique

Modèle

Modalités texte + image → texte
  • Contexte de 1M de tokens en GA au tarif standard depuis le 2026-03-13
  • jusqu'à 300k tokens de sortie sur la Batch API avec l'en-tête bêta output-300k-2026-03-24

selon docs officielles Anthropic ↗

Un prompt, mesuré via la passerelle

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VÉRIFIER exactement 3 phrases

Claude Sonnet 4.6 réussi · 3 sentences

Here is a three-sentence explanation for a CFO: Reasoning models "think out loud" by generating a long internal chain of thought before producing the final answer, and every token in that thinking process is billed at the same rate as the output you actually see. This means a single user request that previously cost 500 tokens of output may now cost 5,000 tokens once the hidden reasoning steps are counted, multiplying cost per call by roughly 5-10x depending on task complexity. To control this, we can cap reasoning depth, route simpler tasks back to non-reasoning models, and audit which use cases actually require that level of accuracy to ensure we are only paying the premium where it delivers measurable business value.

sortie 156 tok latence 4.9 s

Suivi de l'instruction (exactement trois phrases - comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VÉRIFIER le correctif passe les tests

Claude Sonnet 4.6 réussi · 8/8 cases

## The Bug There are two related off-by-one errors: 1. **`cur` starts at `0` instead of `1`** — a single matching pair increments `cur` to `1`, which correctly represents a run of 2, but a single-element list (or any non-repeating list) leaves `cur = 0` and `best = 0`, when the answer should be `1`. 2. **`best` is only updated inside the `if` branch** — a run that ends at the last index is captured correctly *in that branch*, but the initialization problem means the baseline "every element is a run of at least 1" is never established. The root cause is that **`cur` tracks the number of *consecutive equal pairs*, not the length of the run**. Switching to tracking run length directly (starting `cur = 1`, updating `best` on *every* iteration including the `else` branch reset) fixes both issues. […]

sortie 685 tok latence 12.2 s

Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VÉRIFIER JSON valide, schéma exact

Claude Sonnet 4.6 réussi · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "Q3 (September quarter)", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```

sortie 67 tok latence 1.3 s

Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VÉRIFIER 120 mots, 0 mot interdit

Claude Sonnet 4.6 réussi · 121 words, 0 banned, 1 question

**Introducing Prompt Caching Across Providers** Managing AI costs gets complicated when identical prompts hit multiple providers repeatedly, burning through tokens unnecessarily. Today, we're launching cross-provider prompt caching in our API gateway — a feature that stores prompt responses and serves cached results regardless of which underlying model handles your request. Here's how it works: when your application sends a repeated prompt, the gateway checks its cache first, returning stored outputs in milliseconds rather than forwarding requests to OpenAI, Anthropic, or any connected provider. Why pay for the same generation twice? With configurable TTL settings and cache-key customization, teams processing high-volume or repetitive workloads will see immediate latency improvements and measurable cost reductions starting on day one. Available now on all paid plans.

sortie 177 tok latence 5.4 s

Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.

Utilisez Claude Sonnet 4.6 en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="claude-sonnet-4-6",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

À propos de Claude Sonnet 4.6

  • Anthropic l'a lancé comme son modèle équilibré alliant vitesse et intelligence pour les tâches quotidiennes, avec de meilleures performances de recherche agentique tout en consommant moins de tokens, et la fenêtre de 1M est généralement disponible au tarif standard plutôt que réservée à une bêta.
  • Il conserve le profil de latence rapide de Sonnet et la tarification à 3 $/15 $ par million de tokens, avec l'entrée visuelle et l'utilisation d'outils tout du long, et il est éligible à la bêta de sortie étendue à 300K de la Batch API.
  • L'effort couvre low jusqu'à max mais pas xhigh ; bien que le paramètre vaille high par défaut, Anthropic recommande explicitement de le régler sur ce modèle pour éviter une latence inattendue, et suggère medium comme valeur pratique par défaut.
  • La réflexion étendue fonctionne toujours mais est dépréciée au profit de l'adaptative, et aucun des deux types de réflexion n'est rejeté d'emblée.
  • Le préremplissage du message assistant renvoie une erreur ici, tandis que les paramètres d'échantillonnage non par défaut sont encore tolérés.
  • Cette restriction arrive avec Sonnet 5.
  • Il utilise l'ancien tokenizer, de sorte que les comptes de tokens restent comparables à ceux des modèles antérieurs.
  • Anthropic le classe désormais comme un modèle hérité (legacy) supplanté par Claude Sonnet 5.
  • Via l'endpoint compatible OpenAI de Synthorai, il s'intègre à toute intégration de style GPT existante sans modification.

FAQ

Peut-on essayer l'API Claude Sonnet 4.6 gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $3/M de tokens en entrée, ce crédit couvre à lui seul environ 41 requêtes de ~8K tokens sur Claude Sonnet 4.6.

Quels sont les points forts de Claude Sonnet 4.6 ?

Contexte étendu de 200K à 1M de tokens ; sortie maximale doublée à 128K tokens ; réflexion adaptative à tarification inchangée de 3 $/15 $. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte Claude Sonnet 4.6 ?

Sur Synthorai, Claude Sonnet 4.6 coûte $3 par million de tokens en entrée et $15 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.3/M.

Claude Sonnet 4.6 prend-il en charge la mise en cache des prompts ?

Oui, sur activation : marquez les préfixes stables avec des points d'arrêt cache_control. Les tokens d'entrée en cache sont facturés $0.3/M contre $3/M hors cache ; les prompts doivent avoir un préfixe stable de 1,024 tokens pour être mis en cache (TTL 5 min par défaut, 1 heure en option). Guide de mise en cache des prompts →

Comment obtenir l'accès à Claude Sonnet 4.6 ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="claude-sonnet-4-6", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Quelle est la date de coupure des connaissances de Claude Sonnet 4.6 ?

La date de coupure des connaissances de Claude Sonnet 4.6 est 2025-08, selon la documentation officielle du fournisseur (au 2026-07-09).

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →