Claude Sonnet 4.6 est la génération qui a apporté la capacité de grand contexte au palier Sonnet : par rapport à Sonnet 4.5, il étend la fenêtre de contexte de 200K à 1M de tokens, double la sortie maximale à 128K tokens et ajoute la réflexion adaptative aux côtés de la réflexion étendue.
- Entrée
- texte image $3/M
- Sortie
- texte $15/M
- Lecture de cache
- $0.3/M
- Contexte
- 1M
- vs GPT-4o
- ~40% moins cher
- Coupure des connaissances
- 2025-08
Benchmarks
Chiffres publiés par les fournisseurs : Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI
Le prix en contexte
Position du prix parmi 60 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Tokens
| Fenêtre de contexte (spécification du fournisseur) | 1 000 000 |
|---|---|
| Sortie max (spéc. fournisseur) | 128 000 |
| Coupure des connaissances | 2025-08 |
| Données d'entraînement jusqu'à | 2026-01 connaissances jusqu'à 2025-08 |
Mise en cache
| Mode | explicite (sur activation) |
|---|---|
| Préfixe min. | 1 024 |
| Durée de vie | 5 min par défaut, 1 heure en option |
| Coût d'écriture | 1.25x (5m) / 2x (1h) |
Raisonnement
| Paramètre du fournisseur | thinking.type + output_config.effort (budget_tokens still accepted, deprecated) |
|---|---|
| Valeurs acceptées | thinking.type adaptive · enabled (deprecated) · disabled; effort low · medium · high · max (no xhigh) |
| Valeur par défaut | réflexion désactivée ; effort high appliquée si la requête ne précise rien |
| Désactivable | Oui |
| Comportement du raisonnement | La réflexion adaptative s'entrelace automatiquement entre les appels d'outils sans en-tête bêta ; en mode manuel « enabled », l'en-tête interleaved-thinking-2025-05-14 fonctionne toujours mais est déprécié ; les blocs de réflexion des tours précédents sont conservés dans le contexte et facturés en entrée. |
| Paramètre | reasoning_effort |
| Valeurs | minimal · low · medium · high la surface de paramètres de la passerelle - le mappage fournisseur ci-dessus s'applique |
Modèle
| Modalités | texte + image → texte |
|---|
- Contexte de 1M de tokens en GA au tarif standard depuis le 2026-03-13
- jusqu'à 300k tokens de sortie sur la Batch API avec l'en-tête bêta output-300k-2026-03-24
Un prompt, mesuré via la passerelle
Claude Sonnet 4.6 réussi · 3 sentences
Here is a three-sentence explanation for a CFO: Reasoning models "think out loud" by generating a long internal chain of thought before producing the final answer, and every token in that thinking process is billed at the same rate as the output you actually see. This means a single user request that previously cost 500 tokens of output may now cost 5,000 tokens once the hidden reasoning steps are counted, multiplying cost per call by roughly 5-10x depending on task complexity. To control this, we can cap reasoning depth, route simpler tasks back to non-reasoning models, and audit which use cases actually require that level of accuracy to ensure we are only paying the premium where it delivers measurable business value.
sortie 156 tok latence 4.9 s
Suivi de l'instruction (exactement trois phrases - comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.
Claude Sonnet 4.6 réussi · 8/8 cases
## The Bug There are two related off-by-one errors: 1. **`cur` starts at `0` instead of `1`** — a single matching pair increments `cur` to `1`, which correctly represents a run of 2, but a single-element list (or any non-repeating list) leaves `cur = 0` and `best = 0`, when the answer should be `1`. 2. **`best` is only updated inside the `if` branch** — a run that ends at the last index is captured correctly *in that branch*, but the initialization problem means the baseline "every element is a run of at least 1" is never established. The root cause is that **`cur` tracks the number of *consecutive equal pairs*, not the length of the run**. Switching to tracking run length directly (starting `cur = 1`, updating `best` on *every* iteration including the `else` branch reset) fixes both issues. […]
sortie 685 tok latence 12.2 s
Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.
Claude Sonnet 4.6 réussi · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3 (September quarter)", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
sortie 67 tok latence 1.3 s
Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.
Claude Sonnet 4.6 réussi · 121 words, 0 banned, 1 question
**Introducing Prompt Caching Across Providers** Managing AI costs gets complicated when identical prompts hit multiple providers repeatedly, burning through tokens unnecessarily. Today, we're launching cross-provider prompt caching in our API gateway — a feature that stores prompt responses and serves cached results regardless of which underlying model handles your request. Here's how it works: when your application sends a repeated prompt, the gateway checks its cache first, returning stored outputs in milliseconds rather than forwarding requests to OpenAI, Anthropic, or any connected provider. Why pay for the same generation twice? With configurable TTL settings and cache-key customization, teams processing high-volume or repetitive workloads will see immediate latency improvements and measurable cost reductions starting on day one. Available now on all paid plans.
sortie 177 tok latence 5.4 s
Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.
Utilisez Claude Sonnet 4.6 en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="claude-sonnet-4-6",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "claude-sonnet-4-6",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-4-6",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "claude-sonnet-4-6",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("claude-sonnet-4-6")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));À propos de Claude Sonnet 4.6
- Anthropic l'a lancé comme son modèle équilibré alliant vitesse et intelligence pour les tâches quotidiennes, avec de meilleures performances de recherche agentique tout en consommant moins de tokens, et la fenêtre de 1M est généralement disponible au tarif standard plutôt que réservée à une bêta.
- Il conserve le profil de latence rapide de Sonnet et la tarification à 3 $/15 $ par million de tokens, avec l'entrée visuelle et l'utilisation d'outils tout du long, et il est éligible à la bêta de sortie étendue à 300K de la Batch API.
- L'effort couvre low jusqu'à max mais pas xhigh ; bien que le paramètre vaille high par défaut, Anthropic recommande explicitement de le régler sur ce modèle pour éviter une latence inattendue, et suggère medium comme valeur pratique par défaut.
- La réflexion étendue fonctionne toujours mais est dépréciée au profit de l'adaptative, et aucun des deux types de réflexion n'est rejeté d'emblée.
- Le préremplissage du message assistant renvoie une erreur ici, tandis que les paramètres d'échantillonnage non par défaut sont encore tolérés.
- Cette restriction arrive avec Sonnet 5.
- Il utilise l'ancien tokenizer, de sorte que les comptes de tokens restent comparables à ceux des modèles antérieurs.
- Anthropic le classe désormais comme un modèle hérité (legacy) supplanté par Claude Sonnet 5.
- Via l'endpoint compatible OpenAI de Synthorai, il s'intègre à toute intégration de style GPT existante sans modification.
FAQ
Peut-on essayer l'API Claude Sonnet 4.6 gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $3/M de tokens en entrée, ce crédit couvre à lui seul environ 41 requêtes de ~8K tokens sur Claude Sonnet 4.6.
Quels sont les points forts de Claude Sonnet 4.6 ?
Contexte étendu de 200K à 1M de tokens ; sortie maximale doublée à 128K tokens ; réflexion adaptative à tarification inchangée de 3 $/15 $. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte Claude Sonnet 4.6 ?
Sur Synthorai, Claude Sonnet 4.6 coûte $3 par million de tokens en entrée et $15 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.3/M.
Claude Sonnet 4.6 prend-il en charge la mise en cache des prompts ?
Oui, sur activation : marquez les préfixes stables avec des points d'arrêt cache_control. Les tokens d'entrée en cache sont facturés $0.3/M contre $3/M hors cache ; les prompts doivent avoir un préfixe stable de 1,024 tokens pour être mis en cache (TTL 5 min par défaut, 1 heure en option). Guide de mise en cache des prompts →
Comment obtenir l'accès à Claude Sonnet 4.6 ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="claude-sonnet-4-6", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Quelle est la date de coupure des connaissances de Claude Sonnet 4.6 ?
La date de coupure des connaissances de Claude Sonnet 4.6 est 2025-08, selon la documentation officielle du fournisseur (au 2026-07-09).
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.