Claude Sonnet 4.6 è la generazione che ha portato la capacità di grande contesto al livello Sonnet: rispetto a Sonnet 4.5 espande la finestra di contesto da 200K a 1M di token, raddoppia l'output massimo a 128K token e aggiunge il thinking adattivo accanto all'extended thinking.
- Input
- testo immagine $3/M
- Output
- testo $15/M
- Lettura cache
- $0.3/M
- Contesto
- 1M
- vs GPT-4o
- ~40% più economico
- Cutoff di conoscenza
- 2025-08
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.000.000 |
|---|---|
| Output massimo (specifica del vendor) | 128.000 |
| Cutoff di conoscenza | 2025-08 |
| Dati di addestramento fino a | 2026-01 conoscenza fino a 2025-08 |
Caching prompt
| Modalità | esplicito (opt-in) |
|---|---|
| Prefisso min. | 1.024 |
| Durata | 5 min predefinito, 1 ora opzionale |
| Costo di scrittura | 1.25x (5m) / 2x (1h) |
Ragionamento
| Parametro del fornitore | thinking.type + output_config.effort (budget_tokens still accepted, deprecated) |
|---|---|
| Valori accettati | thinking.type adaptive · enabled (deprecated) · disabled; effort low · medium · high · max (no xhigh) |
| Valore predefinito | thinking disattivato; effort high applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | Il thinking adattivo si intercala automaticamente tra le chiamate a strumenti senza header beta; nella modalità manuale "enabled" l'header interleaved-thinking-2025-05-14 funziona ancora ma è deprecato; i blocchi di thinking dei turni precedenti restano nel contesto e vengono fatturati come input. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine → testo |
|---|
- Contesto da 1M di token in GA a prezzo standard dal 2026-03-13
- fino a 300k token di output sulla Batch API con l'header beta output-300k-2026-03-24
Un solo prompt, misurato attraverso il gateway
Claude Sonnet 4.6 superato · 3 sentences
Here is a three-sentence explanation for a CFO: Reasoning models "think out loud" by generating a long internal chain of thought before producing the final answer, and every token in that thinking process is billed at the same rate as the output you actually see. This means a single user request that previously cost 500 tokens of output may now cost 5,000 tokens once the hidden reasoning steps are counted, multiplying cost per call by roughly 5-10x depending on task complexity. To control this, we can cap reasoning depth, route simpler tasks back to non-reasoning models, and audit which use cases actually require that level of accuracy to ensure we are only paying the premium where it delivers measurable business value.
out 156 tok latenza 4.9 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
Claude Sonnet 4.6 superato · 8/8 cases
## The Bug There are two related off-by-one errors: 1. **`cur` starts at `0` instead of `1`** — a single matching pair increments `cur` to `1`, which correctly represents a run of 2, but a single-element list (or any non-repeating list) leaves `cur = 0` and `best = 0`, when the answer should be `1`. 2. **`best` is only updated inside the `if` branch** — a run that ends at the last index is captured correctly *in that branch*, but the initialization problem means the baseline "every element is a run of at least 1" is never established. The root cause is that **`cur` tracks the number of *consecutive equal pairs*, not the length of the run**. Switching to tracking run length directly (starting `cur = 1`, updating `best` on *every* iteration including the `else` branch reset) fixes both issues. […]
out 685 tok latenza 12.2 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
Claude Sonnet 4.6 superato · 5/5 fields, guidance null
```json { "company": "Meridian Robotics", "quarter": "Q3 (September quarter)", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```
out 67 tok latenza 1.3 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
Claude Sonnet 4.6 superato · 121 words, 0 banned, 1 question
**Introducing Prompt Caching Across Providers** Managing AI costs gets complicated when identical prompts hit multiple providers repeatedly, burning through tokens unnecessarily. Today, we're launching cross-provider prompt caching in our API gateway — a feature that stores prompt responses and serves cached results regardless of which underlying model handles your request. Here's how it works: when your application sends a repeated prompt, the gateway checks its cache first, returning stored outputs in milliseconds rather than forwarding requests to OpenAI, Anthropic, or any connected provider. Why pay for the same generation twice? With configurable TTL settings and cache-key customization, teams processing high-volume or repetitive workloads will see immediate latency improvements and measurable cost reductions starting on day one. Available now on all paid plans.
out 177 tok latenza 5.4 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa Claude Sonnet 4.6 in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="claude-sonnet-4-6",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "claude-sonnet-4-6",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-4-6",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "claude-sonnet-4-6",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("claude-sonnet-4-6")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su Claude Sonnet 4.6
- Anthropic lo ha lanciato come il suo modello bilanciato, che combina velocità e intelligenza per i compiti di tutti i giorni, con prestazioni migliorate nella ricerca agentica pur consumando meno token, e la finestra da 1M è in disponibilità generale a prezzo standard anziché riservata alla beta.
- Mantiene il profilo di latenza rapida di Sonnet e il prezzo di $3/$15 per milione di token, con input visivo e uso di strumenti ovunque, e rientra nella beta della Batch API con output esteso a 300K.
- L'effort copre da low fino a max ma non xhigh; benché il parametro abbia high come predefinito, Anthropic raccomanda esplicitamente di impostarlo su questo modello per evitare latenze inattese, e suggerisce medium come predefinito pratico.
- L'extended thinking funziona ancora ma è deprecato a favore di quello adattivo, e nessuno dei due tipi di thinking viene rifiutato del tutto.
- Qui il prefill del messaggio dell'assistente restituisce un errore, mentre i parametri di sampling non predefiniti sono ancora tollerati.
- Quella restrizione arriva con Sonnet 5.
- Usa il tokenizer più vecchio, quindi i conteggi dei token restano confrontabili con i modelli precedenti.
- Anthropic ora lo elenca come modello legacy superato da Claude Sonnet 5.
- Tramite l'endpoint compatibile OpenAI di Synthorai si inserisce senza modifiche in qualsiasi integrazione esistente in stile GPT.
FAQ
L'API di Claude Sonnet 4.6 si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $3/M token in input, quel credito da solo copre circa 41 richieste da ~8K token verso Claude Sonnet 4.6.
In cosa eccelle Claude Sonnet 4.6?
Contesto espanso da 200K a 1M di token; output massimo raddoppiato a 128K token; thinking adattivo a prezzo invariato di $3/$15. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa Claude Sonnet 4.6?
Su Synthorai, Claude Sonnet 4.6 costa $3 per milione di token in input e $15 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.3/M.
Claude Sonnet 4.6 supporta il caching dei prompt?
Sì, su opt-in: marca i prefissi stabili con breakpoint cache_control. I token di input in cache si fatturano a $0.3/M contro $3/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL 5 min predefinito, 1 ora opzionale). Guida al caching dei prompt →
Come ottengo l'accesso a Claude Sonnet 4.6?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="claude-sonnet-4-6" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Qual è il cutoff di conoscenza di Claude Sonnet 4.6?
Il cutoff di conoscenza di Claude Sonnet 4.6 è 2025-08, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-09).
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.