Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Claude Sonnet 4.6

Rilasciato 2026-02-17

chatCodiceRagionamentoChiamata di strumentiVisioneCaching dei prompt

Claude Sonnet 4.6 è la generazione che ha portato la capacità di grande contesto al livello Sonnet: rispetto a Sonnet 4.5 espande la finestra di contesto da 200K a 1M di token, raddoppia l'output massimo a 128K token e aggiunge il thinking adattivo accanto all'extended thinking.

Input
testo immagine $3/M
Output
testo $15/M
Lettura cache
$0.3/M
Contesto
1M
vs GPT-4o
~40% più economico
Cutoff di conoscenza
2025-08

Benchmark

Sopra la mediasolo 2 confrontabili
Claude Sonnet 4.6 altri modelli misurati media dei modelli confrontati nessun altro modello ha fatto meglio
Terminal Bench 2.0 Terminus 2, max
59.1%
OSWorld-Verified
72.5%
GDPval-AA v2 Elo, max · 1606-1633
1633
MMMLU max
89.3%
MCP-Atlas max
61.3%
MMMU-Pro no tools, max
74.5%

Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance Google Moonshot OpenAI

Il prezzo nel contesto

Posizione del prezzo tra 60 modelli comparabili

Input$3/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$15/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.3/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 1.000.000
Output massimo (specifica del vendor) 128.000
Cutoff di conoscenza 2025-08
Dati di addestramento fino a 2026-01 conoscenza fino a 2025-08

Caching prompt

Modalità esplicito (opt-in)
Prefisso min. 1.024
Durata 5 min predefinito, 1 ora opzionale
Costo di scrittura 1.25x (5m) / 2x (1h)

Ragionamento

Parametro del fornitore thinking.type + output_config.effort (budget_tokens still accepted, deprecated)
Valori accettati thinking.type adaptive · enabled (deprecated) · disabled; effort low · medium · high · max (no xhigh)
Valore predefinito thinking disattivato; effort high applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento Il thinking adattivo si intercala automaticamente tra le chiamate a strumenti senza header beta; nella modalità manuale "enabled" l'header interleaved-thinking-2025-05-14 funziona ancora ma è deprecato; i blocchi di thinking dei turni precedenti restano nel contesto e vengono fatturati come input.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo + immagine → testo
  • Contesto da 1M di token in GA a prezzo standard dal 2026-03-13
  • fino a 300k token di output sulla Batch API con l'header beta output-300k-2026-03-24

fonte: documentazione ufficiale Anthropic ↗

Un solo prompt, misurato attraverso il gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICA esattamente 3 frasi

Claude Sonnet 4.6 superato · 3 sentences

Here is a three-sentence explanation for a CFO: Reasoning models "think out loud" by generating a long internal chain of thought before producing the final answer, and every token in that thinking process is billed at the same rate as the output you actually see. This means a single user request that previously cost 500 tokens of output may now cost 5,000 tokens once the hidden reasoning steps are counted, multiplying cost per call by roughly 5-10x depending on task complexity. To control this, we can cap reasoning depth, route simpler tasks back to non-reasoning models, and audit which use cases actually require that level of accuracy to ensure we are only paying the premium where it delivers measurable business value.

out 156 tok latenza 4.9 s

Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICA la correzione supera i test

Claude Sonnet 4.6 superato · 8/8 cases

## The Bug There are two related off-by-one errors: 1. **`cur` starts at `0` instead of `1`** — a single matching pair increments `cur` to `1`, which correctly represents a run of 2, but a single-element list (or any non-repeating list) leaves `cur = 0` and `best = 0`, when the answer should be `1`. 2. **`best` is only updated inside the `if` branch** — a run that ends at the last index is captured correctly *in that branch*, but the initialization problem means the baseline "every element is a run of at least 1" is never established. The root cause is that **`cur` tracks the number of *consecutive equal pairs*, not the length of the run**. Switching to tracking run length directly (starting `cur = 1`, updating `best` on *every* iteration including the `else` branch reset) fixes both issues. […]

out 685 tok latenza 12.2 s

Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICA JSON valido, schema esatto

Claude Sonnet 4.6 superato · 5/5 fields, guidance null

```json { "company": "Meridian Robotics", "quarter": "Q3 (September quarter)", "revenue_usd_m": 412, "growth_pct": 11, "guidance": null } ```

out 67 tok latenza 1.3 s

Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICA 120 parole, 0 parole vietate

Claude Sonnet 4.6 superato · 121 words, 0 banned, 1 question

**Introducing Prompt Caching Across Providers** Managing AI costs gets complicated when identical prompts hit multiple providers repeatedly, burning through tokens unnecessarily. Today, we're launching cross-provider prompt caching in our API gateway — a feature that stores prompt responses and serves cached results regardless of which underlying model handles your request. Here's how it works: when your application sends a repeated prompt, the gateway checks its cache first, returning stored outputs in milliseconds rather than forwarding requests to OpenAI, Anthropic, or any connected provider. Why pay for the same generation twice? With configurable TTL settings and cache-key customization, teams processing high-volume or repetitive workloads will see immediate latency improvements and measurable cost reductions starting on day one. Available now on all paid plans.

out 177 tok latenza 5.4 s

Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.

Usa Claude Sonnet 4.6 in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="claude-sonnet-4-6",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Informazioni su Claude Sonnet 4.6

  • Anthropic lo ha lanciato come il suo modello bilanciato, che combina velocità e intelligenza per i compiti di tutti i giorni, con prestazioni migliorate nella ricerca agentica pur consumando meno token, e la finestra da 1M è in disponibilità generale a prezzo standard anziché riservata alla beta.
  • Mantiene il profilo di latenza rapida di Sonnet e il prezzo di $3/$15 per milione di token, con input visivo e uso di strumenti ovunque, e rientra nella beta della Batch API con output esteso a 300K.
  • L'effort copre da low fino a max ma non xhigh; benché il parametro abbia high come predefinito, Anthropic raccomanda esplicitamente di impostarlo su questo modello per evitare latenze inattese, e suggerisce medium come predefinito pratico.
  • L'extended thinking funziona ancora ma è deprecato a favore di quello adattivo, e nessuno dei due tipi di thinking viene rifiutato del tutto.
  • Qui il prefill del messaggio dell'assistente restituisce un errore, mentre i parametri di sampling non predefiniti sono ancora tollerati.
  • Quella restrizione arriva con Sonnet 5.
  • Usa il tokenizer più vecchio, quindi i conteggi dei token restano confrontabili con i modelli precedenti.
  • Anthropic ora lo elenca come modello legacy superato da Claude Sonnet 5.
  • Tramite l'endpoint compatibile OpenAI di Synthorai si inserisce senza modifiche in qualsiasi integrazione esistente in stile GPT.

FAQ

L'API di Claude Sonnet 4.6 si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $3/M token in input, quel credito da solo copre circa 41 richieste da ~8K token verso Claude Sonnet 4.6.

In cosa eccelle Claude Sonnet 4.6?

Contesto espanso da 200K a 1M di token; output massimo raddoppiato a 128K token; thinking adattivo a prezzo invariato di $3/$15. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa Claude Sonnet 4.6?

Su Synthorai, Claude Sonnet 4.6 costa $3 per milione di token in input e $15 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.3/M.

Claude Sonnet 4.6 supporta il caching dei prompt?

Sì, su opt-in: marca i prefissi stabili con breakpoint cache_control. I token di input in cache si fatturano a $0.3/M contro $3/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL 5 min predefinito, 1 ora opzionale). Guida al caching dei prompt →

Come ottengo l'accesso a Claude Sonnet 4.6?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="claude-sonnet-4-6" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Qual è il cutoff di conoscenza di Claude Sonnet 4.6?

Il cutoff di conoscenza di Claude Sonnet 4.6 è 2025-08, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-09).

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →