Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

Claude Sonnet 5.5 vs Sonnet 5: stesso prezzo, -80% per task

Indice
  1. Cosa cambia in Claude Sonnet 5.5?
  2. Cosa mostrano i benchmark del rilascio?
  3. Come abbiamo effettuato le misurazioni?
  4. Sonnet 5.5 costa meno di Sonnet 5 per task?
  5. Quanto costa ciascun livello di effort?
  6. Perché Sonnet 5.5 inserisce i passaggi nella risposta?
  7. Cosa succede in un tool loop?
  8. Sonnet 5.5 è più veloce?
  9. I token budget di Sonnet 5 restano validi?
  10. Quale modello conviene usare?
  11. FAQ

Claude Sonnet 5.5 ha gli stessi prezzi per token di Claude Sonnet 5: $2 per milione di token in input e $10 per milione in output. Ogni risparmio dipende quindi dal minor numero di token utilizzati. Su 13 task single-shot eseguiti con le impostazioni predefinite dell’API, il costo è stato di $0.0041 per task contro $0.021 di Sonnet 5, l’80% in meno, ed entrambi i modelli hanno risposto correttamente a tutti i task. Il problema riguarda il formato dell’output: sotto il livello di effort xhigh, Sonnet 5.5 a volte non usa il reasoning nascosto e inserisce i passaggi nella risposta, anche quando il prompt chiede esclusivamente il risultato.

TL;DR

  • Con le impostazioni predefinite dell’API, Sonnet 5.5 è costato $0.0041 per task contro $0.021 di Sonnet 5; entrambi hanno risposto correttamente a tutte le 39 chiamate.
  • Sonnet 5.5 ha avuto costi simili con effort low, medium e high; max è costato 3.5x rispetto al valore predefinito.
  • Sotto xhigh, Sonnet 5.5 ha inserito i passaggi nella risposta in 68 dei 156 prompt che chiedevano solo il risultato; un system prompt non ha risolto il problema.
  • In un tool loop con quattro domande, Sonnet 5.5 a max è costato $0.042 per esecuzione, più di Opus 5.5 con le impostazioni predefinite ($0.033).

Anthropic ha rilasciato Sonnet 5.5 il 2026-09-28, dichiarando che è più veloce del 30% e costa “fino al 30% in meno per task” rispetto a Sonnet 5. Abbiamo effettuato le misurazioni il giorno successivo.

Cosa cambia in Claude Sonnet 5.5?

Il prezzo è rimasto invariato, mentre sono cambiati i controlli del thinking e diversi parametri delle richieste. Sonnet 5.5 usa l’adaptive thinking: il modello decide quanto reasoning nascosto eseguire prima di rispondere, e i relativi token vengono fatturati come output. Il comportamento si controlla tramite effort (output_config.effort nella Messages API), un parametro della richiesta con cinque livelli da low a max. Il valore predefinito dell’API è high.

Sonnet 5.5Sonnet 5Opus 5.5
Data di rilascio2026-09-282026-06-302026-09-22
Input / output, per 1M token$2 / $10$2 / $10$4 / $20
Lettura dalla cache, per 1M token$0.20$0.20$0.20
Finestra di contesto / output massimo1M / 128K1M / 128K1M / 128K
Knowledge cutoff (è pubblicato solo il mese)Giugno 2026Gennaio 2026Giugno 2026
Effort predefinito nell’APIhighhighmedium
Impostazione minima del thinkingbetween_tools (con high o inferiore)disablednon può essere disattivato; il thinking è sempre attivo
Prompt minimo memorizzabile in cache512 token1,024 token512 token

Il prezzo di lancio di Sonnet 5, $2 / $10, era stato presentato come promozionale, ma la pagina dei prezzi di Anthropic ora lo indica come standard; il previsto aumento a $3 / $15 non è avvenuto.

Secondo la guida alla migrazione, le seguenti richieste funzionavano con Sonnet 5 ma restituiscono HTTP 400 con Sonnet 5.5:

  • thinking: {"type": "disabled"}. Va sostituito con thinking: {"type": "between_tools"}, che disattiva il reasoning prima della prima risposta ed è accettato solo con effort high o inferiore.
  • Uso forzato dei tool (tool_choice impostato su any o su un tool specifico). Va mantenuto auto, indicando nel prompt quando usare il tool.
  • Un budget di thinking manuale (budget_tokens), valori non predefiniti per temperature, top_p o top_k, e un turno assistant precompilato, cioè l’inizio della risposta fornito al modello.
  • Il replay di un blocco di thinking di Sonnet 5.5 dopo aver modificato il system prompt, i tool o un messaggio precedente, per gli account creati dal 2026-08-31.
  • Il precedente tool per computer use computer_20251124 nella Claude API e su Google Cloud.

Una modifica non genera errori: le brevi note scritte dal modello tra le chiamate ai tool ora arrivano come blocchi thinking, vuoti con l’impostazione di visualizzazione predefinita. Di conseguenza, un’interfaccia che le mostra in streaming non visualizza più nulla.

Cosa mostrano i benchmark del rilascio?

Nella tabella di Anthropic, Sonnet 5.5 è a pochi punti da Opus 5.5, pur avendo prezzi per token dimezzati, ed è molto avanti rispetto a Sonnet 5.

Benchmark (cosa misura)Sonnet 5.5Sonnet 5Opus 5.5GPT-6 Sol
Terminal-Bench 4.0 (coding agentico in un terminale)70.6%10.3%66.4% (xhigh)non dichiarato
CursorBench 4.0 (coding in un editor)55.5%34.1%57.8%non dichiarato
GDPval-AA v2.1 (documenti per knowledge work, punteggio Elo, più alto è meglio)1844144918461487
OSWorld 2.1 (computer use, punteggio parziale)80.1%57.0%81.8%non dichiarato
Humanity’s Last Exam, con tool64.5%54.9%67.7%non dichiarato

Artificial Analysis segnala un problema di costo: con effort max, Sonnet 5.5 ha ottenuto 56 nel suo Intelligence Index, due punti meno di Opus 5.5 a max, ma ha usato circa 193K token di output per task. È il valore più alto mai misurato dal sito, circa il 60% in più rispetto a Opus 5.5 o Sonnet 5 a max, per un costo di circa $7.60 per task dell’indice.

Come abbiamo effettuato le misurazioni?

Abbiamo inviato a tutti e tre i modelli 13 task single-shot, ciascuno composto da un prompt e una risposta, senza tool e con risultati noti: otto task brevi, come sommare i numeri primi inferiori a 60 o contare la cifra 7 da 1 a 500, e cinque che richiedono più passaggi, come un problema knapsack con 10 elementi, i percorsi in una griglia 8x8 con ostacoli e 13 elevato alla potenza 1,001 modulo 10,007. Abbiamo calcolato ogni soluzione localmente con brute force e concluso ogni prompt con “Rispondi con un solo numero intero, nient’altro”. Ogni task è stato eseguito 3 volte con le impostazioni predefinite dell’API e con ciascuno dei cinque livelli di effort, per un totale di 702 chiamate sulla Messages API nativa. Ogni prompt conteneva una stringa casuale univoca, così da evitare risposte provenienti dalla cache, e i costi sono stati calcolati in base ai prezzi di listino di Anthropic. Abbiamo verificato sia la correttezza del risultato finale sia la presenza del solo risultato nella risposta.

L’accuratezza non ha evidenziato differenze tra i modelli. Sonnet 5.5 ha risposto correttamente a tutte le 234 chiamate e Sonnet 5 a tutte le 233 completate, mentre una ha restituito un errore del server; Opus 5.5 ha sbagliato un task con low e uno con le impostazioni predefinite.

Sonnet 5.5 costa meno di Sonnet 5 per task?

Sonnet 5.5 è costato l’80% in meno rispetto a Sonnet 5 con le impostazioni predefinite e dal 77% al 78% in meno con low, medium e high, perché ha generato circa un quinto dei token di output. I prezzi di listino sono identici, quindi il risparmio dipende interamente dall’efficienza nell’uso dei token. Sonnet 5 ha generato circa 1,800-2,100 token per task a ogni livello di effort; Sonnet 5.5 ne ha generati circa 400 fino a xhigh.

Tutti i 13 task, per taskSonnet 5.5Sonnet 5Opus 5.5
Impostazioni API predefinite$0.0041 (396 token)$0.0212 (2,105)$0.0070 (334)
low$0.0043 (409)$0.0184 (1,817)$0.0065 (309)
medium$0.0040 (383)$0.0180 (1,780)$0.0082 (393)
high$0.0043 (416)$0.0188 (1,858)$0.0088 (421)
xhigh$0.0059 (574)$0.0202 (2,001)$0.0105 (507)
max$0.0146 (1,438)$0.0193 (1,909)$0.0234 (1,149)

Grafico a barre raggruppate del costo per task per ciascun livello di effort, in dollari per 1,000 task. Claude Sonnet 5.5: 4.1 con le impostazioni predefinite, 4.3 low, 4.0 medium, 4.3 high, 5.9 xhigh, 14.6 max. Claude Opus 5.5: 7.0 con le impostazioni predefinite, 6.5 low, 8.2 medium, 8.8 high, 10.5 xhigh, 23.4 max. Claude Sonnet 5: 21.2 con le impostazioni predefinite, 18.4 low, 18.0 medium, 18.8 high, 20.2 xhigh, 19.3 max

I conteggi indicano la media dei token di output per chiamata, reasoning incluso. Sui cinque task difficili, il risparmio con le impostazioni predefinite è dell’84% ($0.0057 contro $0.0348). Nel nostro tool loop, dove l’intera conversazione viene reinviata a ogni turno e dominano i token di input, il risparmio è dell’8%. Il “fino al 30%” dichiarato da Anthropic è quindi prudente per prompt singoli come questi, ma generoso per un loop breve come il nostro.

Con solo 13 task, il risparmio dell’80% con l’impostazione predefinita ha un margine ampio: ricampionando i task si ottiene un intervallo al 95% tra il 66% e l’85% in meno, e il limite inferiore resta sopra il 50% in ogni livello da low a xhigh.

Quanto costa ciascun livello di effort?

Con Sonnet 5.5, low, medium e high costano tutti circa $0.0042 per task, quindi in questo test il valore predefinito high non comporta costi aggiuntivi; xhigh è costato circa il 40% in più e max 3.5x rispetto al valore predefinito. A max, Sonnet 5.5 è costato il doppio per task rispetto a Opus 5.5 con le impostazioni predefinite ($0.0146 contro $0.0070), senza miglioramenti nell’accuratezza.

Questo andamento piatto non vale per tutti i workload: in un task DevOps più lungo, un altro tester ha rilevato che high usava circa il doppio dei token di output rispetto a medium. Se l’effort incide sul workload, serve un test completo su tutti i livelli.

Perché Sonnet 5.5 inserisce i passaggi nella risposta?

Sotto xhigh, Sonnet 5.5 non usa sempre un blocco di thinking. Quando lo omette, esegue il reasoning direttamente nella risposta. Il blocco di thinking è la parte separata della risposta che contiene il reasoning del modello; il testo è vuoto per impostazione predefinita e la risposta segue in un blocco text.

Delle 234 risposte di Sonnet 5.5, tutte le 166 con un blocco di thinking contenevano esclusivamente il risultato. Tutte le 68 senza blocco mostravano prima i passaggi, per esempio “09:47 + 3:46 = 13:33 … + 1:39 = 15:40”, seguiti da “15:40”. Il risultato finale era sempre corretto, ma il formato non rispettava la richiesta del prompt.

Risposte contenenti solo il risultatoSonnet 5.5Sonnet 5Opus 5.5
Impostazioni API predefinite22 / 3938 / 3938 / 39
low12 / 3937 / 3938 / 39
medium24 / 3937 / 3939 / 39
high30 / 3938 / 3939 / 39
xhigh39 / 3935 / 3839 / 39
max39 / 3937 / 3939 / 39

Il comportamento dipende dal task: dove è successo, Sonnet 5.5 ha mostrato i calcoli in tutte e tre le ripetizioni, tranne che in un task con l’impostazione predefinita, dove è accaduto due volte. È successo su 9 dei 13 task con low, 6 con l’impostazione predefinita, 5 con medium e 3 con high (tutti brevi calcoli aritmetici). Contati per task, con soli 13 task, nessuno di questi scarti supera una correzione di Holm, quindi i conteggi vanno letti come osservazioni e non come un tasso su cui pianificare. Gli errori di formato di Sonnet 5 sono diversi: una risposta corretta in grassetto seguita da una breve spiegazione. La riga xhigh contiene 38 chiamate perché una ha restituito un errore del server.

Un system prompt che chiedeva “solo il risultato finale”, con tutti i passaggi svolti senza mostrarli, non ha aiutato: Sonnet 5.5 ha fornito esclusivamente il risultato in 8 dei 24 task brevi a low e in 9 dei 24 a medium, contro 6 e 9 senza system prompt. xhigh ha risolto il problema: ogni risposta conteneva un blocco di thinking e il solo risultato, con un costo superiore di circa il 40% rispetto a low, medium e high. Per il codice che esegue il parsing dell’output del modello:

  • Usare xhigh quando la risposta deve stare su una sola riga.
  • Oppure leggere il risultato dall’ultima riga non vuota, che è stata corretta in tutti i 68 casi osservati.
  • Anche gli structured output di Anthropic possono vincolare la risposta a uno schema; non abbiamo testato questa soluzione.
import anthropic

client = anthropic.Anthropic()
prompt = "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else."
resp = client.messages.create(
    model="claude-sonnet-5-5",
    max_tokens=16000,
    output_config={"effort": "xhigh"},  # low, medium, high (API default), xhigh, max
    messages=[{"role": "user", "content": prompt}],
)
text = "".join(block.text for block in resp.content if block.type == "text")
lines = text.strip().splitlines()
answer = lines[-1] if lines else None  # below xhigh, working can precede the answer
print(answer, resp.usage.output_tokens)  # output_tokens includes the reasoning

Cosa succede in un tool loop?

Con le impostazioni predefinite, low e medium, Sonnet 5.5 ha completato correttamente ogni esecuzione di un loop con quattro domande di code reading, per circa $0.011, un terzo del costo di Opus 5.5. A max ha effettuato tre volte più chiamate ai tool ed è costato più di Opus 5.5. Ogni modello dispone di tre tool, per elencare i file, leggere un file ed eseguire ricerche, su una piccola codebase sintetica. Ogni risposta richiede da 3 a 6 consultazioni distribuite tra più file.

Tool loop, 12 esecuzioni ciascunoRisoltiMediana dei turniChiamate ai tool per esecuzioneCosto per esecuzioneMediana del tempo totale
Sonnet 5.5, predefinito12 / 1234.8$0.01126.7 s
Sonnet 5.5, low12 / 1234.9$0.01127.4 s
Sonnet 5.5, medium12 / 1235.1$0.01136.8 s
Sonnet 5.5, max12 / 12414.7$0.042220.1 s
Opus 5.5, predefinito12 / 1245.3$0.033225.3 s
Sonnet 5, predefinito11 / 123.54.2$0.012215.8 s

Le testimonianze dei clienti riportate da VentureBeat indicano meno chiamate ai tool rispetto a Sonnet 5, un terzo in meno nel caso di Lovable. Il nostro loop è troppo breve per mostrare questo vantaggio: Sonnet 5.5 ha effettuato 4.8 chiamate per esecuzione contro 4.2 di Sonnet 5, pur costando l’8% in meno e terminando in meno della metà del tempo.

Sonnet 5.5 è più veloce?

Ha terminato prima soprattutto perché ha generato meno testo. La mediana del tempo totale, dall’invio della richiesta alla ricezione della risposta completa, per ogni task single-shot con le impostazioni predefinite è stata di 3.9 secondi per Sonnet 5.5, 8.1 secondi per Sonnet 5 e 5.5 secondi per Opus 5.5. I token di output al secondo sul tempo totale erano quasi identici per i due Sonnet, 88 contro 91. L’attesa si è dimezzata perché Sonnet 5.5 ha generato un quinto dei token, non perché li abbia prodotti più velocemente. Sui task difficili, i tempi sono 5.8 secondi contro 21.0.

I token budget di Sonnet 5 restano validi?

I budget di contesto e i limiti max_tokens pensati per Sonnet 5 dovrebbero continuare ad andare bene. Secondo la guida alla migrazione di Anthropic, Sonnet 5.5 usa lo stesso tokenizer, e i quattro testi fissi che abbiamo provato (prosa inglese, codice Python, argomenti JSON per gli strumenti, prosa cinese) hanno dato lo stesso numero di token su entrambi i modelli e su Opus 5.5, per esempio 1,270 token per l’inglese e 493 per il cinese; Sonnet 5.5 e Opus 5.5 aggiungono 2 token fissi per richiesta. Le richieste con strumenti costano un po’ meno in input: la pagina dei prezzi di Anthropic indica 286 token per il prompt di sistema nascosto sull’uso degli strumenti su Sonnet 5.5, contro 354 su Sonnet 5.

Quale modello conviene usare?

Per la maggior parte dei workload basati su Sonnet 5, conviene migrare; resta da scegliere il livello di effort.

WorkloadProblema da monitorareRaccomandazioneNumeri
Output elaborato dal codice: estrazione, classificazione, singoli valoriSotto xhigh, i passaggi possono finire nella rispostaSonnet 5.5 a xhigh, oppure medium con parsing dell’ultima rigasolo risultato in 39 / 39 casi a xhigh, 24 / 39 a medium; xhigh costa circa il 40% in più
Chat e testo destinato agli utentiLatenza e costoSonnet 5.5 a medium$0.0040 per task, mediana di 3.9 s
Loop agentici con toolmax moltiplica le chiamate ai toolSonnet 5.5 con le impostazioni predefinite o a medium; passare a Opus 5.5 prima di usare Sonnet 5.5 a max$0.011 per esecuzione con le impostazioni predefinite, $0.042 a max, $0.033 con Opus 5.5
Codice per Sonnet 5 che disattiva il thinking o forza un toolHTTP 400 dopo il cambio di modellobetween_tools (con high o inferiore) e tool_choice: autoGuida alla migrazione di Anthropic

Indipendentemente dal livello di effort, il codice dovrebbe includere due controlli: verificare che la risposta abbia il formato atteso dal parser e imporre un limite ai token di output per ogni richiesta, perché max ha aumentato il costo per task di 3.5x sui prompt singoli e le chiamate ai tool di 3x nel loop.

FAQ

Sonnet 5.5 costa meno di Opus 5.5? Con le rispettive impostazioni predefinite, Sonnet 5.5 è costato il 41% in meno di Opus 5.5 per ogni task single-shot e un terzo per ogni esecuzione del tool loop. A max l’ordine si inverte: Sonnet 5.5 è costato il doppio rispetto a Opus 5.5 con le impostazioni predefinite sui task single-shot e il 27% in più per ogni esecuzione del tool loop.

Quale livello di effort conviene usare con Sonnet 5.5? Sonnet 5.5 ha avuto costi simili con low, medium e high nei nostri task, da $0.0040 a $0.0043, quindi medium è un buon punto di partenza per chat e tool loop. Va usato xhigh quando il codice si aspetta un singolo valore nella risposta; max è costato 3.5x rispetto al valore predefinito.

Posso ancora disattivare il thinking su Sonnet 5.5? Sonnet 5.5 rifiuta thinking: {"type": "disabled"} con HTTP 400. Va inviato invece thinking: {"type": "between_tools"}, accettato con effort low, medium o high.

Misurazioni correlate: Claude Opus 5.5 vs Opus 5, il tokenizer di Claude Sonnet 5 e i controlli del thinking dei vari provider.

Misurazioni eseguite il 2026-09-29, un giorno dopo il rilascio, tramite un gateway verso la Anthropic Messages API. In totale: 702 chiamate single-shot valutate, con 13 task e soluzioni calcolate tramite brute force, 3 ripetizioni, 6 livelli di effort e 3 modelli; 48 chiamate per testare una system instruction sul formato dell’output; 72 esecuzioni del tool loop, con 4 domande multi-hop, 3 ripetizioni e 6 impostazioni; conteggio dei token per quattro testi fissi su ciascun modello. I prompt contenevano stringhe casuali; i costi sono stati calcolati in base ai prezzi di listino di Anthropic.

← Torna al blog