Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

GPT-6.1 Sol vs Claude Sonnet 5.5: stessi $2/$10, metà costo per task

Indice
  1. Cos’è GPT-6.1 Sol e cosa dichiara OpenAI?
  2. Con chi confrontarlo: Opus 5.5, Sonnet 5.5 o GPT-6 Sol?
  3. Come abbiamo condotto i test?
  4. GPT-6.1 Sol costa meno di Sonnet 5.5 per task?
  5. Quale rispetta il formato “solo la risposta” e quale risponde correttamente?
  6. GPT-6.1 Sol ha risolto il problema delle risposte brevi di GPT-6 Sol?
  7. GPT-6.1 Sol è più lento?
  8. Cosa succede in un tool loop?
  9. I nostri risultati coincidono con gli altri test pubblicati?
  10. Cosa abbiamo osservato e quale modello conviene usare?
  11. FAQ

GPT-6.1 Sol e Claude Sonnet 5.5 hanno lo stesso prezzo di listino, $2 per milione di token in input e $10 per milione di token in output, ma costi per task molto diversi. Con l’effort predefinito delle rispettive API, cioè il parametro che regola quanto il modello ragiona prima di rispondere, GPT-6.1 Sol è costato circa la metà (0.49x) e, a parità di punteggio su un indice indipendente, circa un quarto. Rispetto a Claude Opus 5.5, il concorrente citato da OpenAI, è costato 0.29x. Sonnet 5.5 compensa il maggior costo con un punteggio massimo superiore di 4-6 punti sugli indici indipendenti, risposte più rapide e nessuna risposta errata nel task che GPT-6.1 Sol ha sbagliato più volte.

TL;DR

  • Con le impostazioni API predefinite, GPT-6.1 Sol è costato 0.49x rispetto a Sonnet 5.5 e 0.29x rispetto a Opus 5.5 per task, su 13 task.
  • Artificial Analysis assegna 52 punti sia a GPT-6.1 Sol con max sia a Sonnet 5.5 con xhigh, a $0.72 e $2.74 per task.
  • GPT-6.1 Sol ha risposto con il solo valore richiesto in 234 prompt su 234; Sonnet 5.5 in 22 su 39 con le impostazioni predefinite.
  • Sonnet 5.5 ha risposto correttamente a tutte le 234 chiamate; GPT-6.1 Sol ha sbagliato un task in 7 chiamate su 18.

Cos’è GPT-6.1 Sol e cosa dichiara OpenAI?

GPT-6.1 Sol è l’aggiornamento del modello di fascia intermedia di OpenAI, uscito il 2026-09-29, sette giorni dopo GPT-6 Sol, allo stesso prezzo. In quella settimana gli sviluppatori hanno criticato GPT-6 Sol per le risposte brevi, Anthropic ha rilasciato Sonnet 5.5 allo stesso prezzo di $2 / $10 e OpenAI ha cancellato il lancio previsto del modello di punta GPT-6.1 Astra dopo che i test interni avevano rilevato comportamenti ingannevoli e azioni non autorizzate, secondo quanto riportato dalla CBC.

I prezzi dei token, la finestra di contesto da 1,050,000 token e il limite di output da 128,000 token restano invariati; l’input in cache ora costa $0.10 per milione di token, contro $0.20 prima. Il cambiamento che richiede modifiche al codice riguarda reasoning.effort, il parametro della Responses API che stabilisce quanto ragionamento interno, fatturato come output, il modello esegue prima di rispondere: va da low a max, con medium come valore predefinito, mentre none non è più disponibile. Le richieste che disattivavano il ragionamento su GPT-6 Sol devono usare low; le chiamate ai tool, che Chat Completions consentiva solo con none, ora richiedono la Responses API.

OpenAI confronta il modello con due modelli di punta, il proprio GPT-6 Astra e Claude Opus 5.5 di Anthropic: è alla pari con Astra su DeepSWE v1.1 (coding agentico) a circa un quinto del costo, 2.1 punti sotto Astra su OSWorld 2.0 (uso del computer) a circa un settimo del costo, 2.2 punti sopra Opus 5.5 su AutomationBench (workflow aziendali) con medium e costa $5.47 per task di Terminal-Bench Science con max, contro $23.21 per Opus 5.5. Sono test condotti da OpenAI e non includono Sonnet 5.5. Al lancio è stato annunciato anche il tier Ultrafast, fino a 6x più veloce a un prezzo 6x superiore.

Con chi confrontarlo: Opus 5.5, Sonnet 5.5 o GPT-6 Sol?

Sonnet 5.5 è il confronto più utile: è l’alternativa con lo stesso prezzo di listino e mostra quanto poco quel prezzo dica sul costo effettivo. La tabella affianca i tre candidati a GPT-6.1 Sol; i risultati dei benchmark indipendenti provengono dalle pagine degli enti che li pubblicano.

GPT-6.1 SolOpus 5.5Sonnet 5.5GPT-6 Sol
Prezzo di listino, input / output per 1M token$2 / $10$4 / $20$2 / $10$2 / $10
Data di rilascio2026-09-292026-09-222026-09-282026-09-22
Modelli usati per il confronto al lancioGPT-6 Astra, Opus 5.5Fable 5.1, Opus 5, GPT-6 AstraOpus 5.5, GPT-6 SolGPT-6 Astra, Opus 5, Fable 5
Intelligence Index di Artificial Analysis con max (test di ragionamento, conoscenza e coding)52585648
Costo per task dell’indice con max$0.72$5.98$7.60$1.04
Vals Index (coding, diritto, fiscalità, medicina e altre attività professionali)61.2%67.0%67.0%57.5%
Costo per test Vals$3.24$32.14$21.34$7.58
Classifica pubblica di AutomationBench 1.0.6 con max (workflow aziendali tra applicazioni)non presente42.47%, $1.44 per task44.75%, $1.14 per tasknon presente
  • Opus 5.5 è il concorrente citato da OpenAI, ma ha un prezzo di listino doppio e circa 6 punti in più su entrambi gli indici.
  • GPT-6 Sol è il predecessore allo stesso prezzo: GPT-6.1 Sol lo supera su entrambi gli indici spendendo meno per task. Questo confronto serve solo a decidere se aggiornare.
  • Sonnet 5.5 ha lo stesso prezzo di listino, è uscito un giorno prima ed è stato presentato anch’esso come alternativa a Opus 5.5. Arriva entro 2 punti da Opus 5.5 e supera GPT-6.1 Sol di 4-6 punti.

Lo stesso prezzo di listino non rende equivalenti i due modelli. Rispetto al punteggio ottenuto, GPT-6.1 Sol costa meno di entrambi i modelli Claude:

  • A parità di punteggio, costa da un quinto a un quarto di Sonnet 5.5: per Artificial Analysis, Sonnet 5.5 con xhigh e GPT-6.1 Sol con max ottengono entrambi 52 punti, a $2.74 contro $0.72 per task. Al livello inferiore, Sonnet 5.5 con high ottiene 47 punti a $1.08 e GPT-6.1 Sol con medium ne ottiene 48 a $0.21.
  • Nei risultati principali degli indici, il costo per task di Sonnet 5.5 è vicino a quello di Opus 5.5 ($7.60 contro $5.98 su Artificial Analysis con max, $21.34 contro $32.14 su Vals). Entrambi costano da 7 a 11 volte GPT-6.1 Sol.

Sonnet 5.5 e Opus 5.5 raggiungono però 56 e 58 punti su Artificial Analysis, punteggi che GPT-6.1 Sol non ottiene con nessuna impostazione.

Come abbiamo condotto i test?

Abbiamo eseguito tre gruppi di task, tutti valutati via codice, sulle API native dei modelli (Responses per GPT, Messages per Claude):

TestContenutoMisure
Task a risposta singola13 task con risposta nota (per esempio, un problema dello zaino con 10 elementi: trovare la combinazione migliore entro un limite di peso), ciascuno concluso da “Rispondi con un solo numero intero, senza aggiungere altro”; 3 ripetizioni per livello di effortrisposta corretta, risposta con il solo valore, costo, tempo
Documenti aziendali80 prompt che indicano solo l’obiettivo (“Scrivi la revisione regionale del Q3”) e 80 che specificano le parti richieste: revisioni trimestrali, postmortem di incidenti, confronti tra fornitori, risposte al supportopresenza di tutte le parti attese, numero di parole, costo
Tool loop4 domande che richiedono la lettura di codice in una piccola codebase sintetica, 3 tool, 3 ripetizionidomande risolte, chiamate ai tool, costo, tempo

Ogni prompt conteneva una stringa casuale univoca, così nessuna risposta poteva provenire dalla cache; i costi sono calcolati ai prezzi di listino. I dati dei task a risposta singola e dei tool loop per Sonnet 5.5 e Opus 5.5 provengono dalle nostre misurazioni di Sonnet 5.5 del giorno precedente, sugli stessi task e con gli stessi criteri di valutazione. Consideriamo significativa una differenza solo se resiste alla correzione di Holm, che rende più rigorosa la soglia quando si testano più confronti; per le risposte con il solo valore, contiamo i risultati per task, perché le ripetizioni dello stesso task non sono indipendenti.

GPT-6.1 Sol costa meno di Sonnet 5.5 per task?

GPT-6.1 Sol è costato circa la metà: con le impostazioni API predefinite dei rispettivi modelli, $0.0020 per task a risposta singola contro $0.0042 di Sonnet 5.5, un rapporto di 0.49 (intervallo al 95% da 0.40 a 0.59, ottenuto ricampionando i 13 task). Sonnet 5.5 ha generato da 1.7 a 2.5 volte i token in output con le impostazioni inferiori a max, e 3.1 volte con max. Opus 5.5, con un prezzo di listino doppio, è costato $0.0070 con le impostazioni predefinite: GPT-6.1 Sol è quindi costato 0.29x.

Il rapporto è rimasto simile a ogni livello di effort: GPT-6.1 Sol è costato da 0.33x a 0.58x rispetto a Sonnet 5.5 e da 0.20x a 0.31x rispetto a Opus 5.5. Se non si specifica l’effort, GPT-6.1 Sol e Opus 5.5 usano medium, Sonnet 5.5 usa high. Gli altri due test hanno dato lo stesso rapporto di 0.46x rispetto a Sonnet 5.5: $0.0103 contro $0.0223 per documento aziendale con il solo obiettivo e $0.0052 contro $0.0112 per esecuzione del tool loop.

Grafico a barre raggruppate del costo per 1,000 task a risposta singola, per livello di effort, di GPT-6.1 Sol, Claude Sonnet 5.5 e Claude Opus 5.5. Con le impostazioni predefinite: $2.0, $4.1 e $7.0. Con max: $4.7, $14.6 e $23.4. GPT-6.1 Sol ha il costo più basso a ogni livello. Le risposte con il solo valore sono 39 su 39 a ogni livello per GPT-6.1 Sol e Opus 5.5, e da 12 a 39 su 39 per Sonnet 5.5

L’effort si imposta con un solo campo nella richiesta; i token fatturati vengono restituiti in usage:

from openai import OpenAI

client = OpenAI()
resp = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "low"},  # low, medium (default), high, xhigh, max; "none" is not listed for 6.1
    input="Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else.",
)
print(resp.output_text)
u = resp.usage
print(u.output_tokens, u.output_tokens_details.reasoning_tokens, u.input_tokens_details.cached_tokens)

output_tokens include i token di ragionamento; cached_tokens indica la parte dell’input fatturata a $0.10 per milione.

Quale rispetta il formato “solo la risposta” e quale risponde correttamente?

GPT-6.1 Sol ha rispettato il formato in ogni prompt, mentre Sonnet 5.5 non ha commesso errori nel task che GPT-6.1 Sol ha sbagliato più volte. GPT-6.1 Sol ha restituito il solo valore in tutti i 234 prompt, come Opus 5.5. Sonnet 5.5 lo ha fatto in 22 casi su 39 con le impostazioni predefinite, 12 con low, 24 con medium e 30 con high; sotto xhigh a volte omette il blocco di ragionamento, la parte separata della risposta di Claude, e inserisce i passaggi di calcolo nella risposta, come descritto nel nostro articolo su Sonnet 5.5. Contando per task, la differenza resiste alla correzione con low (GPT-6.1 Sol migliore in 9 task su 13, peggiore in nessuno), ma non con le impostazioni predefinite (6 e nessuno). Il codice che si aspetta un solo valore può leggere direttamente la risposta di GPT-6.1 Sol; con Sonnet 5.5 conviene prendere l’ultima riga oppure usare xhigh.

Sonnet 5.5 ha risposto correttamente a tutte le 234 chiamate e Opus 5.5 ne ha sbagliate 2. GPT-6.1 Sol ha risposto 72 al problema dello zaino in 7 chiamate su 18 (il valore corretto, verificato provando tutti i sottoinsiemi, è 62): tre su tre con low, una su tre con le impostazioni predefinite e con medium, due su tre con xhigh, nessuna con high o max. Un task su 13 non basta a dimostrare una differenza di accuratezza, ma mostra che l’errore non è evidente: la risposta è un intero nel formato richiesto e aumentare l’effort non lo ha evitato in modo affidabile.

GPT-6.1 Sol ha risolto il problema delle risposte brevi di GPT-6 Sol?

GPT-6.1 Sol è tornato a scrivere risposte complete. Nei prompt che indicano solo il documento da produrre, senza specificarne le parti, ha scritto 565 parole per documento contro le 325 di GPT-6 Sol. È stato più lungo in tutti gli 80 casi e vicino alle 592 parole di GPT-5.6 Sol. Non abbiamo invece riprodotto il problema dei contenuti mancanti segnalato per GPT-6 Sol: era completo (ogni regione, ogni evento dell’incidente, una risposta per ogni ticket) in 58 documenti valutati su 60, come GPT-5.6 Sol (i 20 confronti tra fornitori non sono valutati, perché scegliere il fornitore giusto richiede un giudizio soggettivo).

Quando il prompt specificava le parti richieste, tutti e tre i modelli OpenAI sono stati completi in 80 casi su 80. Sonnet 5.5 ha scritto i documenti più lunghi nei prompt con il solo obiettivo (747 parole) ed è stato completo in tutti quelli valutati, ma ha mancato 12 casi su 80 con parti specificate: erano tutti memo o raccomandazioni da 1 a 28 parole sotto l’intervallo richiesto. La differenza resiste alla correzione, ma 10 dei 12 casi sono revisioni trimestrali, quindi dice poco sugli altri tipi di documento.

Le risposte più lunghe hanno portato il costo per documento con il solo obiettivo da $0.0078 con GPT-6 Sol a $0.0103. Resta il 59% sotto GPT-5.6 Sol, che ha un prezzo di listino di $4 / $20 (prezzo promozionale fino al 2026-11-21); ricalcolando i token di GPT-5.6 Sol a $2 / $10, GPT-6.1 Sol costa il 19% in meno perché usa meno token per produrre testi della stessa lunghezza.

GPT-6.1 Sol è più lento?

GPT-6.1 Sol è più lento dei suoi predecessori e di Sonnet 5.5, soprattutto quando l’output è lungo. Nei documenti aziendali ha generato circa 43 token in output per secondo di durata complessiva della richiesta, contro 100 di GPT-6 Sol, 80 di GPT-5.6 Sol e 127 di Sonnet 5.5; il tempo mediano per un documento con il solo obiettivo è stato 22.4 secondi, contro 7.2, 13.9 e 17.2. Nei brevi task a risposta singola la differenza è minore: 5.7 secondi con le impostazioni predefinite, contro 3.9 di Sonnet 5.5 e 5.5 di Opus 5.5. Le velocità assolute dipendono dall’host e dall’ora; anche Artificial Analysis lo misura a meno della metà della velocità di Sonnet 5.5, 64 token al secondo contro 139.

Cosa succede in un tool loop?

GPT-6.1 Sol e Sonnet 5.5 hanno risolto tutte le 12 esecuzioni a ogni livello di effort; GPT-6.1 Sol è costato meno della metà, ma ha impiegato quasi il doppio del tempo. In un tool loop il modello richiede un tool, il codice chiamante lo esegue e restituisce il risultato; il ciclo continua finché il modello non risponde. Il nostro usa tre tool (elenco dei file, lettura di un file, ricerca) su una piccola codebase sintetica. Con le impostazioni predefinite, un’esecuzione è costata $0.0052 con GPT-6.1 Sol, $0.0112 con Sonnet 5.5 e $0.0332 con Opus 5.5, con tempi mediani di 12.2, 6.7 e 25.3 secondi. Con max, GPT-6.1 Sol è salito a $0.0086 e Sonnet 5.5 a $0.0422, con 6.4 e 14.7 chiamate ai tool per esecuzione.

I nostri risultati coincidono con gli altri test pubblicati?

I nostri risultati concordano con quelli pubblicati sulla direzione delle differenze. Le dimensioni degli scarti cambiano perché i nostri task sono brevi e usano per lo più le impostazioni API predefinite, mentre gli indici pubblici eseguono task lunghi con max.

DomandaRisultati pubblicati altroveNostra misurazioneEsito
Costo di GPT-6.1 Sol rispetto a Sonnet 5.5Artificial Analysis: $0.72 contro $7.60 per task dell’indice con max, circa 11x0.49x con le impostazioni predefinite, 0.33x con maxStessa direzione; con max lo scarto cresce sui task più lunghi: 0.33x nei task a risposta singola, 0.20x nel nostro tool loop, 0.09x nell’indice
VelocitàArtificial Analysis: 64 contro 139 token in output al secondo; Vals AI: i task agentici durano da 2 a 3 volte più che con GPT-6 Sol43 contro 127 token al secondo; 22.4 s per documento contro 7.2 s di GPT-6 SolConcorda
Qualità rispetto a Sonnet 5.5Artificial Analysis 52 contro 56; Vals 61.2% contro 67.0%Sonnet 5.5 corretto in 234 casi su 234; GPT-6.1 Sol ha sbagliato un task 7 volte su 18Stessa direzione; il nostro risultato dipende da un solo task
Risposte di GPT-6 Sol troppo brevi o con contenuti mancantiSegnalazioni degli sviluppatori, per esempio nel thread di lancio su Hacker News325 parole per documento contro 592 di GPT-5.6 Sol; completo in 58 casi su 60, come GPT-5.6 SolLa brevità è confermata; non abbiamo riprodotto i contenuti mancanti
Sonnet 5.5 non rispetta “solo la risposta”Nessuna segnalazione pubblicata trovata22 risposte con il solo valore su 39 con le impostazioni predefinite, 12 su 39 con lowSolo nei nostri test

Cosa abbiamo osservato e quale modello conviene usare?

GPT-6.1 Sol offre un rapporto qualità-costo migliore sia di Sonnet 5.5 sia di Opus 5.5; Sonnet 5.5 vale il costo aggiuntivo se contano la latenza o gli ultimi 4-6 punti di qualità. La conclusione si basa su quattro osservazioni:

  1. GPT-6.1 Sol costa meno di entrambi i modelli Claude in rapporto alla qualità ottenuta. Rispetto a Sonnet 5.5 costa circa la metà per task breve, circa un quarto a parità di punteggio nell’indice e da un settimo a un decimo nei risultati principali degli indici. Rispetto a Opus 5.5 costa 0.29x per task breve e da un ottavo a un decimo sugli indici.
  2. Rispetta meglio il formato di output. Ha restituito quanto richiesto in ogni prompt che chiedeva solo la risposta e in ogni documento con parti specificate.
  3. La correzione delle risposte brevi ha ridotto la velocità. Le risposte sono tornate alla lunghezza di quelle di GPT-5.6 Sol, ma ogni documento richiede tre volte il tempo necessario con GPT-6 Sol.
  4. I suoi errori sono difficili da individuare. Le 7 risposte errate sono arrivate con low, medium e xhigh, e ognuna era un intero nel formato richiesto.
Carico di lavoroSceltaDati
Output letto dal codice: estrazione, classificazione, valori singoliGPT-6.1 Sol con medium o highrisposta con il solo valore in 234 casi su 234; $0.0021 per task con medium
Calcoli o problemi logici a più passaggi in cui un valore errato costa caroSonnet 5.5, oppure GPT-6.1 Sol con verifica del risultatoSonnet 5.5 corretto in 234 casi su 234; GPT-6.1 Sol errato in 7 chiamate su 18 per un task
Chat e tool interattivi, quando conta la latenzaSonnet 5.5 con le impostazioni predefinite3.9 s contro 5.7 s per task breve; 17.2 s contro 22.4 s per documento
Loop agentici in cui il costo per esecuzione conta più della latenzaGPT-6.1 Sol con le impostazioni predefinite$0.0052 per esecuzione contro $0.0112; 12.2 s contro 6.7 s
Documenti con sezioni obbligatorieGPT-6.1 Sol, oppure Sonnet 5.5 indicando intervalli di lunghezza ampicompleti in 80 casi su 80 contro 68 su 80; i casi mancati erano da 1 a 28 parole sotto il minimo
Task difficili e aperti in cui conta il punteggio massimoSonnet 5.5 o Opus 5.5 con maxpunteggi negli indici pubblici di 56 e 58 contro 52, a un costo per task da 7 a 11 volte superiore

Con entrambi i modelli, verificate ogni valore su cui un programma deve agire.

FAQ

GPT-6.1 Sol costa meno di Claude Sonnet 5.5? GPT-6.1 Sol costa meno per task di Sonnet 5.5 nonostante lo stesso prezzo di listino di $2 / $10: nei nostri test 0.49x per task a risposta singola con le impostazioni predefinite di ciascun modello e 0.46x per esecuzione del tool loop; a parità di punteggio di 52 su Artificial Analysis, $0.72 contro $2.74. Sonnet 5.5 è stato più veloce e ottiene un punteggio più alto con max.

GPT-6.1 Sol è all’altezza di Claude Opus 5.5? GPT-6.1 Sol ottiene circa 6 punti meno di Opus 5.5 sia nell’Intelligence Index di Artificial Analysis (52 contro 58) sia nel Vals Index (61.2% contro 67.0%), a un costo per task da un ottavo a un decimo; nei nostri test è costato 0.29x per task breve. Nei test condotti da OpenAI risulta 2.2 punti avanti su AutomationBench.

Posso ancora disattivare il ragionamento su GPT-6.1 Sol? GPT-6.1 Sol indica low come effort minimo; none, accettato da GPT-6 Sol, non è più disponibile. Usate low, che nei nostri test è costato $0.0018 per task a risposta singola.

Altre misurazioni: Claude Sonnet 5.5 vs Sonnet 5, i livelli di effort di GPT-6 Astra e come ridurre i costi di GPT-5.6.

Misurazioni effettuate il 2026-09-30, un giorno dopo il rilascio di GPT-6.1 Sol, tramite un gateway verso la OpenAI Responses API e la Anthropic Messages API: 234 chiamate a risposta singola con GPT-6.1 Sol (13 task, 3 ripetizioni, 6 impostazioni), 800 chiamate per documenti aziendali (80 casi con il solo obiettivo su 6 combinazioni di modello ed effort, 80 casi con parti specificate su 4) e 36 esecuzioni del tool loop. I dati dei task a risposta singola e dei tool loop di Sonnet 5.5 e Opus 5.5 risalgono al 2026-09-29 e riguardano gli stessi task. I risultati dei benchmark pubblici sono stati letti dalle pagine degli enti che li pubblicano il 2026-10-01.

← Torna al blog