Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

GPT-6 Astra: max costa 2.3x low, con le stesse risposte

Indice
  1. Come si posiziona GPT-6 Astra nei benchmark?
  2. Quali valori di reasoning_effort accetta GPT-6 Astra?
  3. none disattiva il ragionamento? E disabled?
  4. Cosa offre max rispetto a low?
  5. GPT-6 Astra costa 2.5x GPT-5.6 Sol per risposta?
  6. Uno schema JSON o una tool call aumentano il costo del ragionamento?
  7. Puoi leggere il ragionamento che paghi?
  8. Cosa resta invariato rispetto a GPT-5.6?
  9. Come lo gestisce Synthorai
  10. FAQ

Su GPT-6 Astra, reasoning_effort: "max" costa 2.3x rispetto a low e restituisce la stessa risposta in tutti gli 11 task verificati. L’unica impostazione che cambia l’accuratezza è none, che fallisce 17 run su 33 (11 task, 3 run ciascuno). reasoning_effort è il parametro della richiesta che stabilisce quanto ragionamento nascosto esegue il modello prima di rispondere. Questo lavoro viene fatturato come reasoning token alla tariffa di output. I valori ordinati da none a max formano la scala misurata in questo articolo. La scala non coincide con quella documentata: la validazione dell’input dell’API indica sette valori, ma uno (minimal) viene rifiutato da tutti i modelli. Un altro (disabled) non compare nell’elenco, ma Astra lo accetta senza disabilitare nulla. Questo dettaglio cambia il modo in cui vanno letti i benchmark di lancio di OpenAI, pubblicati come “il massimo ottenuto con qualsiasi livello di effort”: il risultato in classifica arriva dal gradino più costoso della scala.

TL;DR

  • GPT-6 Astra accetta sette valori di reasoning_effort, inclusi none e disabled; la documentazione ne elenca cinque e dichiara che none non è supportato.
  • none è l’unico valore che azzera i reasoning token e fallisce 17 task verificati su 33; tutti gli altri livelli ottengono 33 su 33.
  • disabled usa 243 reasoning token contro i 151 di low e costa il 54% in più per risposta corretta, a parità di accuratezza.
  • Ai prezzi di listino, GPT-6 Astra costa 1.57x GPT-5.6 Sol per risposta corretta con low e 2.57x con max, su task risolti correttamente da entrambi.

Come si posiziona GPT-6 Astra nei benchmark?

È avanti nei task in stile agent, in cui il modello usa strumenti in un ciclo, spesso da terminale. Rimane dietro Claude Fable 5.1 in Humanity’s Last Exam e nell’Artificial Analysis Intelligence Index, un aggregato indipendente di dieci valutazioni. Ogni risultato è riportato al livello di effort con il punteggio più alto. La tabella seguente viene dalla pagina di lancio di OpenAI e usa le colonne di confronto scelte da OpenAI:

BenchmarkCosa valutaGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5
Terminal-Bench 4.0task agent eseguiti in un terminale57.9%37.3%55.8%52.6%
Terminal-Bench Science 0.1workflow di ricerca con codice64.6%22.4%52.6%30.0%
FrontierMath Tier 4 (v2)matematica a livello di ricerca97.6%83.0%87.8%73.2%
ARC-AGI-3risoluzione di nuovi ambienti a puzzle99.9%7.8%non indicato30.2%
Humanity’s Last Exam, with toolsdomande multidisciplinari scritte da esperti57.2%non indicato65.0%63.6%
Artificial Analysis Intelligence Index v4.1.1aggregato di dieci valutazioni61.260.965.763.1

Tre aspetti da considerare insieme ai risultati migliori:

  • La riga di Humanity’s Last Exam, dove Astra è indietro di 7.8 punti rispetto a Fable 5.1, compare nella tabella ma non viene citata nel testo.
  • Nella riga di Artificial Analysis, Astra è dietro Claude Fable 5.1, Claude Opus 5 e Claude Fable 5 nella tabella della stessa OpenAI; nell’attuale classifica v4.2, Fable 5.1 è primo con 57 e Astra terzo con 55.
  • I punteggi di cybersecurity sono stati ottenuti, secondo OpenAI, “senza le protezioni di produzione”; il modello distribuito “rifiuterà” i task che richiedono exploit proof of concept.

La frase sotto le tabelle collega direttamente i benchmark alla fattura: “I punteggi delle valutazioni sono il massimo ottenuto con qualsiasi livello di effort”. La classifica di Artificial Analysis elenca ogni modello una volta per ciascuna impostazione di effort. Astra ottiene 54 con xhigh e 55 con max. Il resto dell’articolo quantifica il costo di quel punto.

Quali valori di reasoning_effort accetta GPT-6 Astra?

Sette, ma non sono quelli dichiarati dall’API: un valore pubblicizzato viene rifiutato da tutti i modelli, mentre un valore accettato non compare da nessuna parte. La pagina del modello elenca low, medium, high, xhigh e max e afferma che il modello “non supporta il livello di ragionamento none”. L’API contraddice due volte la documentazione e una volta se stessa.

Inviando un valore non valido, il primo controllo, che verifica la struttura della richiesta prima di coinvolgere un modello, restituisce lo stesso elenco di valori consentiti su GPT-6 Astra e GPT-5.6 Sol:

Invalid value: '__invalid__'. Supported values are: 'none', 'minimal', 'low', 'medium', 'high', 'xhigh', and 'max'.

Inviando poi ciascuno di questi valori, un secondo controllo specifico del modello rifiuta parte di ciò che il primo aveva dichiarato valido (200 indica che la richiesta è stata elaborata, 400 che è stata rifiutata):

ValoreNell’elenco dichiaratoGPT-6 AstraGPT-5.6 Sol
none200200
minimal400, “non supportato dal modello ‘gpt-6-astra-2026-09-03‘“400, stesso errore
disabledno200400
da low a max200200

Quindi none funziona nonostante la documentazione sostenga il contrario, minimal viene dichiarato valido ma rifiutato ovunque e disabled viene accettato soltanto da Astra senza comparire in alcun elenco. I messaggi di errore rivelano anche la build datata a cui punta attualmente l’alias gpt-6-astra, cioè gpt-6-astra-2026-09-03.

none disattiva il ragionamento? E disabled?

none sì, ed è l’unico valore che lo fa. disabled è un normale livello della scala con un nome fuorviante. Abbiamo usato 11 task le cui risposte erano state calcolate in anticipo tramite ricerca esaustiva sulla nostra macchina, eliminando il rischio di una chiave di risposta errata: una regola applicata 40 volte di seguito, un problema di conteggio con tre vincoli, un knapsack, una conversione di base, 7 elevato alla 222 modulo 1000 e altri sei task più brevi. Li abbiamo eseguiti con tutti e sette i livelli di effort, sei su Sol che rifiuta disabled, per 3 run per task e livello, tramite un endpoint compatibile con l’API OpenAI Chat Completions. Questi sono i cinque task più difficili su GPT-6 Astra:

effortaccuratezzareasoning token medicosto per chiamatacosto per risposta corretta
none20% (3 su 15)0$0.00086$0.0043
disabled100%243$0.01311$0.0131
low100%151$0.00851$0.0085
medium100%159$0.00890$0.0089
high100%203$0.01110$0.0111
xhigh100%279$0.01491$0.0149
max100%370$0.01946$0.0195

Il costo per risposta corretta è la spesa di una combinazione task-effort divisa per il numero di run corretti: con un’impostazione accurata al 20%, servono cinque run a pagamento per ottenere una risposta corretta. Il salto avviene in un solo gradino. Tutti i livelli da low in su hanno ottenuto 33 risultati corretti su 33 nei complessivi 11 task su entrambi i modelli. none ne ha ottenuti 16 su 33 con Astra e 21 su 33 con Sol. Nel task della mappa iterata, Astra ha restituito tre numeri errati diversi in tre run. Non c’è un degrado graduale su cui fare tuning: o il ragionamento è attivo, oppure il modello tira a indovinare.

disabled è la trappola. Usa più reasoning token di low, medium e high e costa il 54% in più di low per risposta corretta, con la stessa accuratezza del 100%. Soltanto xhigh e max costano più per risposta corretta del valore il cui nome indica che il ragionamento dovrebbe essere disattivato.

Grafico a barre dei reasoning token per chiamata di GPT-6 Astra con sette valori di reasoning_effort su cinque task multi-step: none usa 0 token ed è corretto nel 20% dei casi, disabled usa 243 token ed è indicato come trappola con un costo superiore del 54% rispetto a low, low usa 151 token ed è indicato come livello minimo, medium 159, high 203, xhigh 279, max 370 e costa 2.3x low con le stesse risposte; tutti i livelli da low in su raggiungono il 100% di accuratezza

Cosa offre max rispetto a low?

Su questi task, nulla, ma costa 2.3x: $0.01946 per chiamata contro $0.00851, entrambi con accuratezza del 100%. I reasoning token salgono da 151 con low a 370 con max e vengono tutti fatturati alla tariffa di output di $50 per milione.

Questo dato va letto insieme alla tabella dei benchmark. Dichiarare “il massimo ottenuto con qualsiasi livello di effort” significa che ogni punteggio viene preso dal livello con il risultato migliore. Nella classifica indipendente, il risultato migliore di Astra è quello di max, superiore di un punto a xhigh; nelle nostre misure, quel livello costa 1.3x quello immediatamente precedente. Su un workload simile ai benchmark di lancio, l’effort aggiuntivo potrebbe giustificare il costo. Su un workload simile al nostro, non lo fa. Per capire in quale caso rientra il proprio workload, bisogna partire misurando i task con low.

GPT-6 Astra costa 2.5x GPT-5.6 Sol per risposta?

Con low, no: 1.57x. Con max, sì: 2.57x. Il prezzo di listino è il costo per token pubblicato dal vendor: Astra costa $10 per l’input e $50 per l’output per milione di token, mentre Sol costa $4 e $20. I dati provengono dalle pagine OpenAI dei modelli Astra e Sol, consultate il 2026-09-07. Il divario di listino è quindi 2.5x sia per l’input sia per l’output; la [pagina di confronto tra GPT-5.6 Sol e GPT-6 Astra](/compare/models/gpt-5-6-sol-vs-gpt-6-astra/) riporta i prezzi aggiornati del catalogo. Il costo per risposta corretta è stato calcolato usando i conteggi dei token e questi prezzi di listino su tutti gli 11 task. Entrambi i modelli hanno ottenuto 33 risultati corretti su 33 da low in su:

effortGPT-6 Astra per risposta correttaGPT-5.6 Sol per risposta correttarapporto
low$0.00560$0.003561.57x
medium$0.00618$0.003731.66x
high$0.00741$0.004001.85x
xhigh$0.01005$0.004432.27x
max$0.01349$0.005252.57x

Ai livelli più bassi, Astra usa meno reasoning token di Sol per arrivare alla stessa risposta: con low, 91 contro 158 per chiamata sui complessivi 11 task. È qui che il divario si riduce. Salendo di livello, il ragionamento di Astra cresce più rapidamente: con max, 249 token contro 242. A quel punto, la differenza per risposta coincide con l’intero divario dei prezzi di listino.

La conclusione è circoscritta: entrambi i modelli raggiungono il 100% da low in su, quindi questo set non distingue le loro capacità. Misura soltanto il prezzo di una risposta che entrambi producono correttamente, con un rapporto che varia da 1.6x a 2.6x in base a un singolo parametro. La pagina di lancio di OpenAI riporta il risultato opposto sui task agent: in Terminal-Bench 4.0, Astra avrebbe un “costo API stimato per task inferiore di circa il 9% e il 63%” rispetto a Sol e Fable 5.1. Un modello che risolve più task usando meno token può costare meno nonostante il prezzo per token più alto. I workload sono diversi, ma in entrambi i casi l’impostazione di effort determina il costo.

Uno schema JSON o una tool call aumentano il costo del ragionamento?

Non con low; con medium sì. Abbiamo inviato un task a passaggio singolo, aggiungere 2 ore e 37 minuti alle 08:15, in tre forme: senza wrapper, dentro uno schema JSON response_format strict, dove la risposta deve rispettare la struttura fornita, e come tool call forzata, con tool_choice vincolato a una funzione e quindi con l’obbligo per il modello di rispondere chiamandola. Il test ha coperto quattro livelli di effort, con 3 run ciascuno. Per GPT-6 Astra, la tabella riporta i reasoning token medi, la loro quota sul totale dei token di output fatturati e il costo per chiamata:

formatononelowmediumhigh
senza wrapper0, $0.000850, $0.0008418 (67% dell’output), $0.0018524 (73%), $0.00217
schema JSON0, $0.001414 (23%), $0.0016521 (57%), $0.0025726 (62%), $0.00282
tool call forzata0, $0.001960, $0.001975 (18%), $0.0022320 (47%), $0.00307

Grafico a barre raggruppate dei reasoning token di GPT-6 Astra su un task banale inviato senza wrapper, dentro uno schema JSON e come tool call forzata, con effort none, low, medium e high: zero token con none e low in ogni formato, tranne 4 token per lo schema con low; da 18 a 26 token con medium e high, con il ragionamento che arriva al 57-73% dei token di output

low può scendere fino a zero: su un task senza passaggi non usa reasoning token e costa quanto none; nel set multi-step precedente usa da 16 a 345 token per task e rimane corretto dove none crolla. Per questo low è il livello minimo utile. Il costo non dipende dal wrapper: con low, uno schema o una tool call aggiungono da 0 a 4 reasoning token. Con medium, invece, il ragionamento rappresenta dal 57 al 67% dei token di output senza wrapper e nello schema, e il 18% nella tool call, nonostante il task non richieda alcun ragionamento. Dentro lo schema, la stessa estrazione costa 1.6x con medium rispetto a low; senza wrapper costa 2.2x. La guida ai costi di GPT-5.6 pubblicata a luglio aveva rilevato lo stesso effetto su quella famiglia. Sol ha un andamento più piatto: 0 reasoning token senza wrapper e nello schema a ogni livello di effort, e da 14 a 18 token nella tool call forzata da medium in su.

Puoi leggere il ragionamento che paghi?

Su una delle due interfacce API di OpenAI. Il vecchio endpoint Chat Completions e il più recente endpoint Responses accettano lo stesso modello e applicano la stessa fatturazione. Abbiamo inviato la stessa domanda con medium, per 3 run su ciascuna interfaccia:

Interfacciareasoning token fatturatitesto del ragionamento restituito
/v1/chat/completions76, 75, 120nessuno; il messaggio contiene soltanto role e content
/v1/responses con reasoning.summary: "auto"62, 62, 116un elemento reasoning con un riepilogo da 277 a 352 caratteri

I conteggi dei token rientrano nella normale variabilità, quindi la fatturazione è la stessa. Cambia soltanto la possibilità di vedere ciò che si è pagato. Con un costo di $50 per milione di token di output, è l’endpoint a determinarlo. La documentazione indirizza anche il tool calling verso Responses (“GPT-6 Astra supporta Chat Completions, ma il tool calling richiede Responses”), quindi un workload che usa strumenti deve necessariamente passare dall’interfaccia che rende visibile il ragionamento.

Cosa resta invariato rispetto a GPT-5.6?

Quasi tutto il contratto. Risultati misurati:

  • Tokenizer. Lo stesso testo di 900 parole è stato tokenizzato in 1,017 prompt token su GPT-6 Astra, GPT-5.6 Sol, GPT-5.6 Luna, GPT-5.5, GPT-5.4 e GPT-5.2. Le dimensioni dei prompt misurate sui modelli 5.x restano valide su Astra; non serve ricalcolarle.
  • Parametri. temperature restituisce 400 sia su Astra sia su Sol (“non supportato da questo modello”), come top_p e logprobs; response_format con uno schema JSON strict produce su entrambi un output valido rispetto allo schema; max_tokens inferiore a 16 viene rifiutato da entrambi.
  • max su Sol. A luglio, reasoning_effort: "max" restituiva 400 su GPT-5.6 Sol tramite Chat Completions. Ora viene accettato e Sol ha ottenuto 33 risultati corretti su 33 con questa impostazione.

Dati tratti dalla documentazione e non misurati qui: la finestra di contesto è di 1,050,000 token, con un input massimo di 922,000 e un output massimo di 128,000; i prompt oltre 272K token di input vengono fatturati al doppio della tariffa di input e cache, la stessa soglia usata dalla famiglia GPT-5.6 e lo stesso meccanismo che abbiamo misurato tra diversi vendor; le letture dalla cache costano $1 per milione e le scritture $12.50, con il nuovo parametro prompt_cache_options.ttl: "30m" che sostituisce prompt_cache_retention. Fast mode, un’opzione a pagamento che secondo OpenAI offre fino a 2x la velocità, costa 2x rispetto alla modalità standard.

Come lo gestisce Synthorai

Il gateway inoltra reasoning_effort senza modificarlo, inclusi i valori non elencati nella documentazione. Nel record di utilizzo di ogni richiesta, reasoning_tokens rimane un campo separato accanto a completion_tokens e al costo fatturato. Tutte le tabelle precedenti sono state costruite da questi dati: il livello di effort inviato con la richiesta, il ragionamento consumato e il relativo costo. Ogni informazione è disponibile per singola richiesta, senza doverla ricostruire da un totale mensile.

FAQ

GPT-6 Astra supporta reasoning_effort none?

Sì. La documentazione dice di no, ma l’API lo accetta sia su GPT-6 Astra sia su GPT-5.6 Sol. È l’unico valore che restituisce zero reasoning token. Ha però fallito 17 run su 33 in un set di task verificati, quindi è adatto a lookup e trasformazioni, non a operazioni che richiedono più passaggi.

Cosa fa reasoning_effort disabled su GPT-6 Astra?

Ragiona. disabled viene accettato su GPT-6 Astra e rifiutato su GPT-5.6 Sol. Non compare in alcun elenco documentato o dichiarato e, nel nostro set difficile, ha usato 243 reasoning token per chiamata contro i 151 di low, con la stessa accuratezza. Va trattato come un alias costoso per un livello intermedio, non come un interruttore per disattivare il ragionamento.

Quale reasoning_effort conviene usare come default su GPT-6 Astra?

low. Su GPT-6 Astra non ha usato reasoning token nel task a passaggio singolo e ne ha usati da 16 a 345 per task in quelli multi-step. Ha ottenuto 33 risultati corretti su 33 contro i 16 di none, mentre max è costato 2.3x per produrre le stesse risposte. Aumenta il livello per uno specifico call site soltanto quando una valutazione sui tuoi task dimostra che un livello superiore cambia i risultati. Impostalo esplicitamente in ogni chiamata e leggi il conteggio del ragionamento dal blocco di utilizzo:

resp = client.chat.completions.create(
    model="gpt-6-astra",
    reasoning_effort="low",
    messages=[{"role": "user", "content": prompt}],
)
print(resp.usage.completion_tokens_details.reasoning_tokens)

Misurazioni eseguite il 2026-09-07 tramite un’interfaccia Chat Completions compatibile con OpenAI, più l’endpoint Responses per confrontare la visibilità del ragionamento: 11 task con chiavi di risposta calcolate localmente tramite forza bruta, 7 valori di effort, 3 run per combinazione su entrambi i modelli, prompt saltati con un suffisso univoco per richiesta in modo che nessuna risposta provenisse dalla cache, costi ricavati dalla contabilità di utilizzo per richiesta. I dati dei benchmark provengono dalla tabella di lancio di OpenAI e dalla classifica di Artificial Analysis, entrambe consultate lo stesso giorno. Il costo per risposta corretta rispetto a GPT-5.6 Sol è calcolato dai conteggi dei token usando il prezzo di listino documentato di ciascun modello.

Correlati: controlli del ragionamento su 13 modelli, guida ai costi di GPT-5.6, costo di Claude Opus 5, fasce di prezzo per contesti lunghi, costo di scrittura della prompt cache.

← Torna al blog