Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

GPT-5.6 Luna

Rilasciato 2026-07-09

chatVisioneCodiceChiamata di strumentiRagionamentoCaching dei prompt

GPT-5.6 Luna è il membro più veloce ed economico della famiglia GPT-5.6 di OpenAI, descritto sulla sua pagina del modello come progettato per carichi di lavoro ad alto volume e sensibili ai costi come sintesi, stesura di bozze e automazione di routine.

Input
testo immagine $1/M
Output
testo $6/M
Lettura cache
$0.1/M
Contesto
1.1M
vs GPT-4o
~80% più economico
Cutoff di conoscenza
2026-02

Benchmark

Sopra la media15 / 42
GPT-5.6 Luna altri modelli misurati media dei modelli confrontati nessun altro modello ha fatto meglio
SWE-Bench Pro
62.7%
GeneBench Pro
10.8%
OSWorld 2.0
45.6%
ExploitBench (Cap%)
33.2%
HealthBench
55.8%
GDPval-AA v2 Elo · 642-1861
1591.8
GPQA Diamond
92.3%
BrowseComp
83.3%
GDP.pdf no tools
22.7%

Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Il prezzo nel contesto

Posizione del prezzo tra 60 modelli comparabili

Input$1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$6/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.1/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 1.050.000
Output massimo (specifica del vendor) 128.000
Cutoff di conoscenza 2026-02

Caching prompt

Modalità automatico
Prefisso min. 1.024
Durata 5-10 min, fino a 1 ora

Ragionamento

Parametro del fornitore reasoning.effort
Valori accettati none · low · medium · high · xhigh · max
Valore predefinito medium applicato se la richiesta non specifica nulla
Disattivabile
Comportamento del ragionamento La Responses API accetta anche reasoning.mode, con valore standard (il predefinito) o pro; mode ed effort sono manopole indipendenti.
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo + immagine → testo
  • Il livello GPT-5.6 più veloce ed economico, progettato per carichi di lavoro ad alto volume sensibili al costo (successore del livello nano)
  • mantiene l'intero contesto da 1,05M della famiglia / 128k di output massimo
  • input in cache al 10% del listino con scritture in cache a 1,25x
  • i prompt oltre i 272k token in input sono fatturati a 2x in input / 1,5x in output

fonte: documentazione ufficiale OpenAI ↗

Un solo prompt, misurato attraverso il gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICA esattamente 3 frasi

GPT-5.6 Luna superato · 3 sentences

Enabling reasoning causes the model to use substantially more computational steps and generated tokens per request, even when the visible answer is similar. Because our provider charges based largely on token consumption and compute, that increased processing translated into roughly twice the cost. We can control the expense by reserving reasoning for complex tasks, setting token and effort limits, and monitoring cost per successful outcome.

out 146 tok (+60 ragionamento) latenza 3.1 s

Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICA la correzione supera i test

GPT-5.6 Luna superato · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: best = max(best, cur) cur = 1 return max(best, cur) ``` The bug is that `cur` counts equal *transitions* rather than the number of items in the current run, so a single-element run returns `0` and a run of length `n` returns `n - 1`; additionally, `best` is only updated when a run is interrupted, so a run continuing through the final element is not finalized before returning. Initializing the current run to one item, resetting it to one after a change, and taking a final `max` fixes both issues.

out 356 tok (+161 ragionamento) latenza 4.7 s

Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICA JSON valido, schema esatto

GPT-5.6 Luna superato · 5/5 fields, guidance "Withheld pending the Q4 close"

{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":null,"guidance":"Withheld pending the Q4 close"}

out 227 tok (+181 ragionamento) latenza 3.6 s

Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICA 120 parole, 0 parole vietate

GPT-5.6 Luna superato · 120 words, 0 banned, 1 question

Introducing PromptCache, an API gateway feature that caches prompts across providers, helping teams reduce latency, control spend, and deliver consistent results. How much faster could your applications respond when repeated prompts are served from a shared cache instead of being sent upstream? PromptCache supports provider-aware routing, configurable time-to-live policies, encrypted storage, cache invalidation, and usage analytics through one operational layer. It works with language-model providers while preserving your authentication, observability, and fallback workflows. Developers can enable caching by endpoint, model, tenant, or prompt pattern, then monitor hit rates and savings in real time. Built for production workloads, PromptCache gives platform teams controls for performance and cost without requiring application rewrites. […]

out 948 tok (+778 ragionamento) latenza 8.0 s

Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.

Usa GPT-5.6 Luna in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gpt-5.6-luna",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Informazioni su GPT-5.6 Luna

  • La guida alla scelta del modello di OpenAI indica Luna per il lavoro efficiente ad alto volume, Terra per prestazioni solide a un prezzo più basso e Sol quando serve la capacità flagship.
  • Mantiene l'intera finestra di contesto da 1.050.000 token della famiglia (specifica del vendor) e i 128K token di output massimo, accetta input di immagini, supporta i token di ragionamento e raggiunge il set di strumenti hosted comprensivo di ricerca web, ricerca file, code interpreter, computer use, shell hosted, apply patch, skill, tool search e MCP, con un cutoff di conoscenza a febbraio 2026.
  • Il reasoning effort omesso da una richiesta si risolve in medium su tutta questa generazione, e la scala arriva al nuovo livello max per i casi più difficili.
  • L'input in cache è fatturato a un decimo del prezzo di listino dell'input, con le scritture in cache a 1,25x, il che si adatta alle pipeline che riusano prompt lunghi, mentre i prompt sopra i 272K token di input sono fatturati a 2x l'input e 1,5x l'output per l'intera richiesta.
  • Function calling, streaming, output strutturati e Batch sono tutti supportati.
  • Synthorai serve GPT-5.6 Luna tramite lo stesso endpoint chat completions compatibile OpenAI di ogni modello GPT.

FAQ

L'API di GPT-5.6 Luna si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1/M token in input, quel credito da solo copre circa 125 richieste da ~8K token verso GPT-5.6 Luna.

In cosa eccelle GPT-5.6 Luna?

Livello GPT-5.6 più veloce ed economico; intero contesto da 1.050.000 token della famiglia mantenuto; input in cache a un decimo del prezzo di listino. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa GPT-5.6 Luna?

Su Synthorai, GPT-5.6 Luna costa $1 per milione di token in input e $6 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.1/M.

GPT-5.6 Luna supporta il caching dei prompt?

Sì, in automatico: i prompt serviti da OpenAI vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.1/M contro $1/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL 5-10 min, fino a 1 ora). Guida al caching dei prompt →

Come ottengo l'accesso a GPT-5.6 Luna?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gpt-5.6-luna" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Qual è il cutoff di conoscenza di GPT-5.6 Luna?

Il cutoff di conoscenza di GPT-5.6 Luna è 2026-02, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-10).

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →