GPT-5.6 Luna è il membro più veloce ed economico della famiglia GPT-5.6 di OpenAI, descritto sulla sua pagina del modello come progettato per carichi di lavoro ad alto volume e sensibili ai costi come sintesi, stesura di bozze e automazione di routine.
- Input
- testo immagine $1/M
- Output
- testo $6/M
- Lettura cache
- $0.1/M
- Contesto
- 1.1M
- vs GPT-4o
- ~80% più economico
- Cutoff di conoscenza
- 2026-02
Benchmark
Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai
Il prezzo nel contesto
Posizione del prezzo tra 60 modelli comparabili
La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.
Specifiche e limiti
Token
| Finestra di contesto (specifica del fornitore) | 1.050.000 |
|---|---|
| Output massimo (specifica del vendor) | 128.000 |
| Cutoff di conoscenza | 2026-02 |
Caching prompt
| Modalità | automatico |
|---|---|
| Prefisso min. | 1.024 |
| Durata | 5-10 min, fino a 1 ora |
Ragionamento
| Parametro del fornitore | reasoning.effort |
|---|---|
| Valori accettati | none · low · medium · high · xhigh · max |
| Valore predefinito | medium applicato se la richiesta non specifica nulla |
| Disattivabile | Sì |
| Comportamento del ragionamento | La Responses API accetta anche reasoning.mode, con valore standard (il predefinito) o pro; mode ed effort sono manopole indipendenti. |
| Parametro | reasoning_effort |
| Valori | minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra |
Modello
| Modalità | testo + immagine → testo |
|---|
- Il livello GPT-5.6 più veloce ed economico, progettato per carichi di lavoro ad alto volume sensibili al costo (successore del livello nano)
- mantiene l'intero contesto da 1,05M della famiglia / 128k di output massimo
- input in cache al 10% del listino con scritture in cache a 1,25x
- i prompt oltre i 272k token in input sono fatturati a 2x in input / 1,5x in output
Un solo prompt, misurato attraverso il gateway
GPT-5.6 Luna superato · 3 sentences
Enabling reasoning causes the model to use substantially more computational steps and generated tokens per request, even when the visible answer is similar. Because our provider charges based largely on token consumption and compute, that increased processing translated into roughly twice the cost. We can control the expense by reserving reasoning for complex tasks, setting token and effort limits, and monitoring cost per successful outcome.
out 146 tok (+60 ragionamento) latenza 3.1 s
Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.
GPT-5.6 Luna superato · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: best = max(best, cur) cur = 1 return max(best, cur) ``` The bug is that `cur` counts equal *transitions* rather than the number of items in the current run, so a single-element run returns `0` and a run of length `n` returns `n - 1`; additionally, `best` is only updated when a run is interrupted, so a run continuing through the final element is not finalized before returning. Initializing the current run to one item, resetting it to one after a change, and taking a final `max` fixes both issues.
out 356 tok (+161 ragionamento) latenza 4.7 s
Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.
GPT-5.6 Luna superato · 5/5 fields, guidance "Withheld pending the Q4 close"
{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":null,"guidance":"Withheld pending the Q4 close"}
out 227 tok (+181 ragionamento) latenza 3.6 s
Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.
GPT-5.6 Luna superato · 120 words, 0 banned, 1 question
Introducing PromptCache, an API gateway feature that caches prompts across providers, helping teams reduce latency, control spend, and deliver consistent results. How much faster could your applications respond when repeated prompts are served from a shared cache instead of being sent upstream? PromptCache supports provider-aware routing, configurable time-to-live policies, encrypted storage, cache invalidation, and usage analytics through one operational layer. It works with language-model providers while preserving your authentication, observability, and fallback workflows. Developers can enable caching by endpoint, model, tenant, or prompt pattern, then monitor hit rates and savings in real time. Built for production workloads, PromptCache gives platform teams controls for performance and cost without requiring application rewrites. […]
out 948 tok (+778 ragionamento) latenza 8.0 s
Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.
Usa GPT-5.6 Luna in 30 secondi
Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gpt-5.6-luna",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gpt-5.6-luna",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-luna",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gpt-5.6-luna",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gpt-5.6-luna")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Informazioni su GPT-5.6 Luna
- La guida alla scelta del modello di OpenAI indica Luna per il lavoro efficiente ad alto volume, Terra per prestazioni solide a un prezzo più basso e Sol quando serve la capacità flagship.
- Mantiene l'intera finestra di contesto da 1.050.000 token della famiglia (specifica del vendor) e i 128K token di output massimo, accetta input di immagini, supporta i token di ragionamento e raggiunge il set di strumenti hosted comprensivo di ricerca web, ricerca file, code interpreter, computer use, shell hosted, apply patch, skill, tool search e MCP, con un cutoff di conoscenza a febbraio 2026.
- Il reasoning effort omesso da una richiesta si risolve in medium su tutta questa generazione, e la scala arriva al nuovo livello max per i casi più difficili.
- L'input in cache è fatturato a un decimo del prezzo di listino dell'input, con le scritture in cache a 1,25x, il che si adatta alle pipeline che riusano prompt lunghi, mentre i prompt sopra i 272K token di input sono fatturati a 2x l'input e 1,5x l'output per l'intera richiesta.
- Function calling, streaming, output strutturati e Batch sono tutti supportati.
- Synthorai serve GPT-5.6 Luna tramite lo stesso endpoint chat completions compatibile OpenAI di ogni modello GPT.
FAQ
L'API di GPT-5.6 Luna si può provare gratis?
Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $1/M token in input, quel credito da solo copre circa 125 richieste da ~8K token verso GPT-5.6 Luna.
In cosa eccelle GPT-5.6 Luna?
Livello GPT-5.6 più veloce ed economico; intero contesto da 1.050.000 token della famiglia mantenuto; input in cache a un decimo del prezzo di listino. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.
Quanto costa GPT-5.6 Luna?
Su Synthorai, GPT-5.6 Luna costa $1 per milione di token in input e $6 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.1/M.
GPT-5.6 Luna supporta il caching dei prompt?
Sì, in automatico: i prompt serviti da OpenAI vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.1/M contro $1/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL 5-10 min, fino a 1 ora). Guida al caching dei prompt →
Come ottengo l'accesso a GPT-5.6 Luna?
Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gpt-5.6-luna" e hai finito: una sola chiave API copre tutti i modelli del gateway.
Qual è il cutoff di conoscenza di GPT-5.6 Luna?
Il cutoff di conoscenza di GPT-5.6 Luna è 2026-02, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-07-10).
Modelli correlati
Confronta
Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.