Novità Registrati gratis, 10 chiamate le offriamo noi. Fino a $1, senza carta.

GPT-6 Luna

Rilasciato 2026-09-22

chatVisioneCodiceChiamata di strumentiRagionamentoCaching dei prompt

GPT-6 Luna è il livello leggero della famiglia GPT-6 di OpenAI, rilasciato il 22 settembre 2026 insieme a GPT-6 Sol.

Input
testo immagine $0.1/M
Output
testo $0.5/M
Lettura cache
$0.01/M
Contesto
1.1M
vs GPT-4o
~98% più economico
Cutoff di conoscenza
2026-05

Prompt oltre 272K token: l'intera richiesta viene fatturata a $0.2/M in input · $0.75/M in output

Benchmark

Sopra la mediasolo 1 confrontabili
GPT-6 Luna altri modelli misurati media dei modelli confrontati nessun altro modello ha fatto meglio
DeepSWE 1.1
66.6%

Dati pubblicati dai fornitori: Alibaba (Qwen) Anthropic DeepSeek Google OpenAI Z.ai

Il prezzo nel contesto

Posizione del prezzo tra 67 modelli comparabili

Input$0.1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Output$0.5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lettura da cache$0.01/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra mostra dove si colloca il prezzo di questo modello tra tutti i modelli dello stesso tipo su Synthorai. Alle due estremità sono indicati il più economico e il più caro. Sono tariffe base; gli sconti per batch, regione e scrittura in cache sono nella pagina dei prezzi.

Specifiche e limiti

Token

Finestra di contesto (specifica del fornitore) 1.050.000
Output massimo (specifica del vendor) 128.000
Cutoff di conoscenza 2026-05

Caching prompt

Modalità automatico
Prefisso min. 1.024
Durata 5-10 min, fino a 1 ora

Ragionamento

Parametro del fornitore reasoning.effort
Valori accettati none · low · medium · high · xhigh · max
Valore predefinito medium applicato se la richiesta non specifica nulla
Disattivabile
Parametro reasoning_effort
Valori minimal · low · medium · high la superficie parametri del gateway - vale la mappatura del fornitore sopra

Modello

Modalità testo + immagine → testo

OpenAI's most efficient GPT-6 model for focused, high-volume tasks and the lowest-cost option in the family. 1.05M context of which up to 922K can be input, 128K max output. Prompts over 272K input tokens move the whole request onto the long-context rate (2x input and cache, 1.5x output). On Chat Completions, function calling works only with reasoning_effort set to none.

fonte: documentazione ufficiale OpenAI ↗

Un solo prompt, misurato attraverso il gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICA esattamente 3 frasi

GPT-6 Luna superato · 3 sentences

Enabling reasoning typically makes the model process more information and generate more internal tokens before producing its answer. Because usage is billed by tokens—and reasoning may also route requests to a more expensive model—the cost per request can rise sharply. If request volume stayed similar, that higher cost per request could explain why the bill doubled.

out 117 tok (+48 ragionamento) latenza 3.4 s

Rispetto dell'istruzione (esattamente tre frasi - contabili), adattamento al pubblico (registro da CFO), e il divario di fatturazione del pensiero nascosto che i contatori di token qui sotto rivelano.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICA la correzione supera i test

GPT-6 Luna superato · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The original code counted matching *adjacent pairs* rather than items, so a run of length `n` was reported as `n - 1`, and a single-item input returned `0`. This version counts the current item as part of each run and updates `best` at every index, including the last; it returns `0` for an empty input.

out 514 tok (+356 ragionamento) latenza 6.9 s

Se la correzione è davvero giusta (eseguibile), la densità della spiegazione, e l'efficienza in token su un compito delimitato.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICA JSON valido, schema esatto

GPT-6 Luna superato · 5/5 fields, guidance "Withheld pending the Q4 close"

{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":null,"guidance":"Withheld pending the Q4 close"}

out 161 tok (+119 ragionamento) latenza 21.7 s

Aderenza allo schema (nessun campo inventato), pressione di allucinazione (guidance è esplicitamente sospesa), e differenze nel percorso di output strutturato.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICA 120 parole, 0 parole vietate

GPT-6 Luna superato · 120 words, 0 banned, 1 question

Introducing Prompt Cache, a new API gateway feature that recognizes repeat prompt prefixes and reuses provider-side cached context across supported models. Teams can route requests to different AI providers while preserving eligible cache hits, reducing redundant input processing and helping lower latency and token costs. Configure cache policies in one place, monitor hit rates by provider, and keep existing client integrations unchanged. The gateway applies provider-specific rules automatically, so developers do not need to build separate caching logic for each endpoint. Which workflows could benefit from faster responses and predictable spend? Prompt Cache is available today in preview for eligible accounts, with usage details, supported providers, and setup guidance in the dashboard. Start with one route, compare results, then expand.

out 959 tok (+813 ragionamento) latenza 14.6 s

Rispetto dei vincoli (budget di parole, elenco di parole vietate, l'unica domanda), impronta stilistica, e controllo della lunghezza.

Usa GPT-6 Luna in 30 secondi

Compatibile OpenAI: cambia la base_url, tieni il tuo SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gpt-6-luna",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Informazioni su GPT-6 Luna

  • OpenAI lo definisce il suo modello più efficiente per attività mirate ad alto volume e l'opzione più economica della famiglia GPT-6, il che lo rende la scelta naturale per riassunto, estrazione, classificazione e instradamento su larga scala.
  • Non rinuncia per questo ai limiti della famiglia: mantiene la finestra di contesto di 1.050.000 token, di cui fino a 922.000 di input, 128K token di output massimo, input di testo e immagini, output strutturati, streaming, uso di strumenti e caching dei prompt, con un limite di conoscenza a maggio 2026.
  • L'effort di ragionamento va da none a max con medium come default, così un deployment ad alto volume può abbassarlo per singola richiesta invece di cambiare modello.
  • I prompt oltre 272K token di input spostano l'intera richiesta sulla tariffa di contesto lungo, con input al doppio e output a 1,5 volte.
  • Come per il resto di GPT-6, il function calling su Chat Completions funziona solo con reasoning_effort a none; usa la Responses API quando servono strumenti e ragionamento insieme.
  • Synthorai offre GPT-6 Luna tramite la stessa API compatibile con OpenAI del resto del catalogo.

FAQ

L'API di GPT-6 Luna si può provare gratis?

Sì: i nuovi account ricevono 10 chiamate di prova e fino a $1 di credito gratuito, senza carta richiesta. A $0.1/M token in input, quel credito da solo copre circa 1,250 richieste da ~8K token verso GPT-6 Luna.

In cosa eccelle GPT-6 Luna?

Il modello più economico della famiglia GPT-6; pensato per attività mirate ad alto volume; mantiene l'intero contesto di 1,05M e 128K di output. Il quadro completo è nella sezione «Informazioni», tratto dalle note di rilascio ufficiali del vendor.

Quanto costa GPT-6 Luna?

Su Synthorai, GPT-6 Luna costa $0.1 per milione di token in input e $0.5 per milione di token in output: il prezzo di listino del provider, senza ricarico della piattaforma. I token di input in cache si fatturano a $0.01/M.

GPT-6 Luna supporta il caching dei prompt?

Sì, in automatico: i prompt serviti da OpenAI vanno in cache senza modifiche al codice. I token di input in cache si fatturano a $0.01/M contro $0.1/M senza cache; per andare in cache i prompt richiedono un prefisso stabile di 1,024 token (TTL 5-10 min, fino a 1 ora). Guida al caching dei prompt →

Come ottengo l'accesso a GPT-6 Luna?

Punta il tuo SDK OpenAI esistente a base_url="https://synthorai.io/v1", imposta model="gpt-6-luna" e hai finito: una sola chiave API copre tutti i modelli del gateway.

Qual è il cutoff di conoscenza di GPT-6 Luna?

Il cutoff di conoscenza di GPT-6 Luna è 2026-05, secondo la documentazione ufficiale del vendor (dato aggiornato al 2026-09-23).

Modelli correlati

Confronta

Ogni valore di questa pagina è trascritto dalla documentazione del fornitore, collegata sopra, e riporta la data in cui è stato verificato. I prezzi sono confrontati sull'intero catalogo; i valori di specifica che i fornitori definiscono in modo diverso sono mostrati indicando la differenza anziché messi a grafico. Nulla qui è misurato da noi e nulla è valutato con un punteggio.

Ottieni la tua chiave API Confronta il tuo costo →