GPT-6 Luna é o nível leve da família GPT-6 da OpenAI, lançado em 22 de setembro de 2026 junto com o GPT-6 Sol.
- Entrada
- texto imagem $0.1/M
- Saída
- texto $0.5/M
- Leitura de cache
- $0.01/M
- Contexto
- 1.1M
- vs GPT-4o
- ~98% mais barato
- Corte de conhecimento
- 2026-05
Prompts acima de 272K tokens: toda a requisição é cobrada a $0.2/M de entrada · $0.75/M de saída
Benchmarks
Publicado pelos fornecedores: Alibaba (Qwen) Anthropic DeepSeek Google OpenAI Z.ai
O preço em contexto
Posição do preço entre 67 modelos comparáveis
A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.
Especificações e limites
Tokens
| Janela de contexto (especificação do fornecedor) | 1.050.000 |
|---|---|
| Saída máxima (especificação do fornecedor) | 128.000 |
| Corte de conhecimento | 2026-05 |
Cache de prompts
| Modo | automático |
|---|---|
| Prefixo mín. | 1.024 |
| Duração | 5-10 min, até 1 hora |
Raciocínio
| Parâmetro do fornecedor | reasoning.effort |
|---|---|
| Valores aceites | none · low · medium · high · xhigh · max |
| Valor predefinido | medium aplicado quando o pedido nada indica |
| Pode ser desativado | Sim |
| Parâmetro | reasoning_effort |
| Valores | minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima |
Modelo
| Modalidades | texto + imagem → texto |
|---|
OpenAI's most efficient GPT-6 model for focused, high-volume tasks and the lowest-cost option in the family. 1.05M context of which up to 922K can be input, 128K max output. Prompts over 272K input tokens move the whole request onto the long-context rate (2x input and cache, 1.5x output). On Chat Completions, function calling works only with reasoning_effort set to none.
conforme documentação oficial da OpenAI ↗
Um prompt, medido pelo gateway
GPT-6 Luna passou · 3 sentences
Enabling reasoning typically makes the model process more information and generate more internal tokens before producing its answer. Because usage is billed by tokens—and reasoning may also route requests to a more expensive model—the cost per request can rise sharply. If request volume stayed similar, that higher cost per request could explain why the bill doubled.
saída 117 tok (+48 pensamento) latência 3.4 s
Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.
GPT-6 Luna passou · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The original code counted matching *adjacent pairs* rather than items, so a run of length `n` was reported as `n - 1`, and a single-item input returned `0`. This version counts the current item as part of each run and updates `best` at every index, including the last; it returns `0` for an empty input.
saída 514 tok (+356 pensamento) latência 6.9 s
Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.
GPT-6 Luna passou · 5/5 fields, guidance "Withheld pending the Q4 close"
{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":null,"guidance":"Withheld pending the Q4 close"}
saída 161 tok (+119 pensamento) latência 21.7 s
Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.
GPT-6 Luna passou · 120 words, 0 banned, 1 question
Introducing Prompt Cache, a new API gateway feature that recognizes repeat prompt prefixes and reuses provider-side cached context across supported models. Teams can route requests to different AI providers while preserving eligible cache hits, reducing redundant input processing and helping lower latency and token costs. Configure cache policies in one place, monitor hit rates by provider, and keep existing client integrations unchanged. The gateway applies provider-specific rules automatically, so developers do not need to build separate caching logic for each endpoint. Which workflows could benefit from faster responses and predictable spend? Prompt Cache is available today in preview for eligible accounts, with usage details, supported providers, and setup guidance in the dashboard. Start with one route, compare results, then expand.
saída 959 tok (+813 pensamento) latência 14.6 s
Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.
Use o GPT-6 Luna em 30 segundos
Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gpt-6-luna",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gpt-6-luna",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-luna",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gpt-6-luna",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gpt-6-luna")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Sobre o GPT-6 Luna
- A OpenAI o chama de seu modelo mais eficiente para tarefas focadas e de alto volume e a opção de menor custo da família GPT-6, o que o torna a escolha natural para resumo, extração, classificação e roteamento em escala.
- Ele não abre mão dos limites da família para isso: mantém a janela de contexto de 1.050.000 tokens, dos quais até 922.000 podem ser de entrada, 128K tokens de saída máxima, entrada de texto e imagem, saídas estruturadas, streaming, uso de ferramentas e cache de prompts, com corte de conhecimento em maio de 2026.
- O esforço de raciocínio vai de none a max com medium como padrão, então uma implantação de alto volume pode reduzi-lo por solicitação em vez de trocar de modelo.
- Prompts acima de 272K tokens de entrada levam a solicitação inteira para a tarifa de contexto longo, com o dobro do preço de entrada e 1,5 vez o de saída.
- Como no restante do GPT-6, a chamada de funções no Chat Completions só funciona com reasoning_effort em none; use a Responses API quando precisar de ferramentas e raciocínio juntos.
- A Synthorai oferece o GPT-6 Luna pela mesma API compatível com OpenAI do restante do catálogo.
Perguntas frequentes
A API do GPT-6 Luna é gratuita para testar?
Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $0.1/M de tokens de entrada, só esse crédito já cobre cerca de 1,250 requisições de ~8K tokens ao GPT-6 Luna.
Em que o GPT-6 Luna é melhor?
O modelo de menor custo da família GPT-6; feito para tarefas focadas e de alto volume; mantém o contexto completo de 1,05M e 128K de saída. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.
Quanto custa o GPT-6 Luna?
Na Synthorai, o GPT-6 Luna custa $0.1 por milhão de tokens de entrada e $0.5 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.01/M.
O GPT-6 Luna suporta cache de prompts?
Sim, automaticamente: prompts servidos pela OpenAI entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $0.01/M, contra $0.1/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL 5-10 min, até 1 hora). Guia de cache de prompts →
Como obtenho acesso ao GPT-6 Luna?
Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="gpt-6-luna" e pronto. Uma única chave de API cobre todos os modelos do gateway.
Qual é o corte de conhecimento do GPT-6 Luna?
O corte de conhecimento do GPT-6 Luna é 2026-05, segundo a documentação oficial do fornecedor (verificado em 2026-09-23).
Modelos relacionados
Comparar
Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.