Novo Cadastre-se grátis, 10 chamadas por nossa conta. Até US$ 1, sem cartão.

GPT-6 Luna

Lançado em 2026-09-22

chatVisãoCódigoChamada de ferramentasRaciocínioCache de prompts

GPT-6 Luna é o nível leve da família GPT-6 da OpenAI, lançado em 22 de setembro de 2026 junto com o GPT-6 Sol.

Entrada
texto imagem $0.1/M
Saída
texto $0.5/M
Leitura de cache
$0.01/M
Contexto
1.1M
vs GPT-4o
~98% mais barato
Corte de conhecimento
2026-05

Prompts acima de 272K tokens: toda a requisição é cobrada a $0.2/M de entrada · $0.75/M de saída

Benchmarks

Acima da médiaapenas 1 comparáveis
GPT-6 Luna outros modelos medidos média dos modelos comparados nenhum outro modelo pontuou mais alto
DeepSWE 1.1
66.6%

Publicado pelos fornecedores: Alibaba (Qwen) Anthropic DeepSeek Google OpenAI Z.ai

O preço em contexto

Posição do preço entre 67 modelos comparáveis

Entrada$0.1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Saída$0.5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Leitura em cache$0.01/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

A barra mostra onde fica o preço deste modelo entre todos os modelos do mesmo tipo na Synthorai. Em cada extremidade está o mais barato e o mais caro. São tarifas base; os descontos de lote, região e escrita em cache estão na página de preços.

Especificações e limites

Tokens

Janela de contexto (especificação do fornecedor) 1.050.000
Saída máxima (especificação do fornecedor) 128.000
Corte de conhecimento 2026-05

Cache de prompts

Modo automático
Prefixo mín. 1.024
Duração 5-10 min, até 1 hora

Raciocínio

Parâmetro do fornecedor reasoning.effort
Valores aceites none · low · medium · high · xhigh · max
Valor predefinido medium aplicado quando o pedido nada indica
Pode ser desativado Sim
Parâmetro reasoning_effort
Valores minimal · low · medium · high a superfície de parâmetros do gateway - aplica-se o mapeamento do fornecedor acima

Modelo

Modalidades texto + imagem → texto

OpenAI's most efficient GPT-6 model for focused, high-volume tasks and the lowest-cost option in the family. 1.05M context of which up to 922K can be input, 128K max output. Prompts over 272K input tokens move the whole request onto the long-context rate (2x input and cache, 1.5x output). On Chat Completions, function calling works only with reasoning_effort set to none.

conforme documentação oficial da OpenAI ↗

Um prompt, medido pelo gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VERIFICAR exatamente 3 frases

GPT-6 Luna passou · 3 sentences

Enabling reasoning typically makes the model process more information and generate more internal tokens before producing its answer. Because usage is billed by tokens—and reasoning may also route requests to a more expensive model—the cost per request can rise sharply. If request volume stayed similar, that higher cost per request could explain why the bill doubled.

saída 117 tok (+48 pensamento) latência 3.4 s

Cumprimento da instrução (exatamente três frases - contáveis), ajuste ao público (registro de CFO), e a lacuna de cobrança do pensamento oculto que os medidores de tokens abaixo expõem.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VERIFICAR a correção passa nos testes

GPT-6 Luna passou · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The original code counted matching *adjacent pairs* rather than items, so a run of length `n` was reported as `n - 1`, and a single-item input returned `0`. This version counts the current item as part of each run and updates `best` at every index, including the last; it returns `0` for an empty input.

saída 514 tok (+356 pensamento) latência 6.9 s

Se a correção é de fato certa (executável), a densidade da explicação, e a eficiência em tokens numa tarefa delimitada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VERIFICAR JSON válido, esquema exato

GPT-6 Luna passou · 5/5 fields, guidance "Withheld pending the Q4 close"

{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":null,"guidance":"Withheld pending the Q4 close"}

saída 161 tok (+119 pensamento) latência 21.7 s

Obediência ao esquema (sem campos inventados), pressão de alucinação (guidance é explicitamente retida), e diferenças no caminho de saída estruturada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VERIFICAR 120 palavras, 0 palavras proibidas

GPT-6 Luna passou · 120 words, 0 banned, 1 question

Introducing Prompt Cache, a new API gateway feature that recognizes repeat prompt prefixes and reuses provider-side cached context across supported models. Teams can route requests to different AI providers while preserving eligible cache hits, reducing redundant input processing and helping lower latency and token costs. Configure cache policies in one place, monitor hit rates by provider, and keep existing client integrations unchanged. The gateway applies provider-specific rules automatically, so developers do not need to build separate caching logic for each endpoint. Which workflows could benefit from faster responses and predictable spend? Prompt Cache is available today in preview for eligible accounts, with usage details, supported providers, and setup guidance in the dashboard. Start with one route, compare results, then expand.

saída 959 tok (+813 pensamento) latência 14.6 s

Obediência às restrições (orçamento de palavras, lista de palavras proibidas, a única pergunta), impressão digital de estilo, e controle de comprimento.

Use o GPT-6 Luna em 30 segundos

Compatível com OpenAI: troque a base_url, mantenha seu SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gpt-6-luna",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Sobre o GPT-6 Luna

  • A OpenAI o chama de seu modelo mais eficiente para tarefas focadas e de alto volume e a opção de menor custo da família GPT-6, o que o torna a escolha natural para resumo, extração, classificação e roteamento em escala.
  • Ele não abre mão dos limites da família para isso: mantém a janela de contexto de 1.050.000 tokens, dos quais até 922.000 podem ser de entrada, 128K tokens de saída máxima, entrada de texto e imagem, saídas estruturadas, streaming, uso de ferramentas e cache de prompts, com corte de conhecimento em maio de 2026.
  • O esforço de raciocínio vai de none a max com medium como padrão, então uma implantação de alto volume pode reduzi-lo por solicitação em vez de trocar de modelo.
  • Prompts acima de 272K tokens de entrada levam a solicitação inteira para a tarifa de contexto longo, com o dobro do preço de entrada e 1,5 vez o de saída.
  • Como no restante do GPT-6, a chamada de funções no Chat Completions só funciona com reasoning_effort em none; use a Responses API quando precisar de ferramentas e raciocínio juntos.
  • A Synthorai oferece o GPT-6 Luna pela mesma API compatível com OpenAI do restante do catálogo.

Perguntas frequentes

A API do GPT-6 Luna é gratuita para testar?

Sim. Contas novas recebem 10 chamadas de teste e até $1 em créditos gratuitos, sem precisar de cartão. A $0.1/M de tokens de entrada, só esse crédito já cobre cerca de 1,250 requisições de ~8K tokens ao GPT-6 Luna.

Em que o GPT-6 Luna é melhor?

O modelo de menor custo da família GPT-6; feito para tarefas focadas e de alto volume; mantém o contexto completo de 1,05M e 128K de saída. Veja a seção Sobre para o quadro completo, extraído das notas de lançamento do próprio fornecedor.

Quanto custa o GPT-6 Luna?

Na Synthorai, o GPT-6 Luna custa $0.1 por milhão de tokens de entrada e $0.5 por milhão de tokens de saída. É o preço de tabela do provedor, sem margem da plataforma. Tokens de entrada em cache são cobrados a $0.01/M.

O GPT-6 Luna suporta cache de prompts?

Sim, automaticamente: prompts servidos pela OpenAI entram em cache sem nenhuma mudança no código. Tokens de entrada em cache são cobrados a $0.01/M, contra $0.1/M sem cache; os prompts precisam de um prefixo estável de 1,024 tokens para entrar em cache (TTL 5-10 min, até 1 hora). Guia de cache de prompts →

Como obtenho acesso ao GPT-6 Luna?

Aponte seu SDK da OpenAI existente para base_url="https://synthorai.io/v1", defina model="gpt-6-luna" e pronto. Uma única chave de API cobre todos os modelos do gateway.

Qual é o corte de conhecimento do GPT-6 Luna?

O corte de conhecimento do GPT-6 Luna é 2026-05, segundo a documentação oficial do fornecedor (verificado em 2026-09-23).

Modelos relacionados

Comparar

Cada valor desta página é transcrito da documentação do fornecedor, ligada acima, e traz a data em que foi verificado. Os preços são comparados em todo o catálogo; os valores de especificação que os fornecedores definem de forma diferente são apresentados com a diferença indicada em vez de representados num gráfico. Nada aqui é medido por nós, e nada é pontuado.

Obtenha sua chave API Compare seu custo →