Nuevo Regístrate gratis, 10 llamadas de regalo. Hasta 1 $, sin tarjeta.

GPT-6 Luna

Lanzamiento: 2026-09-22

chatVisiónCódigoLlamada a herramientasRazonamientoCaché de prompts

GPT-6 Luna es el nivel ligero de la familia GPT-6 de OpenAI, lanzado el 22 de septiembre de 2026 junto con GPT-6 Sol.

Entrada
texto imagen $0.1/M
Salida
texto $0.5/M
Lectura de caché
$0.01/M
Contexto
1.1M
vs GPT-4o
~98% más barato
Corte de conocimiento
2026-05

Prompts de más de 272K tokens: toda la solicitud se factura a $0.2/M de entrada · $0.75/M de salida

Benchmarks

Sobre la mediasolo 1 comparables
GPT-6 Luna otros modelos medidos media de los modelos comparados ningún otro modelo puntuó más alto
DeepSWE 1.1
66.6%

Publicado por los proveedores: Alibaba (Qwen) Anthropic DeepSeek Google OpenAI Z.ai

El precio en contexto

Posición del precio entre 67 modelos comparables

Entrada$0.1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Salida$0.5/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lectura en caché$0.01/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.

Especificaciones y límites

Tokens

Ventana de contexto (especificación del proveedor) 1.050.000
Salida máxima (especificación del proveedor) 128.000
Corte de conocimiento 2026-05

Caché de prompts

Modo automático
Prefijo mín. 1024
Duración 5-10 min, hasta 1 hora

Razonamiento

Parámetro del proveedor reasoning.effort
Valores admitidos none · low · medium · high · xhigh · max
Valor por defecto medium se aplica si la solicitud no indica nada
Se puede desactivar
Parámetro reasoning_effort
Valores minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba

Modelo

Modalidades texto + imagen → texto

OpenAI's most efficient GPT-6 model for focused, high-volume tasks and the lowest-cost option in the family. 1.05M context of which up to 922K can be input, 128K max output. Prompts over 272K input tokens move the whole request onto the long-context rate (2x input and cache, 1.5x output). On Chat Completions, function calling works only with reasoning_effort set to none.

según documentación oficial de OpenAI ↗

Un prompt, medido a través del gateway

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. COMPROBAR exactamente 3 frases

GPT-6 Luna superado · 3 sentences

Enabling reasoning typically makes the model process more information and generate more internal tokens before producing its answer. Because usage is billed by tokens—and reasoning may also route requests to a more expensive model—the cost per request can rise sharply. If request volume stayed similar, that higher cost per request could explain why the bill doubled.

salida 117 tok (+48 pensamiento) latencia 3.4 s

Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. COMPROBAR el arreglo pasa las pruebas

GPT-6 Luna superado · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The original code counted matching *adjacent pairs* rather than items, so a run of length `n` was reported as `n - 1`, and a single-item input returned `0`. This version counts the current item as part of each run and updates `best` at every index, including the last; it returns `0` for an empty input.

salida 514 tok (+356 pensamiento) latencia 6.9 s

Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. COMPROBAR JSON válido, esquema exacto

GPT-6 Luna superado · 5/5 fields, guidance "Withheld pending the Q4 close"

{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":null,"guidance":"Withheld pending the Q4 close"}

salida 161 tok (+119 pensamiento) latencia 21.7 s

Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. COMPROBAR 120 palabras, 0 palabras prohibidas

GPT-6 Luna superado · 120 words, 0 banned, 1 question

Introducing Prompt Cache, a new API gateway feature that recognizes repeat prompt prefixes and reuses provider-side cached context across supported models. Teams can route requests to different AI providers while preserving eligible cache hits, reducing redundant input processing and helping lower latency and token costs. Configure cache policies in one place, monitor hit rates by provider, and keep existing client integrations unchanged. The gateway applies provider-specific rules automatically, so developers do not need to build separate caching logic for each endpoint. Which workflows could benefit from faster responses and predictable spend? Prompt Cache is available today in preview for eligible accounts, with usage details, supported providers, and setup guidance in the dashboard. Start with one route, compare results, then expand.

salida 959 tok (+813 pensamiento) latencia 14.6 s

Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.

Use GPT-6 Luna en 30 segundos

Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gpt-6-luna",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

Acerca de GPT-6 Luna

  • OpenAI lo llama su modelo más eficiente para tareas focalizadas de alto volumen y la opción de menor costo de la familia GPT-6, lo que lo hace idóneo para resumen, extracción, clasificación y enrutamiento a escala.
  • No sacrifica los límites de la familia para lograrlo: mantiene la ventana de contexto de 1.050.000 tokens, de los cuales hasta 922.000 pueden ser de entrada, 128K tokens de salida máxima, entrada de texto e imagen, salidas estructuradas, streaming, uso de herramientas y caché de prompts, con un corte de conocimiento de mayo de 2026.
  • El esfuerzo de razonamiento va de none a max con medium por defecto, de modo que un despliegue de alto volumen puede bajarlo por solicitud en lugar de cambiar de modelo.
  • Los prompts de más de 272K tokens de entrada pasan por completo a la tarifa de contexto largo, con el doble de precio de entrada y 1,5 veces el de salida.
  • Como en el resto de GPT-6, las llamadas a funciones en Chat Completions solo funcionan con reasoning_effort en none; usa la Responses API cuando necesites herramientas y razonamiento a la vez.
  • Synthorai ofrece GPT-6 Luna a través de la misma API compatible con OpenAI que el resto de su catálogo.

Preguntas frecuentes

¿Se puede probar gratis la API de GPT-6 Luna?

Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.1/M por tokens de entrada, solo ese crédito cubre aproximadamente 1,250 solicitudes de ~8K tokens contra GPT-6 Luna.

¿En qué destaca GPT-6 Luna?

El modelo de menor costo de la familia GPT-6; creado para tareas focalizadas de alto volumen; conserva el contexto completo de 1,05M y 128K de salida. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.

¿Cuánto cuesta GPT-6 Luna?

GPT-6 Luna cuesta $0.1 por millón de tokens de entrada y $0.5 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.01/M.

¿GPT-6 Luna admite caché de prompts?

Sí, automáticamente: los prompts servidos por OpenAI se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.01/M frente a $0.1/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL 5-10 min, hasta 1 hora). Guía de caché de prompts →

¿Cómo obtengo acceso a GPT-6 Luna?

Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="gpt-6-luna" y listo. Una sola clave API cubre todos los modelos del gateway.

¿Cuál es la fecha de corte de conocimiento de GPT-6 Luna?

La fecha de corte de conocimiento de GPT-6 Luna es 2026-05, según la documentación oficial del proveedor (a fecha de 2026-09-23).

Modelos relacionados

Comparar

Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.

Obtén tu clave API Compare su costo →