GPT-6 Luna es el nivel ligero de la familia GPT-6 de OpenAI, lanzado el 22 de septiembre de 2026 junto con GPT-6 Sol.
- Entrada
- texto imagen $0.1/M
- Salida
- texto $0.5/M
- Lectura de caché
- $0.01/M
- Contexto
- 1.1M
- vs GPT-4o
- ~98% más barato
- Corte de conocimiento
- 2026-05
Prompts de más de 272K tokens: toda la solicitud se factura a $0.2/M de entrada · $0.75/M de salida
Benchmarks
Publicado por los proveedores: Alibaba (Qwen) Anthropic DeepSeek Google OpenAI Z.ai
El precio en contexto
Posición del precio entre 67 modelos comparables
La barra muestra dónde queda el precio de este modelo entre todos los modelos del mismo tipo en Synthorai. En cada extremo se nombra el más barato y el más caro. Son tarifas base; los descuentos por lote, región y escritura en caché están en la página de precios.
Especificaciones y límites
Tokens
| Ventana de contexto (especificación del proveedor) | 1.050.000 |
|---|---|
| Salida máxima (especificación del proveedor) | 128.000 |
| Corte de conocimiento | 2026-05 |
Caché de prompts
| Modo | automático |
|---|---|
| Prefijo mín. | 1024 |
| Duración | 5-10 min, hasta 1 hora |
Razonamiento
| Parámetro del proveedor | reasoning.effort |
|---|---|
| Valores admitidos | none · low · medium · high · xhigh · max |
| Valor por defecto | medium se aplica si la solicitud no indica nada |
| Se puede desactivar | Sí |
| Parámetro | reasoning_effort |
| Valores | minimal · low · medium · high la superficie de parámetros del gateway - aplica el mapeo del proveedor de arriba |
Modelo
| Modalidades | texto + imagen → texto |
|---|
OpenAI's most efficient GPT-6 model for focused, high-volume tasks and the lowest-cost option in the family. 1.05M context of which up to 922K can be input, 128K max output. Prompts over 272K input tokens move the whole request onto the long-context rate (2x input and cache, 1.5x output). On Chat Completions, function calling works only with reasoning_effort set to none.
Un prompt, medido a través del gateway
GPT-6 Luna superado · 3 sentences
Enabling reasoning typically makes the model process more information and generate more internal tokens before producing its answer. Because usage is billed by tokens—and reasoning may also route requests to a more expensive model—the cost per request can rise sharply. If request volume stayed similar, that higher cost per request could explain why the bill doubled.
salida 117 tok (+48 pensamiento) latencia 3.4 s
Seguimiento de la instrucción (exactamente tres frases - contables), adaptación a la audiencia (registro de CFO), y la brecha de facturación por pensamiento oculto que los medidores de tokens de abajo dejan ver.
GPT-6 Luna superado · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The original code counted matching *adjacent pairs* rather than items, so a run of length `n` was reported as `n - 1`, and a single-item input returned `0`. This version counts the current item as part of each run and updates `best` at every index, including the last; it returns `0` for an empty input.
salida 514 tok (+356 pensamiento) latencia 6.9 s
Si el arreglo es realmente correcto (ejecutable), la densidad de la explicación, y la eficiencia en tokens sobre una tarea acotada.
GPT-6 Luna superado · 5/5 fields, guidance "Withheld pending the Q4 close"
{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":null,"guidance":"Withheld pending the Q4 close"}
salida 161 tok (+119 pensamiento) latencia 21.7 s
Obediencia al esquema (sin campos inventados), presión de alucinación (guidance se retiene explícitamente), y diferencias en la ruta de salida estructurada.
GPT-6 Luna superado · 120 words, 0 banned, 1 question
Introducing Prompt Cache, a new API gateway feature that recognizes repeat prompt prefixes and reuses provider-side cached context across supported models. Teams can route requests to different AI providers while preserving eligible cache hits, reducing redundant input processing and helping lower latency and token costs. Configure cache policies in one place, monitor hit rates by provider, and keep existing client integrations unchanged. The gateway applies provider-specific rules automatically, so developers do not need to build separate caching logic for each endpoint. Which workflows could benefit from faster responses and predictable spend? Prompt Cache is available today in preview for eligible accounts, with usage details, supported providers, and setup guidance in the dashboard. Start with one route, compare results, then expand.
salida 959 tok (+813 pensamiento) latencia 14.6 s
Obediencia a las restricciones (presupuesto de palabras, lista de palabras prohibidas, la única pregunta), huella de estilo, y control de la longitud.
Use GPT-6 Luna en 30 segundos
Compatible con OpenAI: cambie el base_url y conserve su SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gpt-6-luna",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gpt-6-luna",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-luna",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gpt-6-luna",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gpt-6-luna")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));Acerca de GPT-6 Luna
- OpenAI lo llama su modelo más eficiente para tareas focalizadas de alto volumen y la opción de menor costo de la familia GPT-6, lo que lo hace idóneo para resumen, extracción, clasificación y enrutamiento a escala.
- No sacrifica los límites de la familia para lograrlo: mantiene la ventana de contexto de 1.050.000 tokens, de los cuales hasta 922.000 pueden ser de entrada, 128K tokens de salida máxima, entrada de texto e imagen, salidas estructuradas, streaming, uso de herramientas y caché de prompts, con un corte de conocimiento de mayo de 2026.
- El esfuerzo de razonamiento va de none a max con medium por defecto, de modo que un despliegue de alto volumen puede bajarlo por solicitud en lugar de cambiar de modelo.
- Los prompts de más de 272K tokens de entrada pasan por completo a la tarifa de contexto largo, con el doble de precio de entrada y 1,5 veces el de salida.
- Como en el resto de GPT-6, las llamadas a funciones en Chat Completions solo funcionan con reasoning_effort en none; usa la Responses API cuando necesites herramientas y razonamiento a la vez.
- Synthorai ofrece GPT-6 Luna a través de la misma API compatible con OpenAI que el resto de su catálogo.
Preguntas frecuentes
¿Se puede probar gratis la API de GPT-6 Luna?
Sí: las cuentas nuevas reciben 10 llamadas de prueba y hasta $1 de crédito gratuito, sin tarjeta. A $0.1/M por tokens de entrada, solo ese crédito cubre aproximadamente 1,250 solicitudes de ~8K tokens contra GPT-6 Luna.
¿En qué destaca GPT-6 Luna?
El modelo de menor costo de la familia GPT-6; creado para tareas focalizadas de alto volumen; conserva el contexto completo de 1,05M y 128K de salida. Consulte la sección Acerca de para el panorama completo según las notas de lanzamiento del propio proveedor.
¿Cuánto cuesta GPT-6 Luna?
GPT-6 Luna cuesta $0.1 por millón de tokens de entrada y $0.5 por millón de tokens de salida en Synthorai: el precio de lista del proveedor, sin margen de plataforma. Los tokens de entrada en caché se facturan a $0.01/M.
¿GPT-6 Luna admite caché de prompts?
Sí, automáticamente: los prompts servidos por OpenAI se almacenan en caché sin cambios de código. Los tokens de entrada en caché se facturan a $0.01/M frente a $0.1/M sin caché; los prompts necesitan un prefijo estable de 1,024 tokens para entrar en caché (TTL 5-10 min, hasta 1 hora). Guía de caché de prompts →
¿Cómo obtengo acceso a GPT-6 Luna?
Apunte su SDK de OpenAI existente a base_url="https://synthorai.io/v1", configure model="gpt-6-luna" y listo. Una sola clave API cubre todos los modelos del gateway.
¿Cuál es la fecha de corte de conocimiento de GPT-6 Luna?
La fecha de corte de conocimiento de GPT-6 Luna es 2026-05, según la documentación oficial del proveedor (a fecha de 2026-09-23).
Modelos relacionados
Comparar
Cada valor de esta página está transcrito de la documentación del proveedor, enlazada arriba, y lleva la fecha en que se comprobó. Los precios se comparan en todo el catálogo; los valores de especificación que los proveedores definen de forma distinta se muestran indicando la diferencia en lugar de representarse en un gráfico. Nada aquí lo medimos nosotros, y nada se puntúa.