GPT-6 Luna est le niveau léger de la famille GPT-6 d'OpenAI, sorti le 22 septembre 2026 avec GPT-6 Sol.
- Entrée
- texte image $0.1/M
- Sortie
- texte $0.5/M
- Lecture de cache
- $0.01/M
- Contexte
- 1.1M
- vs GPT-4o
- ~98% moins cher
- Coupure des connaissances
- 2026-05
Prompts de plus de 272K tokens : toute la requête est facturée $0.2/M en entrée · $0.75/M en sortie
Benchmarks
Chiffres publiés par les fournisseurs : Alibaba (Qwen) Anthropic DeepSeek Google OpenAI Z.ai
Le prix en contexte
Position du prix parmi 67 modèles comparables
La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.
Spécifications et limites
Tokens
| Fenêtre de contexte (spécification du fournisseur) | 1 050 000 |
|---|---|
| Sortie max (spéc. fournisseur) | 128 000 |
| Coupure des connaissances | 2026-05 |
Mise en cache
| Mode | automatique |
|---|---|
| Préfixe min. | 1 024 |
| Durée de vie | 5-10 min, jusqu'à 1 heure |
Raisonnement
| Paramètre du fournisseur | reasoning.effort |
|---|---|
| Valeurs acceptées | none · low · medium · high · xhigh · max |
| Valeur par défaut | medium appliquée si la requête ne précise rien |
| Désactivable | Oui |
| Paramètre | reasoning_effort |
| Valeurs | minimal · low · medium · high la surface de paramètres de la passerelle - le mappage fournisseur ci-dessus s'applique |
Modèle
| Modalités | texte + image → texte |
|---|
OpenAI's most efficient GPT-6 model for focused, high-volume tasks and the lowest-cost option in the family. 1.05M context of which up to 922K can be input, 128K max output. Prompts over 272K input tokens move the whole request onto the long-context rate (2x input and cache, 1.5x output). On Chat Completions, function calling works only with reasoning_effort set to none.
Un prompt, mesuré via la passerelle
GPT-6 Luna réussi · 3 sentences
Enabling reasoning typically makes the model process more information and generate more internal tokens before producing its answer. Because usage is billed by tokens—and reasoning may also route requests to a more expensive model—the cost per request can rise sharply. If request volume stayed similar, that higher cost per request could explain why the bill doubled.
sortie 117 tok (+48 réflexion) latence 3.4 s
Suivi de l'instruction (exactement trois phrases - comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.
GPT-6 Luna réussi · 8/8 cases
```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: cur = 1 best = max(best, cur) return best ``` The original code counted matching *adjacent pairs* rather than items, so a run of length `n` was reported as `n - 1`, and a single-item input returned `0`. This version counts the current item as part of each run and updates `best` at every index, including the last; it returns `0` for an empty input.
sortie 514 tok (+356 réflexion) latence 6.9 s
Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.
GPT-6 Luna réussi · 5/5 fields, guidance "Withheld pending the Q4 close"
{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":null,"guidance":"Withheld pending the Q4 close"}
sortie 161 tok (+119 réflexion) latence 21.7 s
Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.
GPT-6 Luna réussi · 120 words, 0 banned, 1 question
Introducing Prompt Cache, a new API gateway feature that recognizes repeat prompt prefixes and reuses provider-side cached context across supported models. Teams can route requests to different AI providers while preserving eligible cache hits, reducing redundant input processing and helping lower latency and token costs. Configure cache policies in one place, monitor hit rates by provider, and keep existing client integrations unchanged. The gateway applies provider-specific rules automatically, so developers do not need to build separate caching logic for each endpoint. Which workflows could benefit from faster responses and predictable spend? Prompt Cache is available today in preview for eligible accounts, with usage details, supported providers, and setup guidance in the dashboard. Start with one route, compare results, then expand.
sortie 959 tok (+813 réflexion) latence 14.6 s
Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.
Utilisez GPT-6 Luna en 30 secondes
Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions
from openai import OpenAI
client = OpenAI(
base_url="https://synthorai.io/v1",
api_key="sk-syn-...",
)
resp = client.chat.completions.create(
model="gpt-6-luna",
messages=[{"role": "user", "content": "Summarize this diff"}],
reasoning_effort="medium",
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://synthorai.io/v1",
apiKey: "sk-syn-...",
});
const resp = await client.chat.completions.create({
model: "gpt-6-luna",
messages: [{ role: "user", content: "Summarize this diff" }],
reasoning_effort: "medium",
});
console.log(resp.choices[0].message.content);curl https://synthorai.io/v1/chat/completions \
-H "Authorization: Bearer sk-syn-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-luna",
"messages": [{"role": "user", "content": "Hello"}],
"reasoning_effort": "medium"
}'package main
import (
"context"
"fmt"
"github.com/openai/openai-go/v3"
"github.com/openai/openai-go/v3/option"
)
func main() {
client := openai.NewClient(
option.WithBaseURL("https://synthorai.io/v1"),
option.WithAPIKey("sk-syn-..."),
)
resp, _ := client.Chat.Completions.New(context.TODO(), openai.ChatCompletionNewParams{
Model: "gpt-6-luna",
Messages: []openai.ChatCompletionMessageParamUnion{
openai.UserMessage("Summarize this diff"),
},
ReasoningEffort: openai.ReasoningEffortMedium,
})
fmt.Println(resp.Choices[0].Message.Content)
}import com.openai.client.OpenAIClient;
import com.openai.client.okhttp.OpenAIOkHttpClient;
import com.openai.models.chat.completions.*;
import com.openai.models.ReasoningEffort;
OpenAIClient client = OpenAIOkHttpClient.builder()
.baseUrl("https://synthorai.io/v1")
.apiKey("sk-syn-...")
.build();
ChatCompletion resp = client.chat().completions().create(
ChatCompletionCreateParams.builder()
.model("gpt-6-luna")
.addUserMessage("Summarize this diff")
.reasoningEffort(ReasoningEffort.MEDIUM)
.build());
System.out.println(resp.choices().get(0).message().content().orElse(""));À propos de GPT-6 Luna
- OpenAI le présente comme son modèle le plus efficace pour les tâches ciblées à fort volume et l'option la moins chère de la famille GPT-6, ce qui en fait le choix naturel pour le résumé, l'extraction, la classification et le routage à grande échelle.
- Il ne sacrifie pas pour autant les limites de la famille : il conserve la fenêtre de contexte de 1 050 000 tokens, dont jusqu'à 922 000 en entrée, 128K tokens de sortie maximale, l'entrée texte et image, les sorties structurées, le streaming, l'usage d'outils et le cache de prompts, avec une date limite de connaissances fixée à mai 2026.
- L'effort de raisonnement va de none à max, medium par défaut, si bien qu'un déploiement à fort volume peut le réduire requête par requête au lieu de changer de modèle.
- Les prompts de plus de 272K tokens d'entrée font passer toute la requête au tarif de contexte long, avec un prix d'entrée doublé et un prix de sortie multiplié par 1,5.
- Comme pour le reste de GPT-6, l'appel de fonctions sur Chat Completions ne marche qu'avec reasoning_effort à none ; utilisez la Responses API lorsque vous avez besoin des outils et du raisonnement ensemble.
- Synthorai propose GPT-6 Luna via la même API compatible OpenAI que le reste de son catalogue.
FAQ
Peut-on essayer l'API GPT-6 Luna gratuitement ?
Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $0.1/M de tokens en entrée, ce crédit couvre à lui seul environ 1,250 requêtes de ~8K tokens sur GPT-6 Luna.
Quels sont les points forts de GPT-6 Luna ?
Le modèle le moins cher de la famille GPT-6 ; conçu pour les tâches ciblées à fort volume ; conserve le contexte complet de 1,05M et 128K de sortie. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.
Combien coûte GPT-6 Luna ?
Sur Synthorai, GPT-6 Luna coûte $0.1 par million de tokens en entrée et $0.5 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.01/M.
GPT-6 Luna prend-il en charge la mise en cache des prompts ?
Oui, automatiquement : les prompts servis par OpenAI sont mis en cache sans modification de code. Les tokens d'entrée en cache sont facturés $0.01/M contre $0.1/M hors cache ; les prompts doivent avoir un préfixe stable de 1,024 tokens pour être mis en cache (TTL 5-10 min, jusqu'à 1 heure). Guide de mise en cache des prompts →
Comment obtenir l'accès à GPT-6 Luna ?
Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="gpt-6-luna", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.
Quelle est la date de coupure des connaissances de GPT-6 Luna ?
La date de coupure des connaissances de GPT-6 Luna est 2026-05, selon la documentation officielle du fournisseur (au 2026-09-23).
Modèles associés
Comparer
Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.