Nouveau Inscription gratuite, 10 appels offerts. Jusqu'à 1 $, sans carte.

GPT-5.6 Luna

Date de sortie : 2026-07-09

chatVisionCodeAppel d'outilsRaisonnementMise en cache des prompts

GPT-5.6 Luna est le membre le plus rapide et le plus abordable de la famille GPT-5.6 d'OpenAI, décrit sur sa page modèle comme conçu pour les charges à fort volume et sensibles aux coûts telles que le résumé, la rédaction et l'automatisation de routine.

Entrée
texte image $1/M
Sortie
texte $6/M
Lecture de cache
$0.1/M
Contexte
1.1M
vs GPT-4o
~80% moins cher
Coupure des connaissances
2026-02

Benchmarks

Au-dessus de la moyenne15 / 42
GPT-5.6 Luna autres modèles mesurés moyenne des modèles comparés aucun autre modèle n'a fait mieux
SWE-Bench Pro
62.7%
GeneBench Pro
10.8%
OSWorld 2.0
45.6%
ExploitBench (Cap%)
33.2%
HealthBench
55.8%
GDPval-AA v2 Elo · 642-1861
1591.8
GPQA Diamond
92.3%
BrowseComp
83.3%
GDP.pdf no tools
22.7%

Chiffres publiés par les fournisseurs : Alibaba (Qwen) Anthropic ByteDance DeepSeek Google MiniMax Moonshot OpenAI Tencent Z.ai

Le prix en contexte

Position du prix parmi 60 modèles comparables

Entrée$1/M
$0.05 · Qwen3 VL Flash GPT-5.4 Pro · $30
Sortie$6/M
$0.275 · DeepSeek V4 Flash GPT-5.4 Pro · $180
Lecture en cache$0.1/M
$0.0028 · DeepSeek V4 Flash GPT-5.4 Pro · $15

La barre montre où se situe le prix de ce modèle parmi tous les modèles du même type sur Synthorai. Le moins cher et le plus cher sont nommés à chaque extrémité. Ce sont des tarifs de base ; les remises lot, région et écriture en cache figurent sur la page des tarifs.

Spécifications et limites

Tokens

Fenêtre de contexte (spécification du fournisseur) 1 050 000
Sortie max (spéc. fournisseur) 128 000
Coupure des connaissances 2026-02

Mise en cache

Mode automatique
Préfixe min. 1 024
Durée de vie 5-10 min, jusqu'à 1 heure

Raisonnement

Paramètre du fournisseur reasoning.effort
Valeurs acceptées none · low · medium · high · xhigh · max
Valeur par défaut medium appliquée si la requête ne précise rien
Désactivable Oui
Comportement du raisonnement La Responses API accepte également reasoning.mode, soit standard (la valeur par défaut), soit pro ; mode et effort sont des curseurs indépendants.
Paramètre reasoning_effort
Valeurs minimal · low · medium · high la surface de paramètres de la passerelle - le mappage fournisseur ci-dessus s'applique

Modèle

Modalités texte + image → texte
  • Palier GPT-5.6 le plus rapide et le plus abordable, conçu pour les charges de travail à fort volume sensibles au coût (successeur du palier nano)
  • conserve les 1,05M de contexte / 128k de sortie maximale de la famille
  • entrée mise en cache à 10 % du tarif catalogue, avec des écritures de cache à 1,25x
  • les prompts dépassant 272k tokens d'entrée sont facturés 2x en entrée / 1,5x en sortie

selon docs officielles OpenAI ↗

Un prompt, mesuré via la passerelle

PROMPT Explain to a CFO, in exactly three sentences, why our LLM bill doubled after we enabled reasoning. VÉRIFIER exactement 3 phrases

GPT-5.6 Luna réussi · 3 sentences

Enabling reasoning causes the model to use substantially more computational steps and generated tokens per request, even when the visible answer is similar. Because our provider charges based largely on token consumption and compute, that increased processing translated into roughly twice the cost. We can control the expense by reserving reasoning for complex tasks, setting token and effort limits, and monitoring cost per successful outcome.

sortie 146 tok (+60 réflexion) latence 3.1 s

Suivi de l'instruction (exactement trois phrases - comptables), adaptation à l'audience (registre CFO), et l'écart de facturation lié à la réflexion cachée que les compteurs de tokens ci-dessous révèlent.

PROMPT This function is supposed to return the longest run of consecutive equal items, but callers report it is off by one on single-element inputs and misses runs that end at the last index. Fix it and explain the bug in one paragraph. VÉRIFIER le correctif passe les tests

GPT-5.6 Luna réussi · 8/8 cases

```python def longest_run(xs): if not xs: return 0 best = cur = 1 for i in range(1, len(xs)): if xs[i] == xs[i - 1]: cur += 1 else: best = max(best, cur) cur = 1 return max(best, cur) ``` The bug is that `cur` counts equal *transitions* rather than the number of items in the current run, so a single-element run returns `0` and a run of length `n` returns `n - 1`; additionally, `best` is only updated when a run is interrupted, so a run continuing through the final element is not finalized before returning. Initializing the current run to one item, resetting it to one after a change, and taking a final `max` fixes both issues.

sortie 356 tok (+161 réflexion) latence 4.7 s

Si le correctif est réellement juste (exécutable), la densité de l'explication, et l'efficacité en tokens sur une tâche bornée.

PROMPT Extract a JSON object with fields {company, quarter, revenue_usd_m, growth_pct, guidance} from this text. Use null for anything not stated; add no other fields. VÉRIFIER JSON valide, schéma exact

GPT-5.6 Luna réussi · 5/5 fields, guidance "Withheld pending the Q4 close"

{"company":"Meridian Robotics","quarter":"September quarter","revenue_usd_m":412,"growth_pct":null,"guidance":"Withheld pending the Q4 close"}

sortie 227 tok (+181 réflexion) latence 3.6 s

Respect du schéma (aucun champ inventé), pression d'hallucination (guidance est explicitement retenue), et différences de chemin pour la sortie structurée.

PROMPT Write a 120-word product announcement for an API gateway feature that caches prompts across providers. Forbidden words: "seamless", "unlock", "game-changer", "revolutionize", "empower". Exactly one sentence must be a question. VÉRIFIER 120 mots, 0 mot interdit

GPT-5.6 Luna réussi · 120 words, 0 banned, 1 question

Introducing PromptCache, an API gateway feature that caches prompts across providers, helping teams reduce latency, control spend, and deliver consistent results. How much faster could your applications respond when repeated prompts are served from a shared cache instead of being sent upstream? PromptCache supports provider-aware routing, configurable time-to-live policies, encrypted storage, cache invalidation, and usage analytics through one operational layer. It works with language-model providers while preserving your authentication, observability, and fallback workflows. Developers can enable caching by endpoint, model, tenant, or prompt pattern, then monitor hit rates and savings in real time. Built for production workloads, PromptCache gives platform teams controls for performance and cost without requiring application rewrites. […]

sortie 948 tok (+778 réflexion) latence 8.0 s

Respect des contraintes (budget de mots, liste de mots interdits, l'unique question), empreinte stylistique, et contrôle de la longueur.

Utilisez GPT-5.6 Luna en 30 secondes

Compatible OpenAI : changez la base_url, gardez votre SDK. POST /v1/chat/completions

from openai import OpenAI

client = OpenAI(
    base_url="https://synthorai.io/v1",
    api_key="sk-syn-...",
)

resp = client.chat.completions.create(
    model="gpt-5.6-luna",
    messages=[{"role": "user", "content": "Summarize this diff"}],
    reasoning_effort="medium",
)
print(resp.choices[0].message.content)

À propos de GPT-5.6 Luna

  • Les recommandations de sélection d'OpenAI orientent vers Luna pour le travail efficace à fort volume, vers Terra pour de solides performances à un prix inférieur, et vers Sol quand la capacité du modèle phare est l'exigence.
  • Il conserve la fenêtre de contexte complète de la famille, 1 050 000 tokens (spéc. fournisseur), et 128K tokens de sortie maximale, accepte l'entrée d'images, prend en charge les tokens de raisonnement et atteint l'ensemble des outils hébergés, dont la recherche web, la recherche de fichiers, l'interpréteur de code, l'utilisation de l'ordinateur, le shell hébergé, apply patch, les skills, la recherche d'outils et MCP, avec une date limite des connaissances en février 2026.
  • Un effort de raisonnement omis d'une requête se résout à medium dans toute cette génération, et l'échelle atteint le nouveau niveau max pour les cas les plus difficiles.
  • L'entrée mise en cache est facturée au dixième du tarif d'entrée catalogue, avec des écritures en cache à 1,25x, ce qui convient aux pipelines qui réutilisent de longs prompts, tandis que les prompts au-delà de 272K tokens d'entrée sont facturés 2x en entrée et 1,5x en sortie pour la requête entière.
  • L'appel de fonctions, le streaming, les sorties structurées et Batch sont tous pris en charge.
  • Synthorai sert GPT-5.6 Luna via le même endpoint de chat completions compatible OpenAI que tout modèle GPT.

FAQ

Peut-on essayer l'API GPT-5.6 Luna gratuitement ?

Oui : les nouveaux comptes reçoivent 10 appels d'essai et jusqu'à $1 de crédit gratuit, sans carte bancaire. À $1/M de tokens en entrée, ce crédit couvre à lui seul environ 125 requêtes de ~8K tokens sur GPT-5.6 Luna.

Quels sont les points forts de GPT-5.6 Luna ?

Palier GPT-5.6 le plus rapide et le plus abordable ; conserve l'intégralité du contexte de 1 050 000 tokens de la famille ; entrée en cache au dixième du prix catalogue. Voir la section À propos pour le tableau complet, tiré des notes de version officielles du fournisseur.

Combien coûte GPT-5.6 Luna ?

Sur Synthorai, GPT-5.6 Luna coûte $1 par million de tokens en entrée et $6 par million de tokens en sortie, soit le prix catalogue du fournisseur, sans majoration de plateforme. Les tokens d'entrée en cache sont facturés $0.1/M.

GPT-5.6 Luna prend-il en charge la mise en cache des prompts ?

Oui, automatiquement : les prompts servis par OpenAI sont mis en cache sans modification de code. Les tokens d'entrée en cache sont facturés $0.1/M contre $1/M hors cache ; les prompts doivent avoir un préfixe stable de 1,024 tokens pour être mis en cache (TTL 5-10 min, jusqu'à 1 heure). Guide de mise en cache des prompts →

Comment obtenir l'accès à GPT-5.6 Luna ?

Pointez votre SDK OpenAI existant vers base_url="https://synthorai.io/v1", définissez model="gpt-5.6-luna", et c'est tout. Une seule clé API couvre tous les modèles de la passerelle.

Quelle est la date de coupure des connaissances de GPT-5.6 Luna ?

La date de coupure des connaissances de GPT-5.6 Luna est 2026-02, selon la documentation officielle du fournisseur (au 2026-07-10).

Modèles associés

Comparer

Chaque valeur de cette page est transcrite de la documentation du fournisseur, liée ci-dessus, et porte la date de sa vérification. Les prix sont comparés à l'échelle du catalogue ; les valeurs de spécification que les fournisseurs définissent différemment sont présentées avec la différence indiquée plutôt que mises en graphique. Rien ici n'est mesuré par nous, et rien n'est noté.

Obtenez votre clé API Comparez votre coût →