GPT-6 Luna と GPT-5.6 Luna:価格も文量も半分
目次
公開ベンチマークでは GPT-6 Luna と GPT-5.6 Luna はほぼ互角です(Artificial Analysis Intelligence Index で 38 対 37)。一方、タスクあたりの費用は約半分です。違いは出力する文章にあります。「Q3 のレビューを書いて」のように目標だけを伝えると、80 件のビジネス文書で GPT-6 Luna の文量は GPT-5.6 Luna の 0.55 倍でした。明示された項目は省略していません。必要項目を列挙した場合、完成度は両モデルで同等です。目標だけの指示で GPT-6 Luna がより頻繁に落とした項目は、インシデントの継続時間だけでした。
TL;DR
- Artificial Analysis の評価は
maxeffort で GPT-6 Luna が 38、GPT-5.6 Luna が 37。タスクあたりの費用は $0.07 対 $0.18 です。 - 目標だけを伝えた場合、1 文書あたりの平均は GPT-6 Luna が 384 語、GPT-5.6 Luna が 703 語でした。
- 目標だけを伝えたインシデントの事後分析 20 件のうち、継続時間が抜けたのは GPT-6 Luna で 9 件、GPT-5.6 Luna で 2 件でした。
- 必要項目を列挙した場合、要件を満たした文書は GPT-6 Luna が 80 件中 74 件、GPT-5.6 Luna が 69 件。費用は 1,000 件あたり $0.81 対 $1.61 でした。
ベンチマークで GPT-6 Luna と GPT-5.6 Luna を比べると?
一般的なベンチマークでは GPT-6 Luna と GPT-5.6 Luna は同水準で、タスクあたりの費用は 48% から 61% 低くなっています。差が出るのは、採点基準に照らして評価する文書タスクだけです。スコアには reasoning effort を併記しています。これは回答前にどれだけ推論するかを指定する API 設定で、none から max まで選べ、デフォルトは medium です。数値は 2026-10-02 時点で各公開元のページから取得しました。
| GPT-6 Luna | GPT-5.6 Luna | |
|---|---|---|
| リリース日 | 2026-09-22 | 2026-07-09 |
| 定価、入力 / 出力 100 万 token あたり | $0.10 / $0.50 | $0.20 / $1.20 |
| Artificial Analysis Intelligence Index v4.3.2、max(知識、推論、コーディング、エージェント、ビジネス文書の 10 評価) | 38 | 37 |
| Index のタスクあたり費用 | $0.07 | $0.18 |
| Vals Index(コーディング、法律、税務、金融などの専門タスク) | 51.2% | 51.7% |
| Vals のテストあたり費用 | $0.43 | $0.82 |
| GDPval-AA v2.1 の Elo、max(非公開の採点基準でビジネス文書を評価。Elo は 1 対 1 の比較によるレーティングで、高いほど良い) | 1438 | 1463 |
| GDPval-AA v2.1 の Elo、medium | 1262 | 1133 |
| 出力速度、1 秒あたりの token 数 | 131 | 124 |
GPT-6 Luna への懸念は GDPval-AA から始まりました。Artificial Analysis はリリース時の分析で、GPT-6 Luna は GPT-5.6 Luna より GDPval-AA で約 75 Elo ポイント、もう一つの文書ベンチマークである AA-Briefcase v1.1 で約 45 ポイント低いと報告しています。原因として挙げたのは「見せ方の品質低下と、採点基準の項目が欠けた成果物」で、レビュアーはこれを「format tax」と呼びました。現在のリーダーボードでは max での差は 25 ポイントです。medium では逆に GPT-6 Luna が 129 ポイント上回っています。
他社製品と比べると、GPT-6 Luna の競合は低価格で高速な flash クラスのモデルです。同じ Index では、max の DeepSeek V4.1 Flash が 39 点でタスクあたり $0.27、high の Gemini 3.8 Flash が 41 点で $1.24 です。GPT-6 Luna はスコアで 1 から 3 ポイント譲る代わりに、タスクあたりの費用を 4 分の 1 から 18 分の 1 に抑えています。ただし出力速度は両モデルのほうが速く、それぞれ毎秒 209 token と 249 token です。
価格以外に何が変わったか?
GPT-6 Luna の制限値と設定は GPT-5.6 Luna と同じです。変わったのはキャッシュ入力の価格と知識のカットオフだけです。両モデルともコンテキストウィンドウは 1,050,000 token、出力上限は 128,000 token です。prompt が 272K token を超えると、リクエスト全体の入力料金が 2 倍、出力料金が 1.5 倍になります。キャッシュ済み入力は 100 万 token あたり $0.02 から $0.01 に下がり、知識のカットオフは 2026 年 2 月 16 日から 5 月 18 日に移りました。Responses API では reasoning.effort で effort を指定します(none、low、medium、high、xhigh、max)。推論の内容は表示されず、出力 token として課金されます。
リリースの 1 週間後、OpenAI は上位クラスの GPT-6 Sol を継ぐ GPT-6.1 Sol を公開しました。GPT-6.1 Sol の測定結果では、回答の長さが以前の水準に戻っています。Luna には更新がなかったため、GPT-6 Luna が何を短く書き、何を省き、どうすれば元の文量に戻るかを測定しました。
どう測定したか?
判定に別のモデルを使わずに済むよう、要件をコードで検証できる文書タスクを用意しました。各タスクでは架空のデータを渡し、それをもとに文書を作成させます。
| 文書 | データ | 読み手が期待する内容 |
|---|---|---|
| 四半期レビュー | 6 から 12 地域の売上 | 全地域への言及、減少幅が最大の地域の明示 |
| インシデントの事後分析 | タイムスタンプ付きの 7 から 10 件の出来事 | 全出来事、インシデントの継続時間 |
| ベンダー比較 | 5 から 8 社のホスティング見積もり | 全ベンダーへの言及 |
| 顧客への返信 | 6 から 14 件のサポートチケット | 全チケットへの返信、顧客名を使った呼びかけ |
各タスクについて、同じデータを使い、指示文を 2 種類用意しました。 目標だけを伝える 指示文では、文書の目的だけを指定します(「経営陣向けに Q3 の地域別レビューを書いて」)。評価対象は表の項目だけです。 必要項目を列挙する 指示文では、セクション、件数、語数の範囲を指定し、すべてを評価します。必要項目の欠落、語数不足、件数不足がなければ、要件を満たしたと判定します。目標だけを伝えたベンダー比較は、適切なベンダーの判断が主観的なため、長さだけを集計します。
2026-10-02 に、目標だけを伝える 80 件を両モデルの 5 種類の effort 設定で実行し、GPT-6 Luna ではさらに 1 種類の verbosity 設定で実行しました。必要項目を列挙する 80 件は、両モデルのデフォルトの effort で実行しました。Responses API の呼び出しは合計 1,040 回です。キャッシュから回答が返らないよう、各 prompt に固有のランダム文字列を入れました。費用は OpenAI の定価で計算しています。両モデルには同じタスクを与えたため、比較には正確 McNemar 検定を使いました。これは両モデルの結果が異なるタスクに着目する対応のある検定です。さらに、複数の比較を同時に行う際の判定基準を厳しくする Holm 補正を適用しました。差があると記すのは、補正後も有意なものだけです。
GPT-6 Luna の文量は GPT-5.6 Luna より少ないか?
デフォルトの effort で目標だけを伝えた場合、GPT-6 Luna の文量は GPT-5.6 Luna の 0.55 倍でした。1 文書あたり 384 語対 703 語で、80 件すべてで GPT-6 Luna のほうが短くなりました。どの文書タイプでも短く、差が最大だったのは事後分析(441 語対 981 語)、最小だったのは顧客への返信(576 語対 767 語)です。
必要項目を列挙すると差はなくなり、738 語対 724 語でした。
デフォルトで短く書く傾向は Luna だけのものではありません。同じタスクで GPT-6 Sol は GPT-5.6 Sol の 592 語に対して 325 語を書き、GPT-6.1 Sol は 565 語まで戻りました。
GPT-6 Luna は内容を省くか?
目標だけを伝えた場合、GPT-6 Luna が GPT-5.6 Luna より頻繁に省いたのは、事後分析におけるインシデントの継続時間だけでした。多くの場合、「インシデント発生時間帯:18:00-18:39 UTC」のように時刻の範囲は示し、差の計算は読み手に任せていました。それ以外は、すべての effort 設定で必要な内容が揃っていました。全地域と減少幅が最大の地域、全出来事、全チケットに対する顧客名を使った返信が含まれています。ただし none では 1 件の例外がありました。
| 目標だけを伝える指示文 | GPT-6 Luna の要件充足数 | GPT-6 Luna で継続時間がない事後分析 | GPT-5.6 Luna の要件充足数 | GPT-5.6 Luna で継続時間がない事後分析 |
|---|---|---|---|---|
none | 44 / 60 | 15 / 20 | 57 / 60 | 3 / 20 |
low | 47 / 60 | 13 / 20 | 54 / 60 | 6 / 20 |
medium | 51 / 60 | 9 / 20 | 58 / 60 | 2 / 20 |
high | 53 / 60 | 7 / 20 | 57 / 60 | 3 / 20 |
max | 59 / 60 | 1 / 20 | 60 / 60 | 0 / 20 |
none の差(44 対 57)は補正後も有意でした。medium の差(51 対 58)が有意なのは補正前だけなので、傾向として捉えるべきです。max では両者は互角でした。差はすべて 1 種類の文書に由来します。GPT-6 Luna が事後分析で計算して示すべき数値を省く傾向はありますが、内容を広く省略するわけではありません。
必要項目を列挙すると、要件を満たしたのは GPT-6 Luna が 80 件中 74 件、GPT-5.6 Luna が 69 件で、両者は互角でした。両モデルで要件を満たさなかった文書は、すべてメモまたは影響を説明する段落が指定語数に届かなかったものです。GPT-6 Luna で 6 件、GPT-5.6 Luna で 11 件でした。
文量と抜けた内容を戻すには?
必要な項目を prompt に書けば戻ります。2 つのリクエストパラメータでは戻りません。同じ effort の GPT-6 Luna でも、必要項目を指定すると文量は 384 語から 738 語になり、すべての事後分析で継続時間を明記しました。次のような指示で十分です。
Write the postmortem with these sections: Timeline (a table with every event),
Impact (120-200 words, state the total duration in minutes), Root Cause,
Action Items (5, each ending "Owner: <team>"), Lessons Learned (at least 3 bullets).
text.verbosity は、表示される回答の長さと詳しさを指定する Responses API のパラメータです(low、medium、high)。high にすると、GPT-6 Luna の目標だけを伝えた文書は 7% 長い 410 語になりました。ただし要件充足数は 60 件中 52 件で、元の 51 件と変わりませんでした。
reasoning.effort を上げると、文章の長さよりも推論量が変わります。none から max にすると、GPT-6 Luna の文書は 370 語から 436 語に増え、推論 token は回答あたり 0 から 4,192 に増えました。max では継続時間の欠落は 20 件中 1 件まで減りましたが、費用は medium の 4.5 倍でした。
OpenAI Python SDK で両パラメータを指定する例です。
from openai import OpenAI
client = OpenAI()
prompt = "Write the postmortem with these sections: ..." # data and required parts
resp = client.responses.create(
model="gpt-6-luna",
reasoning={"effort": "medium"}, # none, low, medium (default), high, xhigh, max
text={"verbosity": "high"}, # 7% longer in our runs; did not change completeness
input=prompt,
)
print(resp.output_text)
usage = resp.usage
print(usage.output_tokens, usage.output_tokens_details.reasoning_tokens)
output_tokens には推論 token も含まれます。表示される回答の token 数は、2 つの数値の差です。
GPT-6 Luna は GPT-5.6 Luna よりどれだけ安いか?
同じ文書を作る費用は、GPT-6 Luna が GPT-5.6 Luna より 49% 低くなりました。必要項目を列挙した場合、1,000 文書あたり $0.81 対 $1.61 です。単価の引き下げだけなら、節約幅はもっと大きくなるはずです。GPT-5.6 Luna が使った token を GPT-6 Luna の単価で計算し直すと $0.68 で、58% 安くなります。実際の GPT-6 Luna の回答費用はそれより 20% 高くなりました。推論 token が回答あたり 271 から 537 へと約 2 倍になり、出力 token の合計も 1,284 から 1,558 に増えたためです。
目標だけを伝える指示文なら、費用は 1,000 文書あたり $0.54 対 $1.66 で、68% 安くなります。ただし追加の節約分の大半は、GPT-6 Luna の文量が半分になったことによるものです。省かれた半分が不要だった場合に限り、節約と言えます。
速度はほぼ同じです。リクエスト全体の所要時間で割った出力速度は GPT-6 Luna が毎秒 115 token、GPT-5.6 Luna が 125 token でした。目標だけを伝えた文書の所要時間の中央値は 8.1 秒対 11.1 秒で、GPT-6 Luna のほうが書く量が少ない分、早く終わりました。
他の公開テストと結果は一致するか?
比較できる範囲では、今回の結果は公開ベンチマークと一致します。さらに、何が短くなり、何が抜け、どうすれば解消するかが分かりました。
| 論点 | 他の公開結果 | 今回の測定 | 判断 |
|---|---|---|---|
| 一般的な能力、GPT-6 Luna と GPT-5.6 Luna の比較 | Artificial Analysis は 38 対 37、Vals は 51.2% 対 51.7% | 必要項目を列挙すると、要件を満たした文書は 80 件中 74 件対 69 件で互角 | 一致:同水準 |
| 文書の品質 | GDPval-AA v2.1 の Elo は max で 25 低く、medium で 129 高い | medium では目標だけの指示で文量が 0.55 倍。事後分析で継続時間が抜けたのは 20 件中 9 件対 2 件 | 一部一致:どちらもデフォルトの effort で明確な品質低下を示していない。今回の測定では文量の短縮と、その影響が出た 1 項目を確認した |
| 出力 token | max の Index タスクあたり 51K 対 41K で、24% 多い | medium では 1 文書あたり 1,558 対 1,284 で、21% 多い | 一致 |
| 費用 | Index のタスクあたり 61% 安く、Vals のテストあたり 48% 安い | 必要項目を列挙すると 49% 安く、目標だけの指示では 68% 安い | 一致 |
観測結果を踏まえ、どちらを使うべきか?
prompt を管理できるなら GPT-6 Luna を使い、必要な項目を明記してください。GPT-5.6 Luna を残すのは、prompt を変更できず、読み手が長い文書を期待する場合だけです。根拠は 3 つあります。
- GPT-6 Luna は指示された分を書く。目標だけなら短い文書になり、必要項目を列挙すれば GPT-5.6 Luna と同じ文量で項目を満たします。
- 省略する内容は限定的。4 種類の文書で、より頻繁に抜けた必要項目はインシデントの継続時間だけでした。
- 節約の主因は単価の引き下げ。同じ文書を作る際の出力 token は 21% 多いため、実際の節約率は 49% で、定価の差だけから見込める 58% を下回ります。
| 用途 | 選択 | 数値 |
|---|---|---|
| プログラムが読む出力:分類、抽出、ルーティング | 精度要件を満たす範囲で最も低い effort の GPT-6 Luna | 定価は入力で 50%、出力で 58% 安い。プログラムが読むなら文章の長さは問題にならない |
| テンプレートや自分で書いた prompt から作る文書 | セクション、件数、長さを prompt に指定した GPT-6 Luna | 要件充足数は 80 件中 74 件対 69 件。1,000 件あたり $0.81 対 $1.61 |
| 編集できないエンドユーザーの prompt から作る文書 | リクエストに必要項目を追加できるなら GPT-6 Luna。できなければ GPT-5.6 Luna | 目標だけの指示では 384 語対 703 語。事後分析で継続時間が抜けたのは 20 件中 9 件対 2 件 |
| 採点基準で評価される成果物 | 採点基準を prompt に入れる。text.verbosity には頼らない | verbosity high では要件充足数が 60 件中 52 件対 51 件、文量は 7% 増加 |
顧客に渡す文書は、どちらのモデルで書いた場合も、送信前に必要項目をコードで確認してください。
FAQ
GPT-6 Luna は GPT-5.6 Luna より性能が低い?
必要項目を prompt に列挙した場合、GPT-6 Luna の要件充足度は GPT-5.6 Luna と同等でした(80 件中 74 件対 69 件)。費用は半分です。目標だけを伝えると文量は約半分になり、事後分析ではインシデントの継続時間を省くことがより多くなりました。
text.verbosity: "high" で GPT-6 Luna の文量は GPT-5.6 Luna と同じになる?
今回の測定では、text.verbosity: "high" によって GPT-6 Luna の文量は 7% 増えました。それでも GPT-5.6 Luna の約 58% の長さで、要件充足度も変わりません。prompt に必要項目を列挙すると、同じ文量になりました。
GPT-6.1 で GPT-6 Luna の短い回答は解消された?
OpenAI の 6.1 アップデートは Sol クラスだけが対象です。GPT-6.1 Sol の文量は再び GPT-5.6 Sol と同程度になりました。GPT-6 Luna は 2026-09-22 のリリース以来、更新されていません。
関連する測定結果:GPT-6.1 Sol と Claude Sonnet 5.5 の比較、flash クラスの LLM 比較、GPT-5.6 の費用を抑える方法。