新規 無料登録で、呼び出し 10 回分(最大 $1)をお試しいただけます。カード登録は不要です。

GPT-6 Luna と GPT-5.6 Luna:価格も文量も半分

目次
  1. ベンチマークで GPT-6 Luna と GPT-5.6 Luna を比べると?
  2. 価格以外に何が変わったか?
  3. どう測定したか?
  4. GPT-6 Luna の文量は GPT-5.6 Luna より少ないか?
  5. GPT-6 Luna は内容を省くか?
  6. 文量と抜けた内容を戻すには?
  7. GPT-6 Luna は GPT-5.6 Luna よりどれだけ安いか?
  8. 他の公開テストと結果は一致するか?
  9. 観測結果を踏まえ、どちらを使うべきか?
  10. FAQ

公開ベンチマークでは GPT-6 Luna と GPT-5.6 Luna はほぼ互角です(Artificial Analysis Intelligence Index で 38 対 37)。一方、タスクあたりの費用は約半分です。違いは出力する文章にあります。「Q3 のレビューを書いて」のように目標だけを伝えると、80 件のビジネス文書で GPT-6 Luna の文量は GPT-5.6 Luna の 0.55 倍でした。明示された項目は省略していません。必要項目を列挙した場合、完成度は両モデルで同等です。目標だけの指示で GPT-6 Luna がより頻繁に落とした項目は、インシデントの継続時間だけでした。

TL;DR

  • Artificial Analysis の評価は max effort で GPT-6 Luna が 38、GPT-5.6 Luna が 37。タスクあたりの費用は $0.07 対 $0.18 です。
  • 目標だけを伝えた場合、1 文書あたりの平均は GPT-6 Luna が 384 語、GPT-5.6 Luna が 703 語でした。
  • 目標だけを伝えたインシデントの事後分析 20 件のうち、継続時間が抜けたのは GPT-6 Luna で 9 件、GPT-5.6 Luna で 2 件でした。
  • 必要項目を列挙した場合、要件を満たした文書は GPT-6 Luna が 80 件中 74 件、GPT-5.6 Luna が 69 件。費用は 1,000 件あたり $0.81 対 $1.61 でした。

ベンチマークで GPT-6 Luna と GPT-5.6 Luna を比べると?

一般的なベンチマークでは GPT-6 Luna と GPT-5.6 Luna は同水準で、タスクあたりの費用は 48% から 61% 低くなっています。差が出るのは、採点基準に照らして評価する文書タスクだけです。スコアには reasoning effort を併記しています。これは回答前にどれだけ推論するかを指定する API 設定で、none から max まで選べ、デフォルトは medium です。数値は 2026-10-02 時点で各公開元のページから取得しました。

GPT-6 LunaGPT-5.6 Luna
リリース日2026-09-222026-07-09
定価、入力 / 出力 100 万 token あたり$0.10 / $0.50$0.20 / $1.20
Artificial Analysis Intelligence Index v4.3.2、max(知識、推論、コーディング、エージェント、ビジネス文書の 10 評価)3837
Index のタスクあたり費用$0.07$0.18
Vals Index(コーディング、法律、税務、金融などの専門タスク)51.2%51.7%
Vals のテストあたり費用$0.43$0.82
GDPval-AA v2.1 の Elo、max(非公開の採点基準でビジネス文書を評価。Elo は 1 対 1 の比較によるレーティングで、高いほど良い)14381463
GDPval-AA v2.1 の Elo、medium12621133
出力速度、1 秒あたりの token 数131124

GPT-6 Luna への懸念は GDPval-AA から始まりました。Artificial Analysis はリリース時の分析で、GPT-6 Luna は GPT-5.6 Luna より GDPval-AA で約 75 Elo ポイント、もう一つの文書ベンチマークである AA-Briefcase v1.1 で約 45 ポイント低いと報告しています。原因として挙げたのは「見せ方の品質低下と、採点基準の項目が欠けた成果物」で、レビュアーはこれを「format tax」と呼びました。現在のリーダーボードでは max での差は 25 ポイントです。medium では逆に GPT-6 Luna が 129 ポイント上回っています。

他社製品と比べると、GPT-6 Luna の競合は低価格で高速な flash クラスのモデルです。同じ Index では、max の DeepSeek V4.1 Flash が 39 点でタスクあたり $0.27、high の Gemini 3.8 Flash が 41 点で $1.24 です。GPT-6 Luna はスコアで 1 から 3 ポイント譲る代わりに、タスクあたりの費用を 4 分の 1 から 18 分の 1 に抑えています。ただし出力速度は両モデルのほうが速く、それぞれ毎秒 209 token と 249 token です。

価格以外に何が変わったか?

GPT-6 Luna の制限値と設定は GPT-5.6 Luna と同じです。変わったのはキャッシュ入力の価格と知識のカットオフだけです。両モデルともコンテキストウィンドウは 1,050,000 token、出力上限は 128,000 token です。prompt が 272K token を超えると、リクエスト全体の入力料金が 2 倍、出力料金が 1.5 倍になります。キャッシュ済み入力は 100 万 token あたり $0.02 から $0.01 に下がり、知識のカットオフは 2026 年 2 月 16 日から 5 月 18 日に移りました。Responses API では reasoning.effort で effort を指定します(none、low、medium、high、xhigh、max)。推論の内容は表示されず、出力 token として課金されます。

リリースの 1 週間後、OpenAI は上位クラスの GPT-6 Sol を継ぐ GPT-6.1 Sol を公開しました。GPT-6.1 Sol の測定結果では、回答の長さが以前の水準に戻っています。Luna には更新がなかったため、GPT-6 Luna が何を短く書き、何を省き、どうすれば元の文量に戻るかを測定しました。

どう測定したか?

判定に別のモデルを使わずに済むよう、要件をコードで検証できる文書タスクを用意しました。各タスクでは架空のデータを渡し、それをもとに文書を作成させます。

文書データ読み手が期待する内容
四半期レビュー6 から 12 地域の売上全地域への言及、減少幅が最大の地域の明示
インシデントの事後分析タイムスタンプ付きの 7 から 10 件の出来事全出来事、インシデントの継続時間
ベンダー比較5 から 8 社のホスティング見積もり全ベンダーへの言及
顧客への返信6 から 14 件のサポートチケット全チケットへの返信、顧客名を使った呼びかけ

各タスクについて、同じデータを使い、指示文を 2 種類用意しました。 目標だけを伝える 指示文では、文書の目的だけを指定します(「経営陣向けに Q3 の地域別レビューを書いて」)。評価対象は表の項目だけです。 必要項目を列挙する 指示文では、セクション、件数、語数の範囲を指定し、すべてを評価します。必要項目の欠落、語数不足、件数不足がなければ、要件を満たしたと判定します。目標だけを伝えたベンダー比較は、適切なベンダーの判断が主観的なため、長さだけを集計します。

2026-10-02 に、目標だけを伝える 80 件を両モデルの 5 種類の effort 設定で実行し、GPT-6 Luna ではさらに 1 種類の verbosity 設定で実行しました。必要項目を列挙する 80 件は、両モデルのデフォルトの effort で実行しました。Responses API の呼び出しは合計 1,040 回です。キャッシュから回答が返らないよう、各 prompt に固有のランダム文字列を入れました。費用は OpenAI の定価で計算しています。両モデルには同じタスクを与えたため、比較には正確 McNemar 検定を使いました。これは両モデルの結果が異なるタスクに着目する対応のある検定です。さらに、複数の比較を同時に行う際の判定基準を厳しくする Holm 補正を適用しました。差があると記すのは、補正後も有意なものだけです。

GPT-6 Luna の文量は GPT-5.6 Luna より少ないか?

デフォルトの effort で目標だけを伝えた場合、GPT-6 Luna の文量は GPT-5.6 Luna の 0.55 倍でした。1 文書あたり 384 語対 703 語で、80 件すべてで GPT-6 Luna のほうが短くなりました。どの文書タイプでも短く、差が最大だったのは事後分析(441 語対 981 語)、最小だったのは顧客への返信(576 語対 767 語)です。

必要項目を列挙すると差はなくなり、738 語対 724 語でした。

GPT-6 Luna と GPT-5.6 Luna の回答あたりの語数を示す横棒グラフ。目標だけの指示では effort 設定ごとに GPT-6 Luna が 365 から 436 語、GPT-5.6 Luna が 656 から 727 語。medium では 384 語対 703 語で、要件を満たした文書は 60 件中 51 件対 58 件。必要項目を列挙すると 738 語対 724 語で、要件を満たした文書は 80 件中 74 件対 69 件

デフォルトで短く書く傾向は Luna だけのものではありません。同じタスクで GPT-6 Sol は GPT-5.6 Sol の 592 語に対して 325 語を書き、GPT-6.1 Sol は 565 語まで戻りました。

GPT-6 Luna は内容を省くか?

目標だけを伝えた場合、GPT-6 Luna が GPT-5.6 Luna より頻繁に省いたのは、事後分析におけるインシデントの継続時間だけでした。多くの場合、「インシデント発生時間帯:18:00-18:39 UTC」のように時刻の範囲は示し、差の計算は読み手に任せていました。それ以外は、すべての effort 設定で必要な内容が揃っていました。全地域と減少幅が最大の地域、全出来事、全チケットに対する顧客名を使った返信が含まれています。ただし none では 1 件の例外がありました。

目標だけを伝える指示文GPT-6 Luna の要件充足数GPT-6 Luna で継続時間がない事後分析GPT-5.6 Luna の要件充足数GPT-5.6 Luna で継続時間がない事後分析
none44 / 6015 / 2057 / 603 / 20
low47 / 6013 / 2054 / 606 / 20
medium51 / 609 / 2058 / 602 / 20
high53 / 607 / 2057 / 603 / 20
max59 / 601 / 2060 / 600 / 20

none の差(44 対 57)は補正後も有意でした。medium の差(51 対 58)が有意なのは補正前だけなので、傾向として捉えるべきです。max では両者は互角でした。差はすべて 1 種類の文書に由来します。GPT-6 Luna が事後分析で計算して示すべき数値を省く傾向はありますが、内容を広く省略するわけではありません。

必要項目を列挙すると、要件を満たしたのは GPT-6 Luna が 80 件中 74 件、GPT-5.6 Luna が 69 件で、両者は互角でした。両モデルで要件を満たさなかった文書は、すべてメモまたは影響を説明する段落が指定語数に届かなかったものです。GPT-6 Luna で 6 件、GPT-5.6 Luna で 11 件でした。

文量と抜けた内容を戻すには?

必要な項目を prompt に書けば戻ります。2 つのリクエストパラメータでは戻りません。同じ effort の GPT-6 Luna でも、必要項目を指定すると文量は 384 語から 738 語になり、すべての事後分析で継続時間を明記しました。次のような指示で十分です。

Write the postmortem with these sections: Timeline (a table with every event),
Impact (120-200 words, state the total duration in minutes), Root Cause,
Action Items (5, each ending "Owner: <team>"), Lessons Learned (at least 3 bullets).

text.verbosity は、表示される回答の長さと詳しさを指定する Responses API のパラメータです(low、medium、high)。high にすると、GPT-6 Luna の目標だけを伝えた文書は 7% 長い 410 語になりました。ただし要件充足数は 60 件中 52 件で、元の 51 件と変わりませんでした。

reasoning.effort を上げると、文章の長さよりも推論量が変わります。none から max にすると、GPT-6 Luna の文書は 370 語から 436 語に増え、推論 token は回答あたり 0 から 4,192 に増えました。max では継続時間の欠落は 20 件中 1 件まで減りましたが、費用は medium の 4.5 倍でした。

OpenAI Python SDK で両パラメータを指定する例です。

from openai import OpenAI

client = OpenAI()
prompt = "Write the postmortem with these sections: ..."  # data and required parts
resp = client.responses.create(
    model="gpt-6-luna",
    reasoning={"effort": "medium"},   # none, low, medium (default), high, xhigh, max
    text={"verbosity": "high"},       # 7% longer in our runs; did not change completeness
    input=prompt,
)
print(resp.output_text)
usage = resp.usage
print(usage.output_tokens, usage.output_tokens_details.reasoning_tokens)

output_tokens には推論 token も含まれます。表示される回答の token 数は、2 つの数値の差です。

GPT-6 Luna は GPT-5.6 Luna よりどれだけ安いか?

同じ文書を作る費用は、GPT-6 Luna が GPT-5.6 Luna より 49% 低くなりました。必要項目を列挙した場合、1,000 文書あたり $0.81 対 $1.61 です。単価の引き下げだけなら、節約幅はもっと大きくなるはずです。GPT-5.6 Luna が使った token を GPT-6 Luna の単価で計算し直すと $0.68 で、58% 安くなります。実際の GPT-6 Luna の回答費用はそれより 20% 高くなりました。推論 token が回答あたり 271 から 537 へと約 2 倍になり、出力 token の合計も 1,284 から 1,558 に増えたためです。

目標だけを伝える指示文なら、費用は 1,000 文書あたり $0.54 対 $1.66 で、68% 安くなります。ただし追加の節約分の大半は、GPT-6 Luna の文量が半分になったことによるものです。省かれた半分が不要だった場合に限り、節約と言えます。

速度はほぼ同じです。リクエスト全体の所要時間で割った出力速度は GPT-6 Luna が毎秒 115 token、GPT-5.6 Luna が 125 token でした。目標だけを伝えた文書の所要時間の中央値は 8.1 秒対 11.1 秒で、GPT-6 Luna のほうが書く量が少ない分、早く終わりました。

他の公開テストと結果は一致するか?

比較できる範囲では、今回の結果は公開ベンチマークと一致します。さらに、何が短くなり、何が抜け、どうすれば解消するかが分かりました。

論点他の公開結果今回の測定判断
一般的な能力、GPT-6 Luna と GPT-5.6 Luna の比較Artificial Analysis は 38 対 37、Vals は 51.2% 対 51.7%必要項目を列挙すると、要件を満たした文書は 80 件中 74 件対 69 件で互角一致:同水準
文書の品質GDPval-AA v2.1 の Elo は max で 25 低く、medium で 129 高いmedium では目標だけの指示で文量が 0.55 倍。事後分析で継続時間が抜けたのは 20 件中 9 件対 2 件一部一致:どちらもデフォルトの effort で明確な品質低下を示していない。今回の測定では文量の短縮と、その影響が出た 1 項目を確認した
出力 tokenmax の Index タスクあたり 51K 対 41K で、24% 多いmedium では 1 文書あたり 1,558 対 1,284 で、21% 多い一致
費用Index のタスクあたり 61% 安く、Vals のテストあたり 48% 安い必要項目を列挙すると 49% 安く、目標だけの指示では 68% 安い一致

観測結果を踏まえ、どちらを使うべきか?

prompt を管理できるなら GPT-6 Luna を使い、必要な項目を明記してください。GPT-5.6 Luna を残すのは、prompt を変更できず、読み手が長い文書を期待する場合だけです。根拠は 3 つあります。

  1. GPT-6 Luna は指示された分を書く。目標だけなら短い文書になり、必要項目を列挙すれば GPT-5.6 Luna と同じ文量で項目を満たします。
  2. 省略する内容は限定的。4 種類の文書で、より頻繁に抜けた必要項目はインシデントの継続時間だけでした。
  3. 節約の主因は単価の引き下げ。同じ文書を作る際の出力 token は 21% 多いため、実際の節約率は 49% で、定価の差だけから見込める 58% を下回ります。
用途選択数値
プログラムが読む出力:分類、抽出、ルーティング精度要件を満たす範囲で最も低い effort の GPT-6 Luna定価は入力で 50%、出力で 58% 安い。プログラムが読むなら文章の長さは問題にならない
テンプレートや自分で書いた prompt から作る文書セクション、件数、長さを prompt に指定した GPT-6 Luna要件充足数は 80 件中 74 件対 69 件。1,000 件あたり $0.81 対 $1.61
編集できないエンドユーザーの prompt から作る文書リクエストに必要項目を追加できるなら GPT-6 Luna。できなければ GPT-5.6 Luna目標だけの指示では 384 語対 703 語。事後分析で継続時間が抜けたのは 20 件中 9 件対 2 件
採点基準で評価される成果物採点基準を prompt に入れる。text.verbosity には頼らないverbosity high では要件充足数が 60 件中 52 件対 51 件、文量は 7% 増加

顧客に渡す文書は、どちらのモデルで書いた場合も、送信前に必要項目をコードで確認してください。

FAQ

GPT-6 Luna は GPT-5.6 Luna より性能が低い?
必要項目を prompt に列挙した場合、GPT-6 Luna の要件充足度は GPT-5.6 Luna と同等でした(80 件中 74 件対 69 件)。費用は半分です。目標だけを伝えると文量は約半分になり、事後分析ではインシデントの継続時間を省くことがより多くなりました。

text.verbosity: "high" で GPT-6 Luna の文量は GPT-5.6 Luna と同じになる?
今回の測定では、text.verbosity: "high" によって GPT-6 Luna の文量は 7% 増えました。それでも GPT-5.6 Luna の約 58% の長さで、要件充足度も変わりません。prompt に必要項目を列挙すると、同じ文量になりました。

GPT-6.1 で GPT-6 Luna の短い回答は解消された?
OpenAI の 6.1 アップデートは Sol クラスだけが対象です。GPT-6.1 Sol の文量は再び GPT-5.6 Sol と同程度になりました。GPT-6 Luna は 2026-09-22 のリリース以来、更新されていません。

関連する測定結果:GPT-6.1 Sol と Claude Sonnet 5.5 の比較、flash クラスの LLM 比較、GPT-5.6 の費用を抑える方法。

← ブログに戻る