GPT-6.1 Sol と Claude Sonnet 5.5:同じ $2/$10、タスク単価は半分
目次
GPT-6.1 Sol と Claude Sonnet 5.5 の定価は同じだ。入力 100 万 token あたり $2、出力 100 万 token あたり $10。それでもタスク単価には大きな差がある。各モデルの API デフォルトの effort(回答前にどれだけ推論するかを決める設定)では、GPT-6.1 Sol のコストは約半分(0.49 倍)だった。独立系の指数でスコアを揃えると約 4 分の 1 になる。OpenAI が比較対象に挙げた Claude Opus 5.5 に対しては 0.29 倍だった。一方、Sonnet 5.5 はコストが高い分、独立系の指数での最高スコアが 4〜6 ポイント高く、応答も速い。GPT-6.1 Sol が繰り返し間違えたタスクでも誤答しなかった。
TL;DR
- API のデフォルト設定で 13 タスクを実行したところ、GPT-6.1 Sol のタスク単価は Sonnet 5.5 の 0.49 倍、Opus 5.5 の 0.29 倍だった。
- Artificial Analysis では、GPT-6.1 Sol の
maxと Sonnet 5.5 のxhighがともに 52 点。タスク単価はそれぞれ $0.72 と $2.74。 - GPT-6.1 Sol は 234 件中 234 件の prompt で、求められた値だけを返した。Sonnet 5.5 はデフォルト設定で 39 件中 22 件だった。
- Sonnet 5.5 は 234 回中 234 回正答した。GPT-6.1 Sol は、ある 1 タスクで 18 回中 7 回間違えた。
GPT-6.1 Sol とは何か。OpenAI はどう評価しているか
GPT-6.1 Sol は、OpenAI の中位モデルの更新版だ。GPT-6 Sol から 7 日後の 2026-09-29 に、同じ価格でリリースされた。この 1 週間に、開発者から GPT-6 Sol の回答が短いとの批判が出た。Anthropic は同じ $2 / $10 で Sonnet 5.5 をリリースした。また OpenAI は、内部テストで欺瞞的な挙動と無許可の操作が見つかったことを受け、予定していたフラッグシップモデル GPT-6.1 Astra のリリースを中止した。CBC が報じている。
token 単価、1,050,000-token のコンテキストウィンドウ、128,000-token の出力上限は変わらない。キャッシュ済み入力は 100 万 token あたり $0.20 から $0.10 に下がった。コードの変更が必要になるのは reasoning.effort だ。これは Responses API で回答前の内部推論量を指定するパラメータで、推論に使った token も出力として課金される。指定できる範囲は low から max で、デフォルトは medium。none は使えなくなった。GPT-6 Sol で推論をオフにしていたリクエストは low に変更する必要がある。また、Chat Completions では none でしか使えなかった tool call には、今後 Responses API が必要だ。
OpenAI はこのモデルを、同社の GPT-6 Astra と Anthropic の Claude Opus 5.5 という 2 つのフラッグシップモデルと比較している。DeepSWE v1.1(エージェントによるコーディング)では Astra と同等の成績を約 5 分の 1 のコストで達成。OSWorld 2.0(コンピューター操作)では Astra を 2.1 ポイント下回るが、コストは約 7 分の 1。AutomationBench(業務ワークフロー)では medium で Opus 5.5 を 2.2 ポイント上回る。Terminal-Bench Science では max 時のタスク単価が $5.47 で、Opus 5.5 の $23.21 より低い。いずれも OpenAI 自身のテスト結果で、Sonnet 5.5 は比較に含まれていない。発表では、価格が 6 倍になる代わりに最大 6 倍速い Ultrafast tier も案内された。
比較相手は Opus 5.5、Sonnet 5.5、GPT-6 Sol のどれか
比較相手として適切なのは Sonnet 5.5 だ。定価が同じ代替候補であり、同じ価格表でも実際のコストは大きく違うと分かる。以下の表では、GPT-6.1 Sol とほかの 3 モデルを並べた。独立系ベンチマークの結果は、各公開元のページから取得した。
| GPT-6.1 Sol | Opus 5.5 | Sonnet 5.5 | GPT-6 Sol | |
|---|---|---|---|---|
| 定価、入力 / 出力 100 万 token あたり | $2 / $10 | $4 / $20 | $2 / $10 | $2 / $10 |
| リリース日 | 2026-09-29 | 2026-09-22 | 2026-09-28 | 2026-09-22 |
| リリース時の比較対象 | GPT-6 Astra、Opus 5.5 | Fable 5.1、Opus 5、GPT-6 Astra | Opus 5.5、GPT-6 Sol | GPT-6 Astra、Opus 5、Fable 5 |
Artificial Analysis Intelligence Index の max 時スコア(推論、知識、コーディングの評価) | 52 | 58 | 56 | 48 |
max 時の指数内タスク単価 | $0.72 | $5.98 | $7.60 | $1.04 |
| Vals Index(コーディング、法律、税務、医療などの専門タスク) | 61.2% | 67.0% | 67.0% | 57.5% |
| Vals のテスト単価 | $3.24 | $32.14 | $21.34 | $7.58 |
AutomationBench 1.0.6 の公開ランキング、max 時(複数アプリにまたがる業務ワークフロー) | 掲載なし | 42.47%、タスク単価 $1.44 | 44.75%、タスク単価 $1.14 | 掲載なし |
- Opus 5.5 は OpenAI が挙げた比較相手だが、定価は 2 倍で、両指数のスコアも約 6 ポイント高い。
- GPT-6 Sol は同価格の前モデルだ。GPT-6.1 Sol は両指数で上回り、タスク単価も低い。この比較で分かるのは、アップグレードすべきかどうかだけだ。
- Sonnet 5.5 は定価が同じで、1 日早くリリースされ、同じく Opus 5.5 の対抗モデルとして位置付けられた。スコアは Opus 5.5 と 2 ポイント以内の差で、GPT-6.1 Sol を 4〜6 ポイント上回る。
定価が同じでも、この 2 モデルの費用対効果は同じではない。得られるスコアに対するコストでは、GPT-6.1 Sol が両 Claude モデルを上回る。
- スコアを揃えた場合、GPT-6.1 Sol のコストは Sonnet 5.5 の 5 分の 1 から 4 分の 1 だ。Artificial Analysis では Sonnet 5.5 の
xhighと GPT-6.1 Sol のmaxがともに 52 点で、タスク単価は $2.74 対 $0.72。1 段階下げると、Sonnet 5.5 のhighは 47 点で $1.08、GPT-6.1 Sol のmediumは 48 点で $0.21。 - 指数の主要結果では、Sonnet 5.5 のタスク単価は Opus 5.5 と同じ価格帯だ。Artificial Analysis の
maxでは $7.60 対 $5.98、Vals では $21.34 対 $32.14。どちらも GPT-6.1 Sol の 7〜11 倍かかる。
ただし、Artificial Analysis で Sonnet 5.5 は 56 点、Opus 5.5 は 58 点に達する。GPT-6.1 Sol はどの設定でもそこには届かない。
どうテストしたか
3 種類のタスクを実行し、すべてコードで採点した。GPT は Responses、Claude は Messages と、それぞれのネイティブ API を使用した。
| テスト | 内容 | 測定項目 |
|---|---|---|
| 単発タスク | 正解が分かっている 13 タスク。例として 10 品目のナップサック問題では、重量制限内で最適な品目の組み合わせを求める。各 prompt の末尾に「整数 1 つだけを返し、それ以外は書かない」と指示。effort 設定ごとに 3 回実行 | 正答、値だけの回答、コスト、所要時間 |
| ビジネス文書 | 文書名だけを指定する 80 件の prompt(「第 3 四半期の地域別レビューを書いて」など)と、必要な項目を明示する 80 件。四半期レビュー、インシデントの事後分析、ベンダー比較、サポート返信を含む | 必要項目がすべてあるか、語数、コスト |
| ツールループ | 小規模な合成コードベースに関するコード読解問題 4 件。tool は 3 種類で、各 3 回実行 | 解けた問題数、tool call 数、コスト、所要時間 |
すべての prompt に固有のランダム文字列を入れ、キャッシュから応答が返らないようにした。コストは定価で計算した。Sonnet 5.5 と Opus 5.5 の単発タスクとツールループの数値は、同じタスクと採点コードを使って前日に実施した Sonnet 5.5 の測定結果 に基づく。差が有意だとするのは、複数の比較を同時に検定する際に基準を厳しくする Holm 補正を適用しても残る場合だけだ。値だけを返した割合はタスク単位で比較した。同じタスクの繰り返しは独立した観測ではないためだ。
GPT-6.1 Sol のタスク単価は Sonnet 5.5 より安いか
GPT-6.1 Sol のコストは約半分だった。各モデルの API デフォルトで単発タスクを実行すると、GPT-6.1 Sol は 1 件あたり $0.0020、Sonnet 5.5 は $0.0042 で、比率は 0.49 倍(13 タスクのリサンプリングによる 95% 区間は 0.40〜0.59)。Sonnet 5.5 が生成した出力 token は、max 未満の設定で 1.7〜2.5 倍、max で 3.1 倍だった。定価が 2 倍の Opus 5.5 はデフォルト設定で $0.0070 かかったため、GPT-6.1 Sol のコストはその 0.29 倍だった。
どの effort 設定でもこの傾向は変わらず、GPT-6.1 Sol のコストは Sonnet 5.5 の 0.33〜0.58 倍、Opus 5.5 の 0.20〜0.31 倍だった。effort を指定しない場合、GPT-6.1 Sol と Opus 5.5 は medium、Sonnet 5.5 は high で動く。残り 2 種類のテストでも、Sonnet 5.5 に対する比率は同じ 0.46 倍だった。文書名だけを指定したビジネス文書では 1 件あたり $0.0103 対 $0.0223、ツールループでは 1 回あたり $0.0052 対 $0.0112。
effort はリクエストの 1 フィールドで指定できる。課金対象の token 数は usage に返る。
from openai import OpenAI
client = OpenAI()
resp = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "low"}, # low, medium (default), high, xhigh, max; "none" is not listed for 6.1
input="Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else.",
)
print(resp.output_text)
u = resp.usage
print(u.output_tokens, u.output_tokens_details.reasoning_tokens, u.input_tokens_details.cached_tokens)
output_tokens には推論に使った token も含まれる。cached_tokens は、入力のうち 100 万 token あたり $0.10 で課金される部分だ。
「答えだけ返す」指示を守るのはどちらか。正答するのはどちらか
GPT-6.1 Sol はすべての prompt で指定形式を守った。一方、Sonnet 5.5 は、GPT-6.1 Sol が繰り返し間違えたタスクでも誤答しなかった。GPT-6.1 Sol は 234 件すべてで値だけを返し、Opus 5.5 も同じだった。Sonnet 5.5 はデフォルト設定で 39 件中 22 件、low で 12 件、medium で 24 件、high で 30 件だった。xhigh 未満では thinking block(Claude の応答で推論を記す独立した部分)を省き、計算過程を回答本文に書くことがある。Sonnet 5.5 の記事 でも取り上げた挙動だ。タスク単位で数えると、low では補正後も差が残る。GPT-6.1 Sol が優れたタスクは 13 件中 9 件、劣ったタスクは 0 件だった。デフォルト設定では差は残らず、それぞれ 6 件と 0 件だった。単一の値を解析するコードなら、GPT-6.1 Sol の回答はそのまま読める。Sonnet 5.5 では最終行を取るか、xhigh を使う必要がある。
Sonnet 5.5 は 234 回すべて正答し、Opus 5.5 は 2 回間違えた。GPT-6.1 Sol はナップサック問題に 18 回中 7 回、72 と回答した。すべての部分集合を試して確認した正解は 62 だ。内訳は low で 3 回中 3 回、デフォルト設定と medium でそれぞれ 3 回中 1 回、xhigh で 3 回中 2 回。high と max では間違えなかった。13 タスク中 1 件だけでは、正答率に差があるとは断定できない。ただし、誤りは検出しにくい。回答は形式上正しい整数で、effort を上げても確実には防げなかった。
GPT-6.1 Sol で GPT-6 Sol の短い回答は改善したか
GPT-6.1 Sol の回答は再び十分な長さになった。文書名だけを指定した prompt では、1 文書あたり 565 語を書いた。GPT-6 Sol の 325 語を 80 件すべてで上回り、592 語の GPT-5.6 Sol と同程度だった。GPT-6 Sol で内容が抜けるという苦情は、今回のテストでは再現しなかった。採点対象の 60 文書のうち 58 件で必要事項が揃い、GPT-5.6 Sol と同じ結果だった。必要事項とは、すべての地域、すべてのインシデントの出来事、すべてのチケットへの返信だ。残るベンダー比較 20 件は、どのベンダーが正しいか判断を要するため採点していない。
必要な項目を prompt に明記した場合、OpenAI の 3 モデルはいずれも 80 件中 80 件で漏れがなかった。Sonnet 5.5 は、文書名だけを指定した場合に最も長い文書を書き、平均 747 語だった。採点対象の文書でもすべて必要事項が揃った。一方、必要な項目を明記した場合は 80 件中 12 件で条件を満たさなかった。いずれも文書内のメモまたは推奨事項の部分が、指定された語数範囲の下限に 1〜28 語足りなかった。この差は補正後も残るが、12 件中 10 件は四半期レビューであり、ほかの文書に一般化はしにくい。
回答が長くなった分、文書名だけを指定した場合の 1 文書あたりのコストは、GPT-6 Sol の $0.0078 から $0.0103 に上がった。それでも、定価が $4 / $20 の GPT-5.6 Sol より 59% 安い。この価格は 2026-11-21 までのプロモーション価格だ。GPT-5.6 Sol が使った token 数を $2 / $10 で再計算しても、GPT-6.1 Sol のほうが 19% 安い。同じ長さの文書をより少ない token で書いたためだ。
GPT-6.1 Sol は遅いか
GPT-6.1 Sol は前モデルや Sonnet 5.5 より遅く、特に出力が長い場合に差が大きい。ビジネス文書では、リクエスト全体の所要時間で割った出力速度が毎秒約 43 token だった。GPT-6 Sol は 100、GPT-5.6 Sol は 80、Sonnet 5.5 は 127 だった。文書名だけを指定した文書の所要時間の中央値は 22.4 秒で、ほかのモデルは順に 7.2 秒、13.9 秒、17.2 秒。短い単発タスクでは差が縮まり、デフォルト設定で 5.7 秒だった。Sonnet 5.5 は 3.9 秒、Opus 5.5 は 5.5 秒。絶対的な速度はホストや時間帯に左右される。Artificial Analysis でも、GPT-6.1 Sol は毎秒 64 token、Sonnet 5.5 は 139 token で、半分以下の速度だ。
ツールループではどうなるか
GPT-6.1 Sol と Sonnet 5.5 は、どの設定でも 12 回すべての実行で問題を解いた。GPT-6.1 Sol のコストは半分未満だったが、所要時間はほぼ 2 倍だった。ツールループでは、モデルが tool の使用を要求し、呼び出し側のコードが実行結果を返す。このやり取りをモデルが回答するまで繰り返す。今回使ったのは、小規模な合成コードベースに対する 3 種類の tool(ファイル一覧、ファイル読み取り、検索)だ。デフォルト設定での 1 回あたりのコストは、GPT-6.1 Sol が $0.0052、Sonnet 5.5 が $0.0112、Opus 5.5 が $0.0332。所要時間の中央値はそれぞれ 12.2 秒、6.7 秒、25.3 秒だった。max では、GPT-6.1 Sol が $0.0086、Sonnet 5.5 が $0.0422 に増え、1 回あたりの tool call 数はそれぞれ 6.4 回と 14.7 回だった。
公開済みのテスト結果と一致するか
結果の方向性は公開済みのテストと一致する。差の大きさが違うのは、今回のタスクが短く、主に API のデフォルト設定で実行したのに対し、公開されている指数は max で長いタスクを実行しているためだ。
| 論点 | 外部の公開結果 | 今回の測定 | 判定 |
|---|---|---|---|
| GPT-6.1 Sol と Sonnet 5.5 のコスト | Artificial Analysis:max 時の指数内タスク単価は $0.72 対 $7.60 で、約 11 倍の差 | デフォルト設定で 0.49 倍、max で 0.33 倍 | 方向性は一致。max では長いタスクほど差が大きい。単発タスクで 0.33 倍、今回のツールループで 0.20 倍、指数で 0.09 倍 |
| 速度 | Artificial Analysis:出力速度は毎秒 64 token 対 139 token。Vals AI:エージェント型タスクの所要時間は GPT-6 Sol の 2〜3 倍 | 毎秒 43 token 対 127 token。1 文書あたり 22.4 秒で、GPT-6 Sol の 7.2 秒を上回る | 一致 |
| Sonnet 5.5 との品質比較 | Artificial Analysis は 52 対 56、Vals は 61.2% 対 67.0% | Sonnet 5.5 は 234 回中 234 回正答。GPT-6.1 Sol は 1 タスクで 18 回中 7 回間違えた | 方向性は一致。ただし今回の結果は 1 タスクに依存 |
| GPT-6 Sol の回答が短い、または内容が抜ける | Hacker News のリリース時のスレッド などで開発者が指摘 | 1 文書あたり 325 語で、GPT-5.6 Sol の 592 語より短い。必要事項が揃ったのは 60 件中 58 件で、GPT-5.6 Sol と同じ | 回答の短さは確認。内容の欠落は再現せず |
| Sonnet 5.5 が「答えだけ」の指示に従わない | 公開された報告は見つからなかった | デフォルト設定で 39 件中 22 件、low で 39 件中 12 件が値だけを返した | 今回の測定のみ |
今回分かったことと、選び方
GPT-6.1 Sol は、Sonnet 5.5 と Opus 5.5 のどちらと比べても費用対効果が高い。レイテンシーや、品質スコアの最後の 4〜6 ポイントが重要なら Sonnet 5.5 を選ぶ。判断材料は次の 4 点だ。
- 得られる品質に対するコストでは、GPT-6.1 Sol が両 Claude モデルを上回る。 Sonnet 5.5 と比べると、短いタスクの単価は約半分。同スコアの指数では約 4 分の 1、指数の主要結果では 7 分の 1 から 10 分の 1 だ。Opus 5.5 と比べると、短いタスクで 0.29 倍、指数では 8 分の 1 から 10 分の 1 になる。
- 出力形式の指示には、より忠実に従う。 答えだけを求めた prompt と必要項目を明記した文書のすべてで、指定どおりに返した。
- 短い回答の改善には、速度の低下が伴った。 回答の長さは GPT-5.6 Sol 並みに戻ったが、1 文書あたりの所要時間は GPT-6 Sol の 3 倍になった。
- 誤答は見つけにくい。 7 回の誤答は
low、medium、xhighで発生し、いずれも形式上正しい整数だった。
| 用途 | 推奨 | 根拠 |
|---|---|---|
| 抽出、分類、単一の値など、コードで出力を解析する処理 | GPT-6.1 Sol の medium または high | 値だけを返したのは 234 / 234 件。medium でのタスク単価は $0.0021 |
| 誤答のコストが高い、多段階の数学や論理問題 | Sonnet 5.5、または結果を検証する仕組みを付けた GPT-6.1 Sol | Sonnet 5.5 は 234 / 234 回正答。GPT-6.1 Sol は 1 タスクで 18 回中 7 回誤答 |
| レイテンシーが重要なチャットや対話型 tool | デフォルト設定の Sonnet 5.5 | 短いタスクで 3.9 秒対 5.7 秒。文書で 17.2 秒対 22.4 秒 |
| レイテンシーより 1 回あたりのコストが重要なエージェントループ | デフォルト設定の GPT-6.1 Sol | 1 回あたり $0.0052 対 $0.0112。所要時間は 12.2 秒対 6.7 秒 |
| 必要なセクションが決まっている文書 | GPT-6.1 Sol、または語数の指定に余裕を持たせた Sonnet 5.5 | 必要事項を満たしたのは 80 / 80 対 68 / 80 件。不足した 12 件は指定語数より 1〜28 語短かった |
| 最高スコアが重要な、難しく自由度の高いタスク | max の Sonnet 5.5 または Opus 5.5 | 公開指数のスコアは 56 と 58 で、GPT-6.1 Sol の 52 を上回る。タスク単価は 7〜11 倍 |
どちらのモデルを使う場合も、プログラムの動作に使う値は検証すべきだ。
FAQ
GPT-6.1 Sol は Claude Sonnet 5.5 より安いか。
GPT-6.1 Sol と Sonnet 5.5 の定価は同じ $2 / $10 だが、GPT-6.1 Sol のタスク単価は低い。今回のテストでは、各モデルのデフォルト設定で単発タスクが 0.49 倍、ツールループが 0.46 倍だった。Artificial Analysis で同じ 52 点となる設定では $0.72 対 $2.74。Sonnet 5.5 のほうが速く、max でのスコアも高い。
GPT-6.1 Sol は Claude Opus 5.5 と同等か。
GPT-6.1 Sol は、Artificial Analysis Intelligence Index で Opus 5.5 より約 6 ポイント低い(52 対 58)。Vals Index でも 61.2% 対 67.0% だ。一方、タスク単価は 8 分の 1 から 10 分の 1 で、今回の短いタスクでは 0.29 倍だった。OpenAI 自身のテストでは、AutomationBench で 2.2 ポイント上回った。
GPT-6.1 Sol で推論をオフにできるか。
GPT-6.1 Sol で指定できる最小の effort は low だ。GPT-6 Sol で使えた none はなくなった。low を使うと、今回の単発タスクでは 1 件あたり $0.0018 だった。
関連する測定結果:Claude Sonnet 5.5 と Sonnet 5 の比較、GPT-6 Astra の effort 別比較、GPT-5.6 のコスト調整方法。
測定日は GPT-6.1 Sol のリリース翌日の 2026-09-30。ゲートウェイ経由で OpenAI Responses API と Anthropic Messages API を使用した。GPT-6.1 Sol の単発タスクを 234 回(13 タスク、各 3 回、6 設定)、ビジネス文書の呼び出しを 800 回(文書名だけを指定する 80 件をモデルと effort の 6 設定で実行し、必要項目を明記する 80 件を 4 設定で実行)、ツールループを 36 回実行した。Sonnet 5.5 と Opus 5.5 の単発タスクおよびツールループの数値は、同じタスクを 2026-09-29 に実行した結果だ。公開ベンチマークの数値は 2026-10-01 に各公開元のページで確認した。