新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

Claude Sonnet 5.5 vs Sonnet 5:同価格でタスク単価 80% 減

目次
  1. Claude Sonnet 5.5 で何が変わったか?
  2. リリース時の benchmark は何を示しているか?
  3. どのように測定したか?
  4. Sonnet 5.5 のタスク単価は Sonnet 5 より安いか?
  5. effort level ごとのコストは?
  6. Sonnet 5.5 はなぜ回答に計算過程を書くのか?
  7. tool loop ではどうなるか?
  8. Sonnet 5.5 は高速か?
  9. Sonnet 5 の token budget はそのまま使えるか?
  10. どれを使うべきか?
  11. FAQ

Claude Sonnet 5.5 と Claude Sonnet 5 の token 単価は同じで、入力 100 万 token あたり $2、出力 100 万 token あたり $10 だ。コスト差は、使う token 数の違いだけで決まる。API のデフォルト設定で 13 件の単発タスクを実行したところ、Sonnet 5.5 は 1 タスクあたり $0.0041、Sonnet 5 は $0.021 だった。Sonnet 5.5 のほうが 80% 安く、正答率はどちらも 100% だった。問題は出力形式だ。Sonnet 5.5 は xhigh 未満だと hidden reasoning を省略し、回答だけを求める prompt に対しても計算過程を reply に書くことがある。

TL;DR

  • API のデフォルト設定では、Sonnet 5.5 は 1 タスクあたり $0.0041、Sonnet 5 は $0.021 だった。39 回の呼び出しは両モデルともすべて正解した。
  • Sonnet 5.5 のコストは low、medium、high でほぼ同じだった。max はデフォルトの 3.5 倍だった。
  • Sonnet 5.5 は xhigh 未満だと、回答だけを求めた 156 件中 68 件で計算過程も reply に含めた。system prompt を追加しても改善しなかった。
  • 4 問の tool loop では、Sonnet 5.5 の max は 1 回あたり $0.042 かかり、Opus 5.5 のデフォルト設定($0.033)より高かった。

Anthropic は 2026-09-28 に Sonnet 5.5 をリリースし、Sonnet 5 より 30% 高速で、1 タスクあたりのコストを「最大 30% 削減」できると発表した。その翌日に測定した。

Claude Sonnet 5.5 で何が変わったか?

価格は変わっていない。thinking の制御方法と、複数の request parameter が変わった。Sonnet 5.5 は adaptive thinking を使う。回答前にどれだけ hidden reasoning を行うかはモデルが決め、その reasoning token は出力として課金される。制御には effort を使う。Messages API では output_config.effort に指定し、low から max まで 5 段階ある。API のデフォルトは high だ。

Sonnet 5.5Sonnet 5Opus 5.5
リリース日2026-09-282026-06-302026-09-22
入力/出力、100 万 token あたり$2 / $10$2 / $10$4 / $20
cache read、100 万 token あたり$0.20$0.20$0.20
context window/最大出力1M / 128K1M / 128K1M / 128K
knowledge cutoff(公開されているのは月のみ)2026 年 6 月2026 年 1 月2026 年 6 月
API のデフォルト efforthighhighmedium
thinking の最低設定between_tools(high 以下)disabled無効化できず、thinking は常に有効
cache 可能な prompt の最小サイズ512 token1,024 token512 token

Sonnet 5 の $2 / $10 は当初、導入価格として提供された。しかし、現在の Anthropic の料金ページ では標準価格として掲載されている。予定されていた $3 / $15 への値上げは実施されなかった。

移行ガイド によると、次の request は Sonnet 5 では動作するが、Sonnet 5.5 では HTTP 400 を返す。

  • thinking: {"type": "disabled"}。代わりに thinking: {"type": "between_tools"} を使う。これは最初の回答前の reasoning を無効にし、high 以下でのみ利用できる。
  • tool の強制使用。tool_choice に any または特定の tool を指定する方法は使えない。auto のままにして、tool を使う条件を prompt に書く。
  • 手動の thinking budget(budget_tokens)、デフォルト以外の temperature、top_p、top_k、および事前入力した assistant turn(モデルの reply の書き出しをあらかじめ指定する方法)。
  • 2026-08-31 以降に作成されたアカウントで、system prompt、tool、または以前の message を変更した後に Sonnet 5.5 の thinking block を再送すること。
  • Claude API と Google Cloud で、旧版の computer use tool computer_20251124 を使うこと。

エラーにならない変更もある。tool call 間にモデルが書く短いメモは、今後 thinking block として返される。デフォルトの表示設定では中身が空になるため、これを streaming 表示していた interface では何も表示されなくなる。

リリース時の benchmark は何を示しているか?

Anthropic の比較表では、Sonnet 5.5 は token 単価が半分にもかかわらず、Opus 5.5 と数 point 差に収まっている。Sonnet 5 には大差をつけた。

Benchmark(評価対象)Sonnet 5.5Sonnet 5Opus 5.5GPT-6 Sol
Terminal-Bench 4.0(terminal 上での agentic coding)70.6%10.3%66.4%(xhigh)未報告
CursorBench 4.0(editor 上での coding)55.5%34.1%57.8%未報告
GDPval-AA v2.1(知識労働の文書、Elo rating、高いほど良い)1844144918461487
OSWorld 2.1(computer use、部分点あり)80.1%57.0%81.8%未報告
Humanity’s Last Exam、tool 使用あり64.5%54.9%67.7%未報告

Artificial Analysis はコスト面の注意点も挙げている。max の Sonnet 5.5 は Intelligence Index で 56 を記録し、max の Opus 5.5 より 2 point 低かった。一方、1 タスクあたり約 193K output token を使った。これは同社の測定で最多であり、max の Opus 5.5 または Sonnet 5 より約 60% 多い。index task あたりのコストは約 $7.60 だった。

どのように測定したか?

正解が分かっている 13 件の単発タスクを 3 モデルすべてに送った。各タスクは 1 prompt、1 reply で、tool は使わない。内訳は短い問題が 8 件(60 未満の素数の合計、1 から 500 までに数字の 7 が現れる回数など)、複数段階の処理が必要な問題が 5 件(10 item の knapsack、障害物のある 8x8 grid の経路数、13 の 1,001 乗を 10,007 で割った余りなど)だ。正解はすべてローカルで総当たりして求めた。各 prompt の末尾には「整数を 1 つだけ返し、それ以外は何も書かないこと」と指定した。各タスクを API のデフォルト設定と 5 段階すべての effort で 3 回ずつ実行した。合計 702 call で、native Messages API を使用した。cache から response が返らないよう、各 prompt に一意のランダム文字列を付けた。コストは Anthropic の定価から計算した。最終回答が正しいか、reply が回答だけになっているかを採点した。

精度ではモデル間に差がつかなかった。Sonnet 5.5 は 234 call すべてに正解した。Sonnet 5 は response が返った 233 call すべてに正解したが、1 call は server error になった。Opus 5.5 は low とデフォルト設定で、それぞれ 1 タスクずつ間違えた。

Sonnet 5.5 のタスク単価は Sonnet 5 より安いか?

Sonnet 5.5 はデフォルト設定で Sonnet 5 より 80% 安く、low、medium、high では 77% から 78% 安かった。output token 数が約 5 分の 1 だったためだ。定価は同じなので、コスト削減分はすべて token efficiency による。Sonnet 5 はどの effort でも 1 タスクあたり約 1,800 から 2,100 token を出力した。Sonnet 5.5 は xhigh 未満なら約 400 token だった。

全 13 タスク、1 タスクあたりSonnet 5.5Sonnet 5Opus 5.5
API デフォルト$0.0041(396 token)$0.0212(2,105)$0.0070(334)
low$0.0043(409)$0.0184(1,817)$0.0065(309)
medium$0.0040(383)$0.0180(1,780)$0.0082(393)
high$0.0043(416)$0.0188(1,858)$0.0088(421)
xhigh$0.0059(574)$0.0202(2,001)$0.0105(507)
max$0.0146(1,438)$0.0193(1,909)$0.0234(1,149)

effort 設定別のタスク単価を、1,000 タスクあたりの dollar で示した grouped bar chart。Claude Sonnet 5.5:デフォルト 4.1、low 4.3、medium 4.0、high 4.3、xhigh 5.9、max 14.6。Claude Opus 5.5:デフォルト 7.0、low 6.5、medium 8.2、high 8.8、xhigh 10.5、max 23.4。Claude Sonnet 5:デフォルト 21.2、low 18.4、medium 18.0、high 18.8、xhigh 20.2、max 19.3

token 数は 1 call あたりの平均 output token で、reasoning も含む。難しい 5 タスクでは、デフォルト設定で 84% 安かった($0.0057 に対して $0.0348)。tool loop では transcript 全体を turn ごとに再送し、input token がコストの大半を占めるため、削減率は 8% だった。今回のような単発 prompt に対して Anthropic の「最大 30%」は控えめだが、今回のような短い loop に対しては大きめの数字だ。

タスクは13件だけなので、デフォルト設定での80%減という値の幅は広い。タスクを再標本化した95%区間は66%から85%安い範囲で、low から xhigh までのどの設定でも下限は50%を上回った。

effort level ごとのコストは?

Sonnet 5.5 は low、medium、high のどれでも 1 タスクあたり約 $0.0042 だった。今回の測定では、デフォルトの high に追加コストはない。xhigh は約 40% 高く、max はデフォルトの 3.5 倍だった。max の Sonnet 5.5 は、デフォルト設定の Opus 5.5 より 1 タスクあたりのコストが 2 倍になった($0.0146 に対して $0.0070)。精度は向上しなかった。

どの workload でも同じ傾向になるわけではない。より長い DevOps タスクでは、別のテスター が high で medium の約 2 倍の output token を使ったと報告している。effort の影響を受ける workload では、個別に全設定を測定する必要がある。

Sonnet 5.5 はなぜ回答に計算過程を書くのか?

Sonnet 5.5 は xhigh 未満だと、thinking block を使わないことがある。その場合、reply の中で reasoning を行う。thinking block はモデルの reasoning を格納する response 内の独立した領域だ。デフォルトでは本文が空で、その後に text block として回答が続く。

Sonnet 5.5 の 234 reply のうち、thinking block があった 166 件はすべて回答だけだった。thinking block がなかった 68 件は、すべて最初に計算過程を書いた。たとえば「09:47 + 3:46 = 13:33 … + 1:39 = 15:40」と書いた後に「15:40」と回答した。最終回答は毎回正しかったが、prompt で指定した形式には従っていなかった。

回答のみだった replySonnet 5.5Sonnet 5Opus 5.5
API デフォルト22 / 3938 / 3938 / 39
low12 / 3937 / 3938 / 39
medium24 / 3937 / 3939 / 39
high30 / 3938 / 3939 / 39
xhigh39 / 3935 / 3839 / 39
max39 / 3937 / 3939 / 39

この挙動はタスク単位で起きる。該当したタスクでは、Sonnet 5.5 は 3 回の繰り返しすべてで計算過程を書いた。例外はデフォルト設定の 1 タスクで、3 回中 2 回だった。該当したのは 13 タスク中、low で 9 件、デフォルトで 6 件、medium で 5 件、high で 3 件(いずれも短い算数の問題)だった。タスク単位で数えると 13 件しかないため、どの差も Holm 補正を通らない。これらの件数は今回観測した結果として読み、計画に使える発生率とはみなさないでほしい。Sonnet 5 の失敗は性質が異なり、正しい回答を太字で書いた後に短い説明を付けていた。xhigh が 38 call なのは、1 call が server error になったためだ。

「最終結果だけを返し、途中の処理は表に出さないこと」と system prompt で指定しても改善しなかった。low では短いタスク 24 件中 8 件、medium では 24 件中 9 件だけが回答のみだった。system prompt なしでは、それぞれ 6 件と 9 件だった。xhigh では毎回 thinking block が使われ、回答だけが返ったが、コストは low から high より約 40% 高かった。モデル出力を parse するコードでは、次の方法が使える。

  • 1 行だけを回答として受け取る必要があるなら、xhigh を使う。
  • または、最後の空でない行を回答として読む。今回の 68 件では、すべて正解だった。
  • Anthropic の structured outputs で reply を schema に制約する方法もある。今回は検証していない。
import anthropic

client = anthropic.Anthropic()
prompt = "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else."
resp = client.messages.create(
    model="claude-sonnet-5-5",
    max_tokens=16000,
    output_config={"effort": "xhigh"},  # low, medium, high (API default), xhigh, max
    messages=[{"role": "user", "content": prompt}],
)
text = "".join(block.text for block in resp.content if block.type == "text")
lines = text.strip().splitlines()
answer = lines[-1] if lines else None  # below xhigh, working can precede the answer
print(answer, resp.usage.output_tokens)  # output_tokens includes the reasoning

tool loop ではどうなるか?

デフォルト、low、medium の Sonnet 5.5 は、4 問のコード読解 loop をすべて解き、1 回あたりのコストは約 $0.011 だった。Opus 5.5 の約 3 分の 1 だ。max では tool call が 3 倍に増え、Opus 5.5 より高くなった。各モデルには、小さな合成 codebase に対して 3 種類の tool(file 一覧、file 読み込み、検索)を与えた。各回答には、複数 file をまたぐ 3 から 6 回の lookup が必要だった。

Tool loop、各 12 回解決数turn 中央値1 回あたりの tool call1 回あたりのコストwall time 中央値
Sonnet 5.5、デフォルト12 / 1234.8$0.01126.7 s
Sonnet 5.5、low12 / 1234.9$0.01127.4 s
Sonnet 5.5、medium12 / 1235.1$0.01136.8 s
Sonnet 5.5、max12 / 12414.7$0.042220.1 s
Opus 5.5、デフォルト12 / 1245.3$0.033225.3 s
Sonnet 5、デフォルト11 / 123.54.2$0.012215.8 s

VentureBeat が紹介した顧客のコメント では、Sonnet 5 より tool call が少なかったとされている。Lovable では 3 分の 1 少なかった。今回の loop は短すぎるため、その傾向は確認できなかった。Sonnet 5.5 は 1 回あたり 4.8 call、Sonnet 5 は 4.2 call だった。一方、コストは 8% 安く、完了までの時間は半分未満だった。

Sonnet 5.5 は高速か?

完了が早かった主な理由は、出力が短かったことだ。デフォルト設定の単発タスクで、request 送信から response 全体の受信までにかかった wall time の中央値は、Sonnet 5.5 が 3.9 秒、Sonnet 5 が 8.1 秒、Opus 5.5 が 5.5 秒だった。wall time 1 秒あたりの output token 数は 2 つの Sonnet でほぼ同じだった(88 に対して 91)。待ち時間が半分になったのは、token の生成速度が上がったからではない。Sonnet 5.5 の出力が 5 分の 1 だったためだ。難しいタスクでは 5.8 秒に対して 21.0 秒だった。

Sonnet 5 の token budget はそのまま使えるか?

Sonnet 5 向けに設定したコンテキスト予算や max_tokens の上限は、そのまま使えるはずだ。Anthropic の移行ガイドは Sonnet 5.5 が同じ tokenizer を使うとしており、私たちが試した 4 種類の固定テキスト(英文、Python コード、JSON のツール引数、中国語の文章)は、両モデルと Opus 5.5 で同じ token 数になった。たとえば英文は 1,270 token、中国語は 493 token だった。Sonnet 5.5 と Opus 5.5 はリクエストごとに固定で 2 token 多い。ツールを使うリクエストは入力が少し安くなる。Anthropic の料金ページによると、隠れたツール利用用システムプロンプトは Sonnet 5.5 で 286 token、Sonnet 5 で 354 token だ。

どれを使うべきか?

多くの Sonnet 5 workload は移行したほうがよい。残る判断は effort level の選択だ。

Workload注意点推奨数値
コードで parse する出力:抽出、分類、単一値xhigh 未満では reply に計算過程が入るSonnet 5.5 の xhigh、または medium で最後の行を parse回答のみは xhigh で 39 / 39、medium で 24 / 39。xhigh は約 40% 高い
chat とユーザー向けテキストlatency とコストSonnet 5.5 の medium1 タスクあたり $0.0040、中央値 3.9 s
tool を使う agent loopmax で tool call が増えるSonnet 5.5 のデフォルトまたは medium。Sonnet 5.5 の max を使う前に Opus 5.5 へ移行デフォルトで 1 回あたり $0.011、max で $0.042、Opus 5.5 で $0.033
thinking を無効化する、または tool を強制する Sonnet 5 向けコードモデル変更後に HTTP 400between_tools(high 以下)と tool_choice: autoAnthropic の移行ガイド

effort level にかかわらず、コードには 2 つの検査を入れるべきだ。reply が parser の想定する形式になっているかを確認し、request ごとに output token の上限を設定する。単発 prompt では max によってタスク単価が 3.5 倍になり、loop では tool call が 3 倍になった。

FAQ

Sonnet 5.5 は Opus 5.5 より安いか? デフォルト設定では、Sonnet 5.5 の単発タスク単価は Opus 5.5 より 41% 安く、tool loop 1 回あたりでは 3 分の 1 だった。max では逆転する。Sonnet 5.5 は単発タスクでデフォルト設定の Opus 5.5 の 2 倍、tool loop 1 回あたりでは 27% 高かった。

Sonnet 5.5 ではどの effort level を使うべきか? 今回のタスクでは、Sonnet 5.5 の low、medium、high はほぼ同じコストだった($0.0040 から $0.0043)。chat と tool loop では medium から始めるのが無難だ。コードが reply を単一値として parse する場合は xhigh を使う。max はデフォルトの 3.5 倍かかった。

Sonnet 5.5 でも thinking を無効にできるか? Sonnet 5.5 は thinking: {"type": "disabled"} を拒否し、HTTP 400 を返す。代わりに thinking: {"type": "between_tools"} を送る。利用できる effort は low、medium、high だ。

関連する測定結果:Claude Opus 5.5 と Opus 5 の比較、Claude Sonnet 5 の tokenizer、各 vendor の thinking 制御。

測定日はリリース翌日の 2026-09-29。Anthropic Messages API に接続する gateway 経由で実施した。採点した単発 call は 702 件(総当たりで正解を求めた 13 タスク、3 回の反復、6 種類の effort 設定、3 モデル)、出力形式に対する system instruction の検証は 48 call、tool loop は 72 回(複数段階の調査が必要な 4 問、3 回の反復、6 設定)、固定テキスト 4 種類の token 数もモデルごとに測定した。prompt には salt を付与し、コストは Anthropic の定価から計算した。

← ブログに戻る