新規 無料登録、10回の呼び出しを進呈。最大 $1、カード不要。

Flash LLM API 比較 2026:コスパは GLM、性能は Gemini 3.8

目次
  1. 9 モデルの比較方法と検証方法
  2. Flash に該当するモデルと、最新版へ移行すべきか
  3. 9 モデルの料金
  4. 対応する入力形式と、thinking を無効にできるか
  5. token 単価ではなく、タスク全体ではいくらか
  6. 選ぶべき Flash モデル
  7. default 設定で基準を満たさない Flash モデル
  8. Flash モデルで十分か、大型モデルが必要か
  9. Flash モデルを本番投入すると何が壊れるか
  10. Synthorai での扱い
  11. FAQ

2026 年 9 月時点で最適な Flash クラスの LLM API は、何を重視するかで変わる。ベンチマークスコアあたりのコストなら GLM 5.3 Flash、総合力なら Gemini 3.8 Flash で、音声や動画にも向く。最も高価だが回答の捏造が最も少ないのは Claude Sonnet 5、検証項目をすべて通過した中で最安なのは Seed 2.0 Mini だ。ここでいう Flash クラスとは、各ベンダーの小型かつ高速なモデルを指す。16 モデルを評価した結果、どのベンダーでも現行モデルが旧世代の小型モデルを上回った。本記事では現行 9 モデルを対象に、定価、cache 料金、入力形式、thinking 制御、第三者ベンチマーク、タスク単価、本番環境で起きる問題を比較する。

TL;DR

  • 各ベンダーの現行モデルへ移行すべきだ。Claude Sonnet 5、GPT-5.6 Terra、Gemini 3.8 Flash は、Haiku 4.5、GPT-5.4 mini、Gemini 3.5 Flash-Lite より token 単価は高いが、正答あたりのコストは 2.5-3.9 倍安い。
  • コスパ首位:GLM 5.3 Flash。Artificial Analysis index は 41.9、タスク単価は $0.25。
  • 総合力とマルチモーダル性能の首位:Gemini 3.8 Flash。
  • 回答の捏造が最少:Claude Sonnet 5。ただしタスク単価は最高。
  • 最安:Seed 2.0 Mini。料金は $0.10 / $0.40。

9 モデルの比較方法と検証方法

価格と機能は各ベンダーのページ、ベンチマークは同一 harness で全モデルを測定する第三者 leaderboard から取得した。独自検証は順位付けではなく、採用可否を判断するためのテストだ。参照した leaderboard は Artificial Analysis(AA)Intelligence Index v4.3 と non-hallucination rate(推測せず回答を拒否する割合)、LiveBench、Vals Index、Arena の text と WebDev の投票結果だ。独自検証では、正解を機械的に確認できる 11 タスクを各 3 回実行した。内容は桁数、素数の合計、grid path、coin change、modular power、knapsack などだ。さらに、実在しない企業、研究所、町、合金、賞について 5 問を出し、回答をすべて読んで、拒否したか捏造したかを確認した。thinking は回答前にモデルが生成する reasoning token を指し、output として課金される。reasoning_effort などの field で request ごとに指定する。各モデルは default と、対応するすべての thinking 設定で実行した。

モデルAA indexAA non-hallucinationLiveBenchVals IndexArena text / WebDev独自検証:default / bestdefault での捏造
GPT-5.6 Terra42.3 at max12.177.959.61466 / 152131 / 335 問中 2 問
GLM 5.3 Flash41.972.471.647.21475 / 160731 / 315 問中 0 問
Gemini 3.8 Flash41.2 at high44.875.862.31493 / 156832 / 335 問中 0 問
Qwen3.8 Flash39.954.776.2未掲載未掲載 / 163533 / 335 問中 2 問
DeepSeek V4.1 Flash39.5 at max3.581.157.9未掲載 / 161433 / 335 問中 4 問
Claude Sonnet 538.4 at max60.676.059.61461 / 153733 / 335 問中 0 問
GPT-5.6 Luna37.5 at max7.473.659.91453 / 151931 / 325 問中 4 問
Hy325.825.9未掲載未掲載1456 / 151333 / 335 問中 0 問
Seed 2.0 Mini未掲載未掲載未掲載未掲載未掲載33 / 335 問中 0 問

参照元は 2026-09-17 に確認した。Artificial AnalysisLiveBenchVals IndexArena textArena WebDev を使用した。Arena のスコアは Elo 形式で、20 point 程度の差は小さい。Qwen3.8 Flash は、API の基盤となる open-weight model である Qwen3.8-Flash-Next として掲載されている。測定日は 2026-09-16 と 17 で、日をまたいだ比較に問題がないことを確かめるため、2 モデルを 2 日目に再実行した。

すべての leaderboard で首位になるモデルはない。index は Terra、LiveBench は DeepSeek、Vals と Arena text は Gemini 3.8 Flash、Arena WebDev は Qwen3.8 Flash が首位だ。AA non-hallucination rate と独自の架空質問 5 問では、推測しやすいモデルについて同じ傾向が出た。DeepSeek V4.1 Flash、Luna、Terra はほとんど回答を拒否せず、GLM 5.3 Flash と Sonnet 5 は拒否することが多い。Seed 2.0 Mini は第三者スコアがどこにもないため、判断材料は独自検証だけになる。

Flash に該当するモデルと、最新版へ移行すべきか

各ベンダーの最新小型モデルが対象で、最新版へ移行すべきだ。Google、DeepSeek、Alibaba、Z.ai、ByteDance、Tencent は、それぞれ Flash、Mini、または単一の低価格モデルとして提供している。Anthropic の現行世代は Fable、Opus、Sonnet で、Haiku 4.5 は 1 世代前だ。リリースは 2025 年 10 月で、廃止は早くても 2026 年 10 月 15 日になる。そのため、Claude の Flash クラスには Claude Sonnet 5 を採用した。OpenAI の docs では GPT-5.6 Terra が旧 mini クラス、GPT-5.6 Luna が nano クラスに対応する。Sonnet 5($2 / $10)と Terra($2 / $12)は、ほかの 7 モデルより token 単価が数倍高く、下記では別の価格帯に分けている。

4 ベンダーについては旧世代の小型モデルも評価し、正答あたりのコストを計算した。33 回の実行にかかった総費用を正答数で割るため、正答率が半分なら正答 1 件あたりのコストは 2 倍になる。すべての組み合わせで現行モデルが勝った。TL;DR に挙げた 3 組は、token 単価こそ上がったものの、正答あたりでは安くなった。

  • Claude Haiku 4.5 より Claude Sonnet 5。Haiku が 33 問中 32 問に到達したのは thinking が最大の場合だけだった。Sonnet 5 は thinking を有効にしたすべての設定で 33 問中 33 問正解し、最も安い max では正答あたりのコストが 2.9 倍安かった。架空質問 5 問は両モデルともすべて拒否した。
  • GPT-5.4 mini より GPT-5.6 Terra。mini は default で 33 問中 9 問、33 問正解には high が必要だった。Terra は low で 33 問正解し、コストは 2.5 倍安い。mini は架空質問 5 問をすべて拒否したが、Terra は 2 問で回答を捏造した。
  • Gemini 3.5 Flash-LiteGemini 3.7 Flash より Gemini 3.8 Flash。Flash-Lite と比べると、正答あたりのコストは 3.9 倍安い。Flash-Lite が回答した架空質問 3 問も、3.8 は拒否した。Flash-Lite が向くのは 1 step の抽出処理だけだ。3.7 Flash とは定価が同じで、3.8 は call あたり約 10% 高い。この upgrade で得られるのはコスト削減ではなく性能向上だ。
  • GPT-5.4 nano より GPT-5.6 Luna。どちらも 33 問中 31 問だが、正答あたりのコストは約 3 分の 1 だった。さらに、Qwen3.6 FlashQwen3.5 Flash より Qwen3.8 Flash。旧モデルは thinking token が約 10 倍多く、正答あたりのコストは 6-27 倍高い。

以降は現行の 9 モデルだけを扱う。

9 モデルの料金

output の定価で 3 つの価格帯に分けた。bar は各モデルの最良設定で測定した正答あたりのコストを示す。定価が安くても thinking が多ければ高くなるため、両方をまとめて比較できる。label には定価と cache read 料金を記載した。cache read 料金は、繰り返し使う prompt prefix の料金が通常の input 料金に対して何割かを示す。

現行 9 種の Flash クラスモデルを 3 つの価格帯に分け、最良の thinking 設定における正答あたりの実測コストを示した棒グラフ。$10 から $12 の価格帯は Claude Sonnet 5 が $0.00763、GPT-5.6 Terra が $0.00199。$1.20 から $3.75 の価格帯は GPT-5.6 Luna が $0.00052、DeepSeek V4.1 Flash が $0.00084、Gemini 3.8 Flash が $0.00234。$0.40 から $0.53 の価格帯は GLM 5.3 Flash が $0.00041、Qwen3.8 Flash が $0.00046、Hy3 が $0.00069、Seed 2.0 Mini が $0.00157。default 設定で回答を捏造した Luna と DeepSeek は赤色

価格帯だけでは請求額を予測しにくい。最も高価な価格帯にある GPT-5.6 Terra は、正答あたりでは Gemini 3.8 Flash より安く、Seed 2.0 Mini より約 25% 高いだけだった。モデルが消費する thinking token は、定価と同じくらいコストを左右する。価格は頻繁に変わり、時間帯や地域でも異なる。Google の 3.x Flash は 2027 年 1 月 1 日に倍額となり、Gemini 3.8 Flash は $1.50 / $7.50 になる。DeepSeek は平日の 01:00-04:00 と 06:00-10:00 UTC 以外なら半額だ。OpenAI は 7 月に GPT-5.6 Luna を 80% 値下げした。Qwen3.8 Flash は Alibaba の Singapore region 以外なら 19-25% 安い。現行の小型モデル 3 種は検証日に Synthorai で利用できなかったため、測定対象外とした。Mistral Small 4($0.15 / $0.60)、StepFun Step 3.7 Flash($0.20 / $1.15)、Amazon Nova 2 Lite($0.30 / $2.50)だ。

対応する入力形式と、thinking を無効にできるか

9 モデル中 8 モデルが画像、4 モデルが動画、2 モデルが音声を受け付ける。Tencent の Hunyuan 3 である Hy3 は text のみだ。最後の列は、invoice 抽出を 8 回実行し、strict schema に従った JSON の値が正しかった回数を示す。

モデル入力context / 最大 outputOpen weightsthinking 無効化thinking の defaultSchema JSON
Claude Sonnet 5text、image1M / 128Knoyesadaptive、hightool call 経由で 8/8
GPT-5.6 Terratext、image1.05M / 128Knoyesmedium8/8
Gemini 3.8 Flashtext、image、audio、video、PDF1M / 64Knonomedium8/8
GPT-5.6 Lunatext、image1.05M / 128Knoyesmedium8/8
DeepSeek V4.1 Flashtext、image1M / 384KMITyeshighjson_object のみ、8/8
Seed 2.0 Minitext、image、audio、video256K / 128Knoyesmedium8/8
Qwen3.8 Flashtext、image、video1M / 128KQwen licenseyesxhigh3/8、整数値が不正
GLM 5.3 Flashtext、image、video、file1M / 128KMITnomaxjson_object のみ、8/8
Hy3text256K / 128KApache 2.0yeshighjson_object のみ、7/8

「tool call 経由」とは、schema を tool の input として渡し、Claude にその tool の呼び出しを強制したという意味だ。「json_object のみ」は、今回の request 経路では strict schema が正しく返らず、必要な key を prompt に書いて {"type": "json_object"} を指定した場合に成功したことを示す。音声入力が必要なら Gemini 3.8 Flash または Seed 2.0 Mini、128K を超える output が必要なら DeepSeek V4.1 Flash、自社環境で host できる weight が必要なら DeepSeek、GLM、Hy3、Qwen3.8 Flash が候補になる。

token 単価ではなく、タスク全体ではいくらか

1 call の料金は単価とモデルが消費する token 数で決まる。このクラスでは、単価より token 消費量の差が大きい。公開データとして最も公平なのは、Artificial Analysis の index を 1 タスク実行するためのコストだ。thinking token も含まれ、9 モデル中 8 モデルにデータがある。

各モデルで最も高いスコアが出た設定における Artificial Analysis Intelligence Index 1 タスクあたりのコストを、最安モデルに対する倍率で示した棒グラフ。Hy3 は $0.07 で 1x、index 25.8。GPT-5.6 Luna は $0.18 で 2.4x、37.5。GLM 5.3 Flash は $0.25 で 3.4x、41.9。DeepSeek V4.1 Flash は $0.27 で 3.6x、39.5。Qwen3.8 Flash は $0.37 で 5x、39.9。Gemini 3.8 Flash は $1.24 で 16.8x、41.2。GPT-5.6 Terra は $1.40 で 18.9x、42.3。Claude Sonnet 5 は $5.09 で 68.8x、38.4

GLM 5.3 Flash のスコアは GPT-5.6 Terra と 0.5 point 以内で、タスク単価は 5 分の 1 だ。Qwen3.8 Flash は GLM と定価がほぼ同じだが、タスク単価は 1.5 倍になる。index の実行で生成した output token が、GLM の 180 million に対して 240 million だったためだ。Claude Sonnet 5max は 1 タスク $5.09 で、default の high は $1.79。index の差は 6 point だ。独自の単発 call でも同じ傾向が出た。Seed 2.0 Mini は Qwen3.8 Flash より定価が安いが、正答あたりのコストは 3.4 倍だった。1 タスクあたりの thinking token の中央値が、Qwen の 530 に対して 2,810 だったためだ。

cache read 料金は、DeepSeek が input の 2%、Google、OpenAI、Anthropic、Alibaba が約 10%、Z.ai と ByteDance が 20%、Tencent が 25% だ。agent や RAG の traffic では、cache read 料金が請求額を大きく左右する。RAG は retrieval-augmented generation のことで、取得した document を毎回 prompt に貼り付ける。cache 済みの 100K-token prefix は、DeepSeek V4.1 Flash なら 1 call あたり $0.0006、Sonnet 5 または Terra なら $0.02 だ。OpenRouter の報告では、V4.1 Flash のリリース後、ある 1 日に配信した token の 90% が cache read だった(投稿)。数時間以内に回答される batch tier では、Gemini 3.8 FlashGPT-5.6 Luna、Terra、Sonnet 5 の料金が半額になる。Qwen3.8 Flash、GLM 5.3 Flash、Hy3 には batch tier がない。

選ぶべき Flash モデル

コスパなら GLM 5.3 Flash、総合力とマルチモーダル入力なら Gemini 3.8 Flash、回答の捏造を最小化するなら Claude Sonnet 5、価格なら Seed 2.0 Mini だ。

用途推奨理由
コスパGLM 5.3 Flashindex は 41.9 で Terra に次ぐ 2 位、タスク単価は $0.25。9 モデル中で non-hallucination rate が最高の 72.4。料金は $0.15 / $0.50。image、video、file 入力に対応し、MIT weights
総合力Gemini 3.8 Flash9 モデル中で Vals と Arena text が首位。Terra より index は 1.1 point 低いが、タスク単価は 11% 安い。low で 33 問中 33 問正解し、架空質問はすべて拒否
マルチモーダルGemini 3.8 Flashaudio、video、PDF 入力に対応し、audio は text と同じ料金。schema JSON は 8 回中 8 回成功
高速かつ回答の捏造が最少Claude Sonnet 5thinking を有効にした全設定で 33 問中 33 問正解。thinking の有効、無効を問わず架空質問 5 問をすべて拒否。最初の回答 token まで 2.2 秒。タスク単価は最高なので、call 料金より誤回答の損失が大きい用途に向く
最安Seed 2.0 Mini$0.10 / $0.40。default で 33 問中 33 問正解、schema JSON は 8 回中 8 回成功、架空質問 5 問をすべて拒否。audio と video 入力にも対応

残る 3 モデルは、それぞれ 1 つの理由で推奨から外れた。GPT-5.6 Terra は index 首位で、low では正答あたり $0.00199 で 33 問中 33 問正解した。しかし output 1 million token あたり $12 でありながら、架空質問 5 問中 2 問で回答を捏造した。DeepSeek V4.1 Flash は LiveBench 首位で cache 料金も最安だが、入力は text と image のみで、thinking 有効時に架空質問 5 問中 4 問で回答を捏造した。Qwen3.8 Flash は独自検証で全問正解したモデルの中では最安で、正答あたり $0.00046。Arena WebDev でも首位だ。しかし 2 問で回答を捏造し、strict schema では整数値を誤り、400 語の説明に約 3 分かかった。

1 モデルに固定せず、request 単位で振り分けるべきだ。正解を検証できる closed task は、基準を通過した最安モデル(GLM 5.3 Flash、Qwen3.8 Flash、Hy3)へ送る。open な事実質問は回答を拒否できるモデル(GLM 5.3 Flash、Sonnet 5、Gemini 3.8 Flash)へ送る。長時間の agent 実行には、予算内で最も強いモデルを使う。

default 設定で基準を満たさない Flash モデル

9 モデル中 2 モデルが該当する。どちらも open question を拒否できる設定へ送れば基準を満たす。採用基準は出荷時の default 設定で評価し、タスク 33 問中 30 問以上正解、架空質問 5 問中 2 問以下の捏造とした。

モデルdefault での結果変更変更後
DeepSeek V4.1 Flash5 問中 4 問で捏造。「従業員 50 人」「1790 °C」「賞の受賞者は Simpsons の登場人物」などopen question では thinking を無効化5 問中 5 問を拒否。ただしタスクは 33 問中 21 問なので、open question だけを送る
GPT-5.6 Luna5 問中 4 問で捏造。「従業員は約 20 人」「1974」「1,400 °C」などopen question では thinking を無効化5 問中 4 問を拒否。ただしタスクは 33 問中 7 問なので、同じ routing が必要

GPT-5.6 TerraQwen3.8 Flash は、いずれも架空回答が 2 問で基準ぎりぎりだった。Terra は「従業員 0 人」「約 1,455 °C」などと回答した。open question では同様に扱うべきだ。

Flash モデルで十分か、大型モデルが必要か

範囲が限定された作業なら十分だ。model が実際の repository に対して shell を操作する短めの agent benchmark では、DeepSeek V4.1 FlashDeepSeek V4 Pro を上回る。Terminal-Bench 2.1 は 90.6 対 87.9、DeepSWE は 74.2 対 62.7 だ。Gemini 3.8 Flash は Terminal-Bench 2.1 で 89.4、Claude Opus 5 は 89.1 だった。9 モデルすべてが 2 turn の tool-calling loop を 3 回中 3 回完了した。

長いタスクや長大な context では差が再び開く。Google の Terminal-Bench 4.0 の表では、Gemini 3.8 Flash が 19.1、Opus 5 が 51.8 だ。OpenAI の 512K-1M token を対象とする multi-needle retrieval test では、GPT-5.6 Luna が 41.3、GPT-5.6 Terra が 72.5。1M の context window があっても、最小モデルが 1M token を確実に検索できるとは限らない。Flash モデルは抽出、分類、短い tool step、形式が決まった code 変更に使う。長時間の agent 実行の計画や、非常に長い document を対象とする質問には大型モデルを使うべきだ。

Flash モデルを本番投入すると何が壊れるか

問題になりやすいのは、モデルの能力より default と request 形式だ。

  • thinking を無効にできないモデルが 2 つあるGemini 3.8 FlashGLM 5.3 Flash は、試したすべての無効化設定で 400 を返した。
  • default が両極端にある。GLM 5.3 Flash の default は maxQwen3.8 Flashxhigh だ(Alibaba)。架空質問 5 問で Qwen3.8 Flash が消費した reasoning token の中央値は 11,680 だった。Google は thinking を max_output_tokens に含めるため、上限が小さいと回答が途中で切れたり空になったりするが、料金は発生する(thinking ガイド)。
  • Claude は独自の制御方式を使うClaude Sonnet 5 は thinking depth を output_config.effort で設定し、旧式の budget_tokens は拒否する(effort)。reasoning_effort は parameter に含まれない。
  • tool loop では reasoning も履歴に戻す必要がある。DeepSeek の thinking mode では、以前の turn の reasoning_content が必要になる(thinking mode)。Gemini は function-call part に thought signature を付ける。message history を組み直す framework は、この 2 つを失う。
  • strict JSON の挙動は統一されていない。Qwen3.8 Flash は schema の型を守ったが、8 回中 5 回で整数値を誤った。line item が -561994 になる例もあった。Qwen、GLM、Hy3、DeepSeek では、必要な key を prompt に明記して json_object を使う。Claude では tool call を使う。
  • thinking で回答の誠実さが変わるDeepSeek V4.1 Flash は thinking 有効時に 5 問中 4 問で回答を捏造し、無効時は 0 問だった。
  • model id は切り替わるdeepseek-v4-flash は 9 月 10 日から V4.1 Flash を配信している(料金)。Claude Haiku 4.5 は 10 月 15 日以降に廃止される可能性がある(廃止予定)。seed-2-0-mini-260428 のような日付付き snapshot がある場合は固定する。
  • open weights の third-party host は品質が異なる。DeepSeek、GLM、Qwen、Hy3 は多くの provider が提供しており、quantization と cache の挙動も異なる。9 月には、ある reseller が有料 request を安価なモデルへ転送していたことが判明した(Hacker News)。利用する provider の回答を、ベンダー公式 API と比較する必要がある。

速度はモデルの大きさより、default の thinking 設定に左右される。2026-09-17 に各 default で 400 語の説明を streaming し、それぞれ 3 回実行した。

モデル、default 設定最初の回答 token合計時間1 秒あたりの output token
Claude Sonnet 52.2 s10.5 s70
Gemini 3.8 Flash10.7 s14.3 s114
GPT-5.6 Luna24.9 s26.1 s89
GPT-5.6 Terra33.3 s34.2 s63
GLM 5.3 Flash36.7 s39.3 s128
DeepSeek V4.1 Flash40.4 s40.6 s158
Seed 2.0 Mini61.3 s61.5 s81
Hy3123.0 s134.5 s35
Qwen3.8 Flash159.9 s165.8 s72

1 秒あたりの token 数は、call 全体の reasoning と回答を合算した。Sonnet 5 の adaptive thinking は文章作成タスクで token を消費せず、すぐに回答を開始した。Qwen3.8 Flash は同じタスクで reasoning token を中央値 10,697 消費した。closed task を安価に処理できるモデルでも、open-ended prompt には数分かかる場合がある。

OpenAI-compatible request では 1 field で設定でき、thinking の消費量は usage に返る。

from openai import OpenAI

client = OpenAI(base_url="https://synthorai.io/v1", api_key="sk-syn-...")
r = client.chat.completions.create(
    model="gemini-3.8-flash",          # or glm-5.3-flash, gpt-5.6-terra, ...
    reasoning_effort="low",
    max_tokens=32768,
    messages=[{"role": "user", "content": "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer."}],
)
u = r.usage
print(r.choices[0].message.content, u.completion_tokens, u.completion_tokens_details.reasoning_tokens)

Claude Sonnet 5 では、同じ request を Messages API に送り、output_config: {"effort": "low"} を指定する。

Synthorai での扱い

上記の全モデルは、OpenAI-compatible または Anthropic-compatible の同じ endpoint で、単一の model id として利用できる。モデル比較ページ では、任意の 2 モデルについて料金、cache、入力形式、context、ベンダーの benchmark を並べて比較できる。9 モデルすべての現行料金は モデル料金比較 に掲載している。

FAQ

Claude Sonnet 5 は Flash モデルか。 Anthropic 自身は Flash と呼んでいないが、現行世代で最小のモデルだ。Claude Haiku 4.5 は 2025 年 10 月のモデルで、2026 年 10 月 15 日以降に廃止される可能性がある。Claude Sonnet 5 は Haiku の $1 / $5 に対して $2 / $10 だが、独自検証では正答あたりのコストが 2.9 倍安かった。

Gemini Flash API は無料かGemini 3.8 Flash には Google AI Studio の free tier がある。ただし、Google は free tier の内容を製品改善に使用する(料金)。EEA、Switzerland、UK 向けの app では、有料 service だけが許可されている(利用規約)。有料 tier は 2026 年 12 月 31 日まで $0.75 / $3.75、以降は $1.50 / $7.50 だ。

Gemini Flash と Flash-Lite のどちらを使うべきか。 すべての request が 1 step の抽出処理でない限り、Gemini 3.8 Flash を使うべきだ。Artificial Analysis index は Gemini 3.5 Flash-Lite の 23 に対して 41.2。独自検証では正答あたりのコストが 3.9 倍安く、Flash-Lite が回答した架空質問 3 問を含め、5 問すべてを拒否した。Flash-Lite は $0.30 / $2.50 で、約 4 秒で回答する。

GPT-5.6 Luna と GPT-5.6 Terra のどちらを選ぶべきか。 大量処理なら GPT-5.6 Luna、難しい reasoning なら GPT-5.6 Terra だ。Luna は $0.20 / $1.20 で、default では正答あたり $0.00030、33 問中 31 問正解した。Terra は $2 / $12 で、low では正答あたり $0.00199、33 問中 33 問正解し、9 モデル中で index 首位だった。default では両方とも回答を捏造し、Luna は 5 問中 4 問、Terra は 2 問だった。

coding に最適な Flash モデルはどれか。 Arena WebDev では Qwen3.8 FlashDeepSeek V4.1 FlashGLM 5.3 Flash が上位で、スコアはそれぞれ 1635、1614、1607。LiveBench の agentic coding category は DeepSeek が 77.3 で首位。Vals の Vibe Code Bench は DeepSeek が 84.7、Claude Sonnet 5 が 81.3 で上位だった。

関連記事:DeepSeek V4.1 Flash API の料金GLM 5.3 API の料金Gemini 3.7 Flash API の料金provider 別 prompt caching 比較用途別の最適な LLM

← ブログに戻る