Jev と Flash LLM 比較:ワークフローは 7 倍安く、単一ラベルは同額
目次
TypeSafe の Jev が Flash LLM より安いかどうかは、処理の形で決まる。各サポート会話について 12 問を処理した場合、Jev のコストは thinking を無効にした GPT-5.6 Luna の 7 分の 1 で、ネットワーク時間を除く処理時間は 1.66 秒に対して 0.12 秒だった。一方、77 クラスからラベルを 1 つ選ぶ処理では、Qwen3.8 Flash や GLM 5.3 Flash と同額だった。Jev は意思決定モデルだ。文章を生成するのではなく、定義した質問ごとに選択肢、スコア、確率を返す。公開データセットを使った 4 種類のテストで、Flash クラスのチャットモデル 5 種と比較した。各モデルでは、最も安い設定とデフォルトの thinking 設定を使用した。Jev は全テストで最速だったが、精度が最も高かったテストはなかった。
TL;DR
- 1 ケースあたり 12 問では、Flash LLM のコストは Jev の 4.8-37 倍、処理時間は 11-27 倍だった。精度は同程度だった。
- メッセージごとにラベルを 1 つ付ける処理では、thinking を無効にした Qwen3.8 Flash および GLM 5.3 Flash と Jev のコストは同じだった。
- デフォルトの thinking 設定では、単一ラベルのコストが Flash モデルで Jev の 1.5-26 倍になった。
- GPT-5.6 Luna は、プロンプトインジェクション以外の全テストで Jev より高精度だった。
- Jev が 0.99 以上の確率を返した回答は、98% が正解だった。
Jev とは何か、LLM とどう違うのか
Jev は TypeSafe の「System One」モデルだ。テキストまたは JSON(state)を読み、型付きの質問に回答する。パースが必要な生成テキストは返さない。質問には 3 種類ある。
| 質問タイプ | 指定内容 | 戻り値 |
|---|---|---|
| Noul(TypeSafe による yes/no の呼称) | yes/no で答える質問 | 0-1 の確率 |
| Choice | 定義した最大 255 個の選択肢から 1 つ選ぶ | 選択された項目、全項目の確率、信頼度 |
| Score | 定義した 2-10 段階の順序付き尺度で評価する | 確率加重スコア、信頼度 |
リクエストでは質問を名前付きで指定し、各名前に対して 1 つの回答を受け取る。次の例は、TypeSafe のドキュメントにある形式(API リファレンス)を使い、短いサポートチャットについて 3 つの yes/no 質問を送っている。
curl https://api.typesafe.ai/v1/systemone \
-H "Authorization: Bearer $TYPESAFE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "jev-latest",
"state": {"transcript": "Customer: My card was declined twice today.\nAgent: One moment.\nCustomer: Also, how do I change my PIN?"},
"questions": {
"declined_card": {"type": "noul", "instructions": "In `transcript`, does the customer report a declined card payment?"},
"change_pin": {"type": "noul", "instructions": "In `transcript`, does the customer want to change a PIN?"},
"lost_card": {"type": "noul", "instructions": "In `transcript`, does the customer report a lost or stolen card?"}
}
}'
実行時のレスポンスは次のとおりだった。
{
"model": "jev-1.13.0",
"answers": {
"declined_card": {"type": "noul", "noul": 0.99},
"change_pin": {"type": "noul", "noul": 0.98},
"lost_card": {"type": "noul", "noul": 0.02}
},
"usage": {"input_tokens": 359, "output_tokens": 56}
}
コード側では answers.<question>.noul を読み、通常の数値と同じようにしきい値と比較する。model フィールドには、回答したバージョンが入る。TypeSafe が新バージョンをリリースすると jev-latest の参照先も変わるため、そのモデルに合わせてしきい値を調整するなら jev-1.13.0 に固定したほうがよい。
TypeSafe は質問を並列に評価する。Jev 1.13 の料金は入力 100 万 token あたり $0.042 で、出力は無料だ(モデル一覧)。入力 token 単価は Qwen3.8 Flash の 3.6 分の 1、GPT-5.6 Luna の 4.8 分の 1、Gemini 3.8 Flash の 18 分の 1 になる。入力には、1 回あたり約 300 token の TypeSafe 独自テンプレートに加え、定義したすべての質問と選択肢が含まれる。上記の呼び出しでは 359 input token、$0.000015 が課金され、56 output token は無料だった。TypeSafe は Jev の苦手分野として、個数のカウント、算術、日付の比較、複数ステップの質問、無関係なテキストを大量に含む長い state を 特性上の注意点 に挙げている。
テスト方法
2026-09-21 と 2026-09-22 に、4 種類のテストを Jev と 5 種類の Flash チャットモデルでそれぞれ 1 回ずつ実行した。対象モデルは GPT-5.6 Luna、Qwen3.8 Flash、GLM 5.3 Flash、DeepSeek V4.1 Flash、Gemini 3.8 Flash だ。各チャットモデルは、利用可能な最も安い thinking 設定(off、off を指定できない場合は low)で実行した。3 種類の分類テストでは、ベンダーのデフォルト設定でも再実行した。
- 1 ケースあたり 12 問:Banking77 データセット(PolyAI、CC BY 4.0)の 1-6 件のメッセージから組み立てた 150 件のカスタマーサポート会話を使った。正解は既知だ。各モデルは会話ごとに 12 個の yes/no 質問(「顧客はカードの紛失または盗難を申告しているか」など)へ確率付きで回答する。Jev には 12 個の Noul 質問を 1 回の呼び出しで渡し、チャットモデルには 1 つの JSON オブジェクトを返させた。このうち 60 件は、会話の前に 3,000 token または 12,000 token の参照文書(銀行に関する Wikipedia 記事)を追加して再実行した。
- 単一ラベル:Banking77 のメッセージ 308 件を使った。77 intent から各 4 件を抽出している。Jev には 77 個の選択肢を持つ Choice を 1 つ渡し、チャットモデルには同じ一覧から intent を返させた。
- 28 ラベル:GoEmotions(Google、Apache 2.0)のコメント 200 件を使い、各コメントを 28 種類の感情で分類した。
- プロンプトインジェクション:deepset の prompt-injections テストセット(Apache 2.0)全 116 行を使い、各行について 1 つの yes/no 質問を実行した。
コストは、各ベンダーの定価に課金対象 token 数を掛けて算出した。レイテンシーは、接続を維持した状態でモデルごとに 40 回呼び出す別の測定から取得し、ネットワーク往復時間を差し引いた。測定方法は速度のセクションで説明する。GPT-5.6 Terra と Seed 2.0 Mini についても 3 種類の分類テストを実行した。結果は表に含めたが、グラフには含めていない。
Jev が Flash LLM より安くなる条件
1 つのテキストに対する質問数が多い場合、テキストが長い場合、またはチャットモデルが thinking を使う場合だ。短いテキストにラベルを 1 つ付けるだけなら、thinking を無効にした低価格モデルと Jev のコストは同じになる。
倍率を左右する要因は 3 つある。1 つ目は質問数だ。チャットモデルは質問ごとに回答を生成する必要があり、出力側の料金が高い。GPT-5.6 Luna は入力 100 万 token あたり $0.20 に対し、出力は $1.20 だ。一方、Jev の回答は無料で、質問を 1 つ追加しても入力は約 17 token しか増えない。2 つ目は thinking だ。ベンダーのデフォルト設定では、チャットモデルが単一ラベルごとに最大 161 output token の中央値を記録した。thinking を無効にした場合は 3-8 token で、Jev に対するコスト倍率も thinking に応じて上昇した。3 つ目は入力長だ。12,000-token の参照文書を追加すると、固定テンプレートや回答部分の影響が小さくなり、倍率は入力単価の比率に近づく。GLM 5.3 Flash の 3.5 倍から Gemini 3.8 Flash の 18.6 倍までで、DeepSeek V4.1 Flash は 7.1 倍だった。
単一ラベルのテストでは、最安モデルに対する Jev のコスト削減効果はなかった。77 個の選択肢によって呼び出しごとに約 1,400 token が追加されるため、1 行のメッセージでも Jev の課金対象入力は約 1,690 token になる。Qwen3.8 Flash は 440 token だった。
| テスト、1,000 ケースあたりのコスト | Jev | Luna | Qwen3.8 Flash | GLM 5.3 Flash | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| 1 ケースあたり 12 問 | $0.027 | $0.19 | $0.13 | $0.14 | $0.27 | $1.02 |
| 12 問、12,000-token の参照文書 | $0.43 | $2.02 | $1.57 | $1.53 | $3.06 | $8.06 |
| 単一ラベル、最安設定 | $0.071 | $0.098 | $0.069 | $0.068 | $0.16 | $0.99 |
| 単一ラベル、ベンダーのデフォルト設定 | $0.071 | $0.11 | $0.19 | $0.13 | $0.61 | $1.83 |
Jev はどれだけ速いか
ネットワーク時間を除くと、約 7-28 倍速かった。Jev の中央値は 0.11-0.12 秒、チャットモデルは 0.79-3.25 秒だった。
モデルとタスクの組み合わせごとに、接続を維持したまま 40 回を逐次実行し、同じ接続上でモデル処理を伴わないリクエストから測った往復時間を差し引いた。残るのはモデル自身の時間と、当社のプロキシから各プロバイダーまでの経路で、経路はすべてのモデルで同じである。
| ネットワーク時間を除いた秒数、中央値(95 パーセンタイル) | Jev | GPT-5.6 Luna | Qwen3.8 Flash | GLM 5.3 Flash | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| 単一ラベル、最安設定 | 0.11 (0.21) | 1.33 (1.80) | 0.96 (1.68) | 1.22 (3.06) | 0.79 (1.35) | 1.95 (3.76) |
| 単一ラベル、ベンダーのデフォルト設定 | 0.11 (0.21) | 1.45 (5.29) | 3.25 (21.5) | 2.97 (7.32) | 1.19 (10.4) | 2.18 (8.22) |
| 1 ケースあたり 12 問 | 0.12 (0.20) | 1.66 (2.56) | 3.21 (5.21) | 3.13 (6.20) | 1.33 (1.70) | 2.14 (2.89) |
thinking の影響は 95 パーセンタイルで目立つ。ベンダーのデフォルト設定では、Qwen3.8 Flash の呼び出し 20 回に 1 回が、単一ラベルの処理に 21 秒以上かかった。Jev は最も遅い呼び出しでも約 0.2 秒に収まった。
質問を増やしても Jev は遅くならなかった。1 件のサポートチケットについて yes/no 質問を 1 問から 60 問まで増やしても中央値の変化は 0.1 秒未満で、60 問の呼び出しでは 1,371 input token、$0.000058 が課金された。20 問の呼び出しは 5 回の実行すべてで全問正解だった。
TypeSafe 自身の主張との比較
傾向は一致したが、差の大きさは小さかった。比較対象が異なるためだ。TypeSafe のリリース記事では、複数ステップのワークフローを reasoning 有効の frontier model と比較し、最大で 444.6 倍安く、193.6 倍速いとしている。同社はこの数値を「実環境で得られる改善幅の上限寄り」と説明している(リリース記事)。
公開されている ワークフロー評価 には GPT-5.6 Luna も含まれている。Jev はケースあたり精度 67.8%、$0.0004、0.4 秒、Luna は 66.8%、$0.0033、12.9 秒で、Jev は約 8 倍安く 32 倍速い。今回の 12 問テストでは、thinking を無効にした Luna のコストは Jev の 7 倍、ネットワーク時間を除く処理時間は 14 倍だった。桁は同じだ。最安の Flash モデルと単一ラベルで比較すると、コスト差はなくなる。
Jev の精度は Flash LLM と同等か
ワークフローテストでは近いが、分類テストでは下回った。首位になったテストはない。1 ケースあたり 12 問では、Jev の micro F1(全質問の yes と no をまとめて評価し、1.0 が完全正解)はチャットモデル群の範囲内だった。正解と不正解を確率順に並べる性能も、最上位モデルとほぼ同等だった。
| 1 ケースあたり 12 問(150 会話) | 0.5 での Micro F1 | 12 問すべて正解 | AUC |
|---|---|---|---|
| Jev 1.13 | 0.909 | 61.3% | 0.990 |
| GPT-5.6 Luna、thinking off | 0.933 | 71.3% | 0.973 |
| GPT-5.6 Luna、デフォルト | 0.931 | 71.3% | 0.992 |
| Gemini 3.8 Flash、low | 0.919 | 66.7% | 0.974 |
| Qwen3.8 Flash、thinking off | 0.913 | 62.7% | 0.975 |
| GLM 5.3 Flash、low | 0.906 | 64.7% | 0.975 |
| DeepSeek V4.1 Flash、thinking off | 0.896 | 60.0% | 0.958 |
AUC は、確率による順位付けの性能を表す。1.0 なら、正解が「yes」の全項目に、不正解の「no」より高い確率が付いている。先頭に 12,000-token の参照文書を追加しても、Jev の精度は維持された。同じ 60 会話で、参照文書なしの F1 が 0.922、ありでは 0.914 だった。
分類テストではチャットモデルが上回り、特にデフォルトの thinking 設定で差が広がった。
| モデルと設定 | 単一ラベル(Banking77) | 28 ラベル(GoEmotions micro F1) | プロンプトインジェクション |
|---|---|---|---|
| Jev 1.13 | 80.2% | 0.228 | 74.1% |
| GPT-5.6 Luna、thinking off / default | 85.1% / 87.3% | 0.301 / 0.342 | 69.6% / 72.2% |
| GPT-5.6 Terra、thinking off / default | 83.4% / 85.4% | 0.273 / 0.324 | 80.9% / 79.1% |
| Gemini 3.8 Flash、low / default | 84.4% / 83.8% | 0.373 / 0.372 | 81.9% / 82.8% |
| Qwen3.8 Flash、off / default | 77.6% / 81.5% | 0.286 / 0.338 | 81.9% / 80.2% |
| GLM 5.3 Flash、low / default | 77.9% / 79.9% | 0.255 / 0.310 | 81.9% / 81.9% |
| DeepSeek V4.1 Flash、off / default | 77.3% / 81.8% | 0.289 / 0.365 | 82.8% / 86.2% |
| Seed 2.0 Mini、thinking off | 70.8% | 0.245 | 66.4% |
GPT-5.6 Luna と Terra は、116 件のインジェクションテキスト中 115 件、200 件のコメント中 199 件に回答した。各テストで 1 リクエストずつエラーが返ったため、精度は回答が返った件数を分母としている。yes または no 以外の回答は不正解として数えた。感情分類では、Jev は yes を返しすぎた。0.80-0.95 の確率を付けた感情が人間のラベルに含まれていた割合は、15% にすぎなかった。感情ラベルは疎で、アノテーターはコメントごとに 1-2 個しか選んでいない。このため全モデルのスコアが低くなるが、指示内容はすべてのモデルで同じだ。プロンプトインジェクションでは、Jev のデフォルト値 0.5 は適切なしきい値ではなかった。次のセクションで説明する。
Jev の信頼度は信用できるか
確率によって正解と不正解をうまく分離できるが、一般的な意味では calibration されていない。タスクごとにしきい値を調整する必要がある。calibration されている状態とは、0.8 の確率を付けた回答が 80% の確率で正しいことを指す。Banking77 では、Jev が 0.99 以上を付けた回答の 98% が正解だったが、0.8 未満では正解率が約半分だった。
Banking77 のメッセージのほぼ半数(48%)で、最上位の確率が 0.99 以上だった。この回答だけを採用し、残りをより大きなモデルへ送るパイプラインなら、トラフィックの 48% を 98% の精度で処理できる。プロンプトインジェクションでは逆の面が見える。デフォルトのしきい値 0.5 では、Jev が検出できた攻撃は半分だけだった。残り半分には 0.03-0.5 の確率が付いた。絶対値は低いが、正常テキストの中央値 0.02 よりは大半が高かった。確率順に並べると、攻撃と正常テキストを AUC 0.984 で分離できた。
| インジェクションセットのしきい値 | Jev の精度 | 検出した攻撃 | 誤検知(正常 56 件中) |
|---|---|---|---|
| 0.5(デフォルト) | 74.1% | 50.0% | 0 |
| 0.1 | 88.8% | 80.0% | 1 |
| 0.05 | 93.1% | 91.7% | 3 |
これらのしきい値は同じ 116 件のテキスト上で選んでいるため、上限値として扱うべきだ。チャットモデルでも、生成した各 token に対するモデル自身の確率である token log-probabilities を API が返す場合は、確率を取得できる。今回のチャットモデルでは、Qwen3.8 Flash と Seed 2.0 Mini が実行時にこの値を返した。Qwen3.8 Flash の「yes」に対する確率は、インジェクションテキストを AUC 0.977 で順位付けできた。
Jev と Flash LLM のどちらを使うべきか
| 処理内容 | 選択肢 | このテストに基づく理由 |
|---|---|---|
| 同じテキストについて、多数の yes/no 質問や単一選択を行う | Jev | 4.8-37 倍安く、ネットワーク時間を除いて 11-27 倍速い。精度は同程度 |
| 1 秒未満で回答する必要があるループ内の意思決定 | Jev | ネットワークを除くと 0.11-0.12 秒 |
| 長い文書について少数の判定を行う | Jev | コストは入力単価の比率に近づき、3.5-18.6 倍安い |
| 短いメッセージごとにラベルを 1 つ、最低コストで付ける | Jev、thinking を無効にした Qwen3.8 Flash または GLM 5.3 Flash | コストは同じ。LLM では log-probabilities を読まない限り確率を取得できない |
| 最も高精度なラベル付け | デフォルト設定の GPT-5.6 Luna | Banking77 で 87.3%、1,000 件あたり $0.11 |
| 数値、日付、個数のカウント、生成テキスト | チャットモデル | TypeSafe はこれらを Jev の弱点としている |
今回の実行で Jev の効果を最も引き出せたパターンは、意思決定を同じテキストに対する多数の狭い質問へ分解し、自前のラベル付きデータで調整したしきい値を超える回答だけを採用し、残りをチャットモデルへ送る構成だった。
FAQ
TypeSafe Jev とは何か?
Jev は TypeSafe の意思決定モデルだ。テキストについて型付きの質問(yes/no、単一選択、段階評価)に回答し、生成テキストではなく確率を返す。現在のバージョンは Jev 1.13 で、jev-latest alias から提供されている。料金は入力 100 万 token あたり $0.042、出力は無料だ。
Jev は LLM より安いか? 処理内容による。各サポート会話について 12 問を処理した場合、thinking を無効にした GPT-5.6 Luna のコストは Jev の 7 倍、Gemini 3.8 Flash は 37 倍だった。77 クラスから単一ラベルを選ぶ処理では、thinking を無効にした Qwen3.8 Flash および GLM 5.3 Flash と Jev のコストは同じだった。
Jev は GPT-5.6 Luna より高精度か? 今回のテストでは違った。1 ケースあたり 12 問では、thinking を無効にした GPT-5.6 Luna の micro F1 が 0.933、Jev は 0.909 だった。Banking77 では Luna が 85.1%、Jev が 80.2% だった。デフォルト設定では、Jev が Luna より多くのプロンプトインジェクションを検出した。
TypeSafe が Jev は 444 倍安いと説明しているのはなぜか? この数値は、複数ステップのワークフローで reasoning を使う frontier model と Jev を比較したものだ。TypeSafe 自身も上限寄りの数値としている。今回 Flash モデルと比較した結果では、12 問のワークフローで 4.8-37 倍安く、単一ラベルではほぼ同額だった。
Jev の確率は calibration されているか? 一般的な意味では calibration されていない。Banking77 では、確率 0.99 以上の回答は 98% が正解だったが、0.8 未満では正解率が約半分だった。プロンプトインジェクションでは、攻撃の半数に 0.5 未満の確率を付けた。タスクごとに、自前のラベル付きデータでしきい値を調整する必要がある。
関連記事:2026 年版、最適な Flash LLM API、LLM の構造化出力を比較、LLM の thinking 制御、用途別に選ぶ最適な LLM。