Jev 對決 Flash LLM:工作流程省 7 倍,單一標籤同價
目錄
TypeSafe 的 Jev 是否比 Flash LLM 便宜,取決於工作型態。針對每份客服對話紀錄詢問 12 個問題時,Jev 的成本比關閉思考的 GPT-5.6 Luna 低 7 倍;扣除網路時間後,Jev 耗時 0.12 秒,後者則是 1.66 秒。若只做一次 77 類標籤分類,Jev 與 Qwen3.8 Flash 和 GLM 5.3 Flash 的成本相同。Jev 是決策模型,不產生文字,而是針對你定義的每個問題,回傳選項、分數或機率。我們用四組取自公開資料集的測試,將它與五款 Flash 級聊天模型比較,並分別測試各模型最便宜及預設的思考設定。Jev 在所有測試中都是最快的模型,但沒有任何一項準確率最高。
TL;DR
- 每個案例詢問 12 個問題時,Flash LLM 的成本是 Jev 的 4.8 到 37 倍,耗時則是 11 到 27 倍,準確率相近。
- 每則訊息只做一次標籤分類時,Jev 與關閉思考的 Qwen3.8 Flash、GLM 5.3 Flash 成本相同。
- 使用預設思考設定時,Flash 模型執行一次標籤分類的成本是 Jev 的 1.5 到 26 倍。
- 除了提示注入測試,GPT-5.6 Luna 在所有測試中都比 Jev 準確。
- Jev 機率達 0.99 以上的答案,有 98% 正確。
Jev 是什麼?和 LLM 有何不同?
Jev 是 TypeSafe 的「System One」模型。它會讀取一段文字或 JSON(state),再回答與內容相關的型別化問題,不需要解析生成文字。問題分成三種類型:
| 問題類型 | 詢問方式 | 回傳內容 |
|---|---|---|
| Noul(TypeSafe 對是非題的稱呼) | 一個是非題 | 0 到 1 的機率 |
| Choice | 從你定義的最多 255 個選項中選一個 | 選中的選項、每個選項的機率、信賴度 |
| Score | 按照你定義的 2 到 10 個有序等級評分 | 以機率加權的分數、信賴度 |
每個請求會用名稱指定問題,並按名稱各自取得一個答案。以下請求採用 TypeSafe 文件中的格式(API 參考文件),針對一段簡短的客服對話詢問三個是非題:
curl https://api.typesafe.ai/v1/systemone \
-H "Authorization: Bearer $TYPESAFE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "jev-latest",
"state": {"transcript": "Customer: My card was declined twice today.\nAgent: One moment.\nCustomer: Also, how do I change my PIN?"},
"questions": {
"declined_card": {"type": "noul", "instructions": "In `transcript`, does the customer report a declined card payment?"},
"change_pin": {"type": "noul", "instructions": "In `transcript`, does the customer want to change a PIN?"},
"lost_card": {"type": "noul", "instructions": "In `transcript`, does the customer report a lost or stolen card?"}
}
}'
實際執行後收到的回應如下:
{
"model": "jev-1.13.0",
"answers": {
"declined_card": {"type": "noul", "noul": 0.99},
"change_pin": {"type": "noul", "noul": 0.98},
"lost_card": {"type": "noul", "noul": 0.02}
},
"usage": {"input_tokens": 359, "output_tokens": 56}
}
程式只要讀取 answers.<question>.noul,再像處理一般數值一樣與門檻比較即可。model 欄位會標示實際回答的版本。TypeSafe 發布新版時,jev-latest 會隨之更新。因此,如果你針對特定版本調整了門檻,應固定使用 jev-1.13.0。
TypeSafe 會平行處理所有問題。Jev 1.13 每百萬個輸入 token 收費 $0.042,輸出免費(模型列表)。其輸入 token 單價比 Qwen3.8 Flash 低 3.6 倍、比 GPT-5.6 Luna 低 4.8 倍,也比 Gemini 3.8 Flash 低 18 倍。輸入內容包含 TypeSafe 自己的範本,每次呼叫約 300 個 token,以及你定義的所有問題與選項。上例共計費 359 個輸入 token,成本為 $0.000015;56 個輸出 token 則免費。TypeSafe 在 Jev 的能力落差說明中列出其弱項,包括計數、算術、日期比較、多步驟問題,以及含有大量無關文字的長篇 state。
我們如何測試?
我們在 2026-09-21 與 2026-09-22 各執行一次四組測試,對象包含 Jev 與五款 Flash 聊天模型:GPT-5.6 Luna、Qwen3.8 Flash、GLM 5.3 Flash、DeepSeek V4.1 Flash 和 Gemini 3.8 Flash。每款聊天模型都使用可正常運作的最低成本思考設定,也就是關閉思考;不接受關閉的模型則設為低。在三組分類測試中,我們也另外測試供應商的預設設定。
- 每個案例 12 個問題:150 份客服對話紀錄,每份由 Banking77 資料集(PolyAI,CC BY 4.0)中的一到六則訊息組成,因此正確答案已知。每個模型都要針對每份對話回答 12 個是非題,例如「客戶是否表示信用卡遺失或遭竊?」,並為每題提供機率。Jev 在一次呼叫中送出 12 個 Noul 問題,聊天模型則回傳一個 JSON 物件。我們又抽出其中 60 份重新測試,分別在對話前加入 3,000 token 與 12,000 token 的參考文件,內容取自 Wikipedia 的銀行業相關條目。
- 單一標籤:308 則 Banking77 訊息,77 種意圖各取 4 則。Jev 接收一個含 77 個選項的 Choice 問題;聊天模型則取得相同清單並回覆意圖。
- 28 個標籤:200 則 GoEmotions 留言(Google,Apache 2.0),每則有 28 種可能情緒。
- 提示注入:deepset 的 prompt-injections 測試集(Apache 2.0),共 116 筆,每筆回答一個是非題。
成本以各供應商牌價乘上計費 token 數量計算。延遲則另行測量,每個模型執行 40 次呼叫,保持連線並扣除網路往返時間;速度章節會說明細節。我們也在三組分類測試中執行了 GPT-5.6 Terra 和 Seed 2.0 Mini。這兩款模型列在表格中,但未放入圖表。
Jev 何時比 Flash LLM 便宜?
同一段文字需要回答多個問題、輸入文字很長,或聊天模型原本會啟用思考時,Jev 較便宜。若只是替一則短訊息分類,而且便宜模型已關閉思考,兩者成本相同。
成本倍數主要受三項因素影響。第一是問題數量。聊天模型必須為每個問題產生答案,而輸出通常是成本較高的一側,例如 GPT-5.6 Luna 每百萬個輸出 token 收費 $1.20,輸入則是 $0.20。Jev 的答案免費,每增加一題只會多出約 17 個輸入 token。第二是思考。採用供應商預設設定時,聊天模型每次標籤分類的輸出中位數最高達 161 個 token;關閉思考後則只有 3 到 8 個。相對於 Jev 的成本倍數也因此提高。第三是輸入長度。加入 12,000-token 參考文件後,固定範本與答案對總成本的影響變小,倍數會接近輸入單價比:GLM 5.3 Flash 為 3.5 倍,Gemini 3.8 Flash 則高達 18.6 倍;DeepSeek V4.1 Flash 是 7.1 倍。
單一標籤測試是 Jev 對最便宜模型沒有成本優勢的情境。77 個選項讓 Jev 每次呼叫多出約 1,400 個 token,因此即使訊息只有一行,Jev 也會計費約 1,690 個輸入 token,Qwen3.8 Flash 則是 440 個。
| 測試,每 1,000 個案例的成本 | Jev | Luna | Qwen3.8 Flash | GLM 5.3 Flash | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| 每個案例 12 個問題 | $0.027 | $0.19 | $0.13 | $0.14 | $0.27 | $1.02 |
| 12 個問題,12,000-token 參考文件 | $0.43 | $2.02 | $1.57 | $1.53 | $3.06 | $8.06 |
| 單一標籤,最便宜設定 | $0.071 | $0.098 | $0.069 | $0.068 | $0.16 | $0.99 |
| 單一標籤,供應商預設設定 | $0.071 | $0.11 | $0.19 | $0.13 | $0.61 | $1.83 |
Jev 快多少?
扣除網路時間後,Jev 約快 7 到 28 倍。Jev 的中位數是 0.11 到 0.12 秒,聊天模型則需 0.79 到 3.25 秒。
我們對每個模型和任務依序呼叫 40 次,全程重複使用同一條連線,並減去在同一條連線上以不做模型運算的請求測得的往返時間。剩下的是模型本身的耗時,加上從我們的代理到各家服務商的那段路徑,所有模型走的都是同一條路徑。
| 扣除網路後的秒數,中位數(第 95 百分位) | Jev | GPT-5.6 Luna | Qwen3.8 Flash | GLM 5.3 Flash | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| 單一標籤,最便宜設定 | 0.11 (0.21) | 1.33 (1.80) | 0.96 (1.68) | 1.22 (3.06) | 0.79 (1.35) | 1.95 (3.76) |
| 單一標籤,供應商預設設定 | 0.11 (0.21) | 1.45 (5.29) | 3.25 (21.5) | 2.97 (7.32) | 1.19 (10.4) | 2.18 (8.22) |
| 每個案例 12 個問題 | 0.12 (0.20) | 1.66 (2.56) | 3.21 (5.21) | 3.13 (6.20) | 1.33 (1.70) | 2.14 (2.89) |
第 95 百分位最能看出思考造成的延遲。採用供應商預設設定時,Qwen3.8 Flash 每 20 次單一標籤呼叫中,就有一次超過 21 秒。Jev 最慢的呼叫仍維持在 0.2 秒左右。
增加問題數並不會拖慢 Jev:針對同一張客服工單,從 1 個問題增加到 60 個是非題,中位延遲的變化不到 0.1 秒,而 60 個問題的那次呼叫計費 1,371 個輸入 token,成本為 $0.000058。20 題的呼叫共執行五次,每次的每個答案都正確。
這些結果和 TypeSafe 自己的說法一致嗎?
方向一致,但差距較小,因為比較基準不同。TypeSafe 的發布文章宣稱最高可省 444.6 倍成本、快 193.6 倍。這些數據是把 Jev 與啟用 reasoning 的前沿模型比較,工作內容則是多步驟流程。TypeSafe 自己也稱這些數字是「實際使用情境中較高的一端」(發布文章)。
其公開的工作流程評測包含 GPT-5.6 Luna。Jev 每個案例的準確率為 67.8%,成本 $0.0004,耗時 0.4 秒;Luna 則是 66.8%、$0.0033 和 12.9 秒。Jev 約便宜 8 倍、快 32 倍。我們在 12 題測試中測得,關閉思考的 Luna 成本是 Jev 的 7 倍,扣除網路後耗時為 14 倍,數量級相同。若與最便宜的 Flash 模型比較單一標籤工作,成本差距則完全消失。
Jev 和 Flash LLM 一樣準確嗎?
工作流程測試的結果接近,分類測試則落後,而且 Jev 從未拿下第一。在每個案例 12 題的測試中,Jev 的 micro F1 落在聊天模型的範圍內。這項指標會把所有問題的「是」與「否」一起計算,1.0 代表完全正確。Jev 的機率對正確與錯誤答案的排序能力,也和表現最好的聊天模型大致相當。
| 每個案例 12 個問題(150 份對話紀錄) | 門檻 0.5 的 Micro F1 | 12 題全對 | AUC |
|---|---|---|---|
| Jev 1.13 | 0.909 | 61.3% | 0.990 |
| GPT-5.6 Luna,關閉思考 | 0.933 | 71.3% | 0.973 |
| GPT-5.6 Luna,預設設定 | 0.931 | 71.3% | 0.992 |
| Gemini 3.8 Flash,低 | 0.919 | 66.7% | 0.974 |
| Qwen3.8 Flash,關閉思考 | 0.913 | 62.7% | 0.975 |
| GLM 5.3 Flash,低 | 0.906 | 64.7% | 0.975 |
| DeepSeek V4.1 Flash,關閉思考 | 0.896 | 60.0% | 0.958 |
AUC 衡量機率的排序能力。1.0 代表每個正確的「是」都比每個「否」得到更高的機率。前面加入 12,000-token 參考文件後,Jev 的準確率沒有下降。在同一批 60 份對話紀錄中,加入文件後的 F1 為 0.914,未加入時則為 0.922。
在分類測試中,聊天模型明顯領先,尤其是在供應商預設的思考設定下:
| 模型與設定 | 單一標籤(Banking77) | 28 個標籤(GoEmotions micro F1) | 提示注入 |
|---|---|---|---|
| Jev 1.13 | 80.2% | 0.228 | 74.1% |
| GPT-5.6 Luna,關閉思考/預設設定 | 85.1% / 87.3% | 0.301 / 0.342 | 69.6% / 72.2% |
| GPT-5.6 Terra,關閉思考/預設設定 | 83.4% / 85.4% | 0.273 / 0.324 | 80.9% / 79.1% |
| Gemini 3.8 Flash,低/預設設定 | 84.4% / 83.8% | 0.373 / 0.372 | 81.9% / 82.8% |
| Qwen3.8 Flash,關閉/預設設定 | 77.6% / 81.5% | 0.286 / 0.338 | 81.9% / 80.2% |
| GLM 5.3 Flash,低/預設設定 | 77.9% / 79.9% | 0.255 / 0.310 | 81.9% / 81.9% |
| DeepSeek V4.1 Flash,關閉/預設設定 | 77.3% / 81.8% | 0.289 / 0.365 | 82.8% / 86.2% |
| Seed 2.0 Mini,關閉思考 | 70.8% | 0.245 | 66.4% |
GPT-5.6 Luna 與 Terra 在 116 筆提示注入文字中回答了 115 筆,在 200 則留言中則回答了 199 則。兩者各有一個請求回傳錯誤,因此準確率是按成功取得的答案計算。未回覆「是」或「否」一律算錯。在情緒測試中,Jev 太常回答「是」。它對某種情緒給出 0.80 到 0.95 的機率時,只有 15% 符合人工標籤。情緒標籤本來就很稀疏,每則留言的標註者只選一到兩種情緒,因此所有模型的分數都被拉低。不過,每個模型收到的指示相同。在提示注入測試中,Jev 預設的 0.5 並非合適門檻,下一節會說明。
Jev 的信賴度可信嗎?
它的機率能有效區分正確與錯誤答案,但並不符合一般意義上的校準,因此每項工作都要設定自己的門檻。所謂已校準,是指機率為 0.8 的答案有 80% 正確。在 Banking77 上,Jev 機率達 0.99 以上的答案有 98% 正確,低於 0.8 時則大約只有一半正確。
Banking77 中將近一半的訊息(48%)最高機率達 0.99 以上。因此,pipeline 可以直接接受這些結果,再把其餘訊息交給更大的模型處理。如此一來,這部分流量仍能維持 98% 的準確率。提示注入則呈現另一面。採用預設的 0.5 門檻時,Jev 只偵測到一半的攻擊。另一半的機率介於 0.03 到 0.5,絕對值雖低,但仍大多高於正常文字,後者的中位數為 0.02。若按機率排序,Jev 區分攻擊與正常文字的 AUC 可達 0.984。
| 提示注入資料集的門檻 | Jev 準確率 | 偵測到的攻擊 | 誤報數(共 56 筆正常文字) |
|---|---|---|---|
| 0.5(預設) | 74.1% | 50.0% | 0 |
| 0.1 | 88.8% | 80.0% | 1 |
| 0.05 | 93.1% | 91.7% | 3 |
這些門檻是直接用同一批 116 筆文字挑出的,因此只能視為上限。如果聊天模型的 API 會回傳 token log-probabilities,也就是模型對自己產生的每個 token 所估計的機率,它同樣可以提供機率。在這次測試的聊天模型中,Qwen3.8 Flash 與 Seed 2.0 Mini 都有回傳。Qwen3.8 Flash 對「yes」給出的機率,在提示注入文字上的排序 AUC 為 0.977。
該選 Jev 還是 Flash LLM?
| 工作類型 | 建議使用 | 本次測試的理由 |
|---|---|---|
| 針對同一段文字詢問多個是非題或單選題 | Jev | 便宜 4.8 到 37 倍,扣除網路後快 11 到 27 倍,準確率相近 |
| 迴圈中的決策,而且必須在一秒內回覆 | Jev | 扣除網路後 0.11 到 0.12 秒 |
| 長篇文件,每份只需要少數判斷 | Jev | 成本會接近輸入單價比,低 3.5 到 18.6 倍 |
| 每則短訊息只做一次標籤分類,並追求最低成本 | Jev、關閉思考的 Qwen3.8 Flash 或 GLM 5.3 Flash | 成本相同;除非讀取 log-probabilities,否則 LLM 不會回傳機率 |
| 追求最準確的標籤 | 採用預設設定的 GPT-5.6 Luna | Banking77 準確率 87.3%,每 1,000 筆成本 $0.11 |
| 數字、日期、計數或生成文字 | 聊天模型 | TypeSafe 將這些列為 Jev 的弱項 |
本次測試中,最能發揮 Jev 優勢的做法是:把決策拆成多個針對同一段文字的明確小問題;使用自己的標註資料調整門檻,直接處理高於門檻的答案;其餘再交給聊天模型。
常見問題
TypeSafe Jev 是什麼?
Jev 是 TypeSafe 的決策模型。它會針對一段文字回答型別化問題,包括是非題、單選題及量表評分,並回傳機率而非生成文字。Jev 1.13 是目前版本,透過 jev-latest 別名提供服務。每百萬個輸入 token 收費 $0.042,輸出免費。
Jev 比 LLM 便宜嗎? 取決於工作型態。針對每份客服對話紀錄詢問 12 個問題時,關閉思考的 GPT-5.6 Luna 成本是 Jev 的 7 倍,Gemini 3.8 Flash 則是 37 倍。若只執行一次 77 類標籤分類,關閉思考的 Qwen3.8 Flash 和 GLM 5.3 Flash 與 Jev 成本相同。
Jev 比 GPT-5.6 Luna 準確嗎? 我們的測試結果並非如此。在每個案例 12 題的測試中,關閉思考的 GPT-5.6 Luna micro F1 為 0.933,Jev 則是 0.909;在 Banking77 上,兩者分別為 85.1% 與 80.2%。不過,在預設門檻下,Jev 偵測到的提示注入比關閉思考的 Luna 更多。
TypeSafe 為何聲稱 Jev 可便宜 444 倍? 該數字比較的是 Jev 與在多步驟工作流程中啟用 reasoning 的前沿模型,TypeSafe 也將其稱為較高的一端。我們與 Flash 模型比較後,測得 Jev 在 12 題工作流程中便宜 4.8 到 37 倍,單一標籤的成本則大致相同。
Jev 的機率有經過校準嗎? 一般意義上沒有。在 Banking77 上,機率達 0.99 以上的答案有 98% 正確,但低於 0.8 時只有約一半正確。在提示注入測試中,一半攻擊的機率低於 0.5。請針對每項工作,使用自己的標註資料調整門檻。
延伸閱讀:2026 年最佳 Flash LLM API、LLM 結構化輸出比較、LLM 思考控制、依使用情境選擇最佳 LLM。