新用戶 免費註冊,送 10 次呼叫,最高 $1,免綁卡。

Jev 對決 Flash LLM:工作流程省 7 倍,單一標籤同價

目錄
  1. Jev 是什麼?和 LLM 有何不同?
  2. 我們如何測試?
  3. Jev 何時比 Flash LLM 便宜?
  4. Jev 快多少?
  5. 這些結果和 TypeSafe 自己的說法一致嗎?
  6. Jev 和 Flash LLM 一樣準確嗎?
  7. Jev 的信賴度可信嗎?
  8. 該選 Jev 還是 Flash LLM?
  9. 常見問題

TypeSafe 的 Jev 是否比 Flash LLM 便宜,取決於工作型態。針對每份客服對話紀錄詢問 12 個問題時,Jev 的成本比關閉思考的 GPT-5.6 Luna 低 7 倍;扣除網路時間後,Jev 耗時 0.12 秒,後者則是 1.66 秒。若只做一次 77 類標籤分類,Jev 與 Qwen3.8 FlashGLM 5.3 Flash 的成本相同。Jev 是決策模型,不產生文字,而是針對你定義的每個問題,回傳選項、分數或機率。我們用四組取自公開資料集的測試,將它與五款 Flash 級聊天模型比較,並分別測試各模型最便宜及預設的思考設定。Jev 在所有測試中都是最快的模型,但沒有任何一項準確率最高。

TL;DR

  • 每個案例詢問 12 個問題時,Flash LLM 的成本是 Jev 的 4.8 到 37 倍,耗時則是 11 到 27 倍,準確率相近。
  • 每則訊息只做一次標籤分類時,Jev 與關閉思考的 Qwen3.8 Flash、GLM 5.3 Flash 成本相同。
  • 使用預設思考設定時,Flash 模型執行一次標籤分類的成本是 Jev 的 1.5 到 26 倍。
  • 除了提示注入測試,GPT-5.6 Luna 在所有測試中都比 Jev 準確。
  • Jev 機率達 0.99 以上的答案,有 98% 正確。

Jev 是什麼?和 LLM 有何不同?

Jev 是 TypeSafe 的「System One」模型。它會讀取一段文字或 JSON(state),再回答與內容相關的型別化問題,不需要解析生成文字。問題分成三種類型:

問題類型詢問方式回傳內容
Noul(TypeSafe 對是非題的稱呼)一個是非題0 到 1 的機率
Choice從你定義的最多 255 個選項中選一個選中的選項、每個選項的機率、信賴度
Score按照你定義的 2 到 10 個有序等級評分以機率加權的分數、信賴度

每個請求會用名稱指定問題,並按名稱各自取得一個答案。以下請求採用 TypeSafe 文件中的格式(API 參考文件),針對一段簡短的客服對話詢問三個是非題:

curl https://api.typesafe.ai/v1/systemone \
  -H "Authorization: Bearer $TYPESAFE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "jev-latest",
    "state": {"transcript": "Customer: My card was declined twice today.\nAgent: One moment.\nCustomer: Also, how do I change my PIN?"},
    "questions": {
      "declined_card": {"type": "noul", "instructions": "In `transcript`, does the customer report a declined card payment?"},
      "change_pin":    {"type": "noul", "instructions": "In `transcript`, does the customer want to change a PIN?"},
      "lost_card":     {"type": "noul", "instructions": "In `transcript`, does the customer report a lost or stolen card?"}
    }
  }'

實際執行後收到的回應如下:

{
  "model": "jev-1.13.0",
  "answers": {
    "declined_card": {"type": "noul", "noul": 0.99},
    "change_pin":    {"type": "noul", "noul": 0.98},
    "lost_card":     {"type": "noul", "noul": 0.02}
  },
  "usage": {"input_tokens": 359, "output_tokens": 56}
}

程式只要讀取 answers.<question>.noul,再像處理一般數值一樣與門檻比較即可。model 欄位會標示實際回答的版本。TypeSafe 發布新版時,jev-latest 會隨之更新。因此,如果你針對特定版本調整了門檻,應固定使用 jev-1.13.0

TypeSafe 會平行處理所有問題。Jev 1.13 每百萬個輸入 token 收費 $0.042,輸出免費(模型列表)。其輸入 token 單價比 Qwen3.8 Flash 低 3.6 倍、比 GPT-5.6 Luna 低 4.8 倍,也比 Gemini 3.8 Flash 低 18 倍。輸入內容包含 TypeSafe 自己的範本,每次呼叫約 300 個 token,以及你定義的所有問題與選項。上例共計費 359 個輸入 token,成本為 $0.000015;56 個輸出 token 則免費。TypeSafe 在 Jev 的能力落差說明中列出其弱項,包括計數、算術、日期比較、多步驟問題,以及含有大量無關文字的長篇 state。

我們如何測試?

我們在 2026-09-21 與 2026-09-22 各執行一次四組測試,對象包含 Jev 與五款 Flash 聊天模型:GPT-5.6 LunaQwen3.8 FlashGLM 5.3 FlashDeepSeek V4.1 FlashGemini 3.8 Flash。每款聊天模型都使用可正常運作的最低成本思考設定,也就是關閉思考;不接受關閉的模型則設為低。在三組分類測試中,我們也另外測試供應商的預設設定。

  • 每個案例 12 個問題:150 份客服對話紀錄,每份由 Banking77 資料集(PolyAI,CC BY 4.0)中的一到六則訊息組成,因此正確答案已知。每個模型都要針對每份對話回答 12 個是非題,例如「客戶是否表示信用卡遺失或遭竊?」,並為每題提供機率。Jev 在一次呼叫中送出 12 個 Noul 問題,聊天模型則回傳一個 JSON 物件。我們又抽出其中 60 份重新測試,分別在對話前加入 3,000 token 與 12,000 token 的參考文件,內容取自 Wikipedia 的銀行業相關條目。
  • 單一標籤:308 則 Banking77 訊息,77 種意圖各取 4 則。Jev 接收一個含 77 個選項的 Choice 問題;聊天模型則取得相同清單並回覆意圖。
  • 28 個標籤:200 則 GoEmotions 留言(Google,Apache 2.0),每則有 28 種可能情緒。
  • 提示注入:deepset 的 prompt-injections 測試集(Apache 2.0),共 116 筆,每筆回答一個是非題。

成本以各供應商牌價乘上計費 token 數量計算。延遲則另行測量,每個模型執行 40 次呼叫,保持連線並扣除網路往返時間;速度章節會說明細節。我們也在三組分類測試中執行了 GPT-5.6 TerraSeed 2.0 Mini。這兩款模型列在表格中,但未放入圖表。

Jev 何時比 Flash LLM 便宜?

同一段文字需要回答多個問題、輸入文字很長,或聊天模型原本會啟用思考時,Jev 較便宜。若只是替一則短訊息分類,而且便宜模型已關閉思考,兩者成本相同。

長條圖比較四種工作型態下,各 Flash 模型每個案例的成本相對於 Jev 1.13 的倍數。GPT-5.6 Luna:最便宜設定下的單一標籤為 1.4 倍、預設設定為 1.5 倍、每個案例 12 個問題為 7.0 倍、12 個問題加 12,000-token 參考文件為 4.7 倍。Qwen3.8 Flash:0.97 倍、2.7 倍、4.8 倍、3.6 倍。GLM 5.3 Flash:0.95 倍、1.9 倍、5.0 倍、3.5 倍。DeepSeek V4.1 Flash:2.2 倍、8.6 倍、9.8 倍、7.1 倍。Gemini 3.8 Flash:14.0 倍、25.7 倍、37.0 倍、18.6 倍

成本倍數主要受三項因素影響。第一是問題數量。聊天模型必須為每個問題產生答案,而輸出通常是成本較高的一側,例如 GPT-5.6 Luna 每百萬個輸出 token 收費 $1.20,輸入則是 $0.20。Jev 的答案免費,每增加一題只會多出約 17 個輸入 token。第二是思考。採用供應商預設設定時,聊天模型每次標籤分類的輸出中位數最高達 161 個 token;關閉思考後則只有 3 到 8 個。相對於 Jev 的成本倍數也因此提高。第三是輸入長度。加入 12,000-token 參考文件後,固定範本與答案對總成本的影響變小,倍數會接近輸入單價比:GLM 5.3 Flash 為 3.5 倍,Gemini 3.8 Flash 則高達 18.6 倍;DeepSeek V4.1 Flash 是 7.1 倍。

單一標籤測試是 Jev 對最便宜模型沒有成本優勢的情境。77 個選項讓 Jev 每次呼叫多出約 1,400 個 token,因此即使訊息只有一行,Jev 也會計費約 1,690 個輸入 token,Qwen3.8 Flash 則是 440 個。

測試,每 1,000 個案例的成本JevLunaQwen3.8 FlashGLM 5.3 FlashDeepSeek V4.1 FlashGemini 3.8 Flash
每個案例 12 個問題$0.027$0.19$0.13$0.14$0.27$1.02
12 個問題,12,000-token 參考文件$0.43$2.02$1.57$1.53$3.06$8.06
單一標籤,最便宜設定$0.071$0.098$0.069$0.068$0.16$0.99
單一標籤,供應商預設設定$0.071$0.11$0.19$0.13$0.61$1.83

Jev 快多少?

扣除網路時間後,Jev 約快 7 到 28 倍。Jev 的中位數是 0.11 到 0.12 秒,聊天模型則需 0.79 到 3.25 秒。

我們對每個模型和任務依序呼叫 40 次,全程重複使用同一條連線,並減去在同一條連線上以不做模型運算的請求測得的往返時間。剩下的是模型本身的耗時,加上從我們的代理到各家服務商的那段路徑,所有模型走的都是同一條路徑。

扣除網路後的秒數,中位數(第 95 百分位)JevGPT-5.6 LunaQwen3.8 FlashGLM 5.3 FlashDeepSeek V4.1 FlashGemini 3.8 Flash
單一標籤,最便宜設定0.11 (0.21)1.33 (1.80)0.96 (1.68)1.22 (3.06)0.79 (1.35)1.95 (3.76)
單一標籤,供應商預設設定0.11 (0.21)1.45 (5.29)3.25 (21.5)2.97 (7.32)1.19 (10.4)2.18 (8.22)
每個案例 12 個問題0.12 (0.20)1.66 (2.56)3.21 (5.21)3.13 (6.20)1.33 (1.70)2.14 (2.89)

第 95 百分位最能看出思考造成的延遲。採用供應商預設設定時,Qwen3.8 Flash 每 20 次單一標籤呼叫中,就有一次超過 21 秒。Jev 最慢的呼叫仍維持在 0.2 秒左右。

增加問題數並不會拖慢 Jev:針對同一張客服工單,從 1 個問題增加到 60 個是非題,中位延遲的變化不到 0.1 秒,而 60 個問題的那次呼叫計費 1,371 個輸入 token,成本為 $0.000058。20 題的呼叫共執行五次,每次的每個答案都正確。

這些結果和 TypeSafe 自己的說法一致嗎?

方向一致,但差距較小,因為比較基準不同。TypeSafe 的發布文章宣稱最高可省 444.6 倍成本、快 193.6 倍。這些數據是把 Jev 與啟用 reasoning 的前沿模型比較,工作內容則是多步驟流程。TypeSafe 自己也稱這些數字是「實際使用情境中較高的一端」(發布文章)。

其公開的工作流程評測包含 GPT-5.6 Luna。Jev 每個案例的準確率為 67.8%,成本 $0.0004,耗時 0.4 秒;Luna 則是 66.8%、$0.0033 和 12.9 秒。Jev 約便宜 8 倍、快 32 倍。我們在 12 題測試中測得,關閉思考的 Luna 成本是 Jev 的 7 倍,扣除網路後耗時為 14 倍,數量級相同。若與最便宜的 Flash 模型比較單一標籤工作,成本差距則完全消失。

Jev 和 Flash LLM 一樣準確嗎?

工作流程測試的結果接近,分類測試則落後,而且 Jev 從未拿下第一。在每個案例 12 題的測試中,Jev 的 micro F1 落在聊天模型的範圍內。這項指標會把所有問題的「是」與「否」一起計算,1.0 代表完全正確。Jev 的機率對正確與錯誤答案的排序能力,也和表現最好的聊天模型大致相當。

每個案例 12 個問題(150 份對話紀錄)門檻 0.5 的 Micro F112 題全對AUC
Jev 1.130.90961.3%0.990
GPT-5.6 Luna,關閉思考0.93371.3%0.973
GPT-5.6 Luna,預設設定0.93171.3%0.992
Gemini 3.8 Flash,低0.91966.7%0.974
Qwen3.8 Flash,關閉思考0.91362.7%0.975
GLM 5.3 Flash,低0.90664.7%0.975
DeepSeek V4.1 Flash,關閉思考0.89660.0%0.958

AUC 衡量機率的排序能力。1.0 代表每個正確的「是」都比每個「否」得到更高的機率。前面加入 12,000-token 參考文件後,Jev 的準確率沒有下降。在同一批 60 份對話紀錄中,加入文件後的 F1 為 0.914,未加入時則為 0.922。

在分類測試中,聊天模型明顯領先,尤其是在供應商預設的思考設定下:

模型與設定單一標籤(Banking77)28 個標籤(GoEmotions micro F1)提示注入
Jev 1.1380.2%0.22874.1%
GPT-5.6 Luna,關閉思考/預設設定85.1% / 87.3%0.301 / 0.34269.6% / 72.2%
GPT-5.6 Terra,關閉思考/預設設定83.4% / 85.4%0.273 / 0.32480.9% / 79.1%
Gemini 3.8 Flash,低/預設設定84.4% / 83.8%0.373 / 0.37281.9% / 82.8%
Qwen3.8 Flash,關閉/預設設定77.6% / 81.5%0.286 / 0.33881.9% / 80.2%
GLM 5.3 Flash,低/預設設定77.9% / 79.9%0.255 / 0.31081.9% / 81.9%
DeepSeek V4.1 Flash,關閉/預設設定77.3% / 81.8%0.289 / 0.36582.8% / 86.2%
Seed 2.0 Mini,關閉思考70.8%0.24566.4%

GPT-5.6 Luna 與 Terra 在 116 筆提示注入文字中回答了 115 筆,在 200 則留言中則回答了 199 則。兩者各有一個請求回傳錯誤,因此準確率是按成功取得的答案計算。未回覆「是」或「否」一律算錯。在情緒測試中,Jev 太常回答「是」。它對某種情緒給出 0.80 到 0.95 的機率時,只有 15% 符合人工標籤。情緒標籤本來就很稀疏,每則留言的標註者只選一到兩種情緒,因此所有模型的分數都被拉低。不過,每個模型收到的指示相同。在提示注入測試中,Jev 預設的 0.5 並非合適門檻,下一節會說明。

Jev 的信賴度可信嗎?

它的機率能有效區分正確與錯誤答案,但並不符合一般意義上的校準,因此每項工作都要設定自己的門檻。所謂已校準,是指機率為 0.8 的答案有 80% 正確。在 Banking77 上,Jev 機率達 0.99 以上的答案有 98% 正確,低於 0.8 時則大約只有一半正確。

長條圖顯示 Jev 1.13 在 Banking77 上依最高選項機率區分的準確率:0.99 到 1.00,涵蓋 48% 的訊息,其中 98% 正確;0.95 到 0.99,81%;0.90 到 0.95,77%;0.80 到 0.90,75%;0.70 到 0.80,52%;0.50 到 0.70,40%;低於 0.50,42%

Banking77 中將近一半的訊息(48%)最高機率達 0.99 以上。因此,pipeline 可以直接接受這些結果,再把其餘訊息交給更大的模型處理。如此一來,這部分流量仍能維持 98% 的準確率。提示注入則呈現另一面。採用預設的 0.5 門檻時,Jev 只偵測到一半的攻擊。另一半的機率介於 0.03 到 0.5,絕對值雖低,但仍大多高於正常文字,後者的中位數為 0.02。若按機率排序,Jev 區分攻擊與正常文字的 AUC 可達 0.984。

提示注入資料集的門檻Jev 準確率偵測到的攻擊誤報數(共 56 筆正常文字)
0.5(預設)74.1%50.0%0
0.188.8%80.0%1
0.0593.1%91.7%3

這些門檻是直接用同一批 116 筆文字挑出的,因此只能視為上限。如果聊天模型的 API 會回傳 token log-probabilities,也就是模型對自己產生的每個 token 所估計的機率,它同樣可以提供機率。在這次測試的聊天模型中,Qwen3.8 FlashSeed 2.0 Mini 都有回傳。Qwen3.8 Flash 對「yes」給出的機率,在提示注入文字上的排序 AUC 為 0.977。

該選 Jev 還是 Flash LLM?

工作類型建議使用本次測試的理由
針對同一段文字詢問多個是非題或單選題Jev便宜 4.8 到 37 倍,扣除網路後快 11 到 27 倍,準確率相近
迴圈中的決策,而且必須在一秒內回覆Jev扣除網路後 0.11 到 0.12 秒
長篇文件,每份只需要少數判斷Jev成本會接近輸入單價比,低 3.5 到 18.6 倍
每則短訊息只做一次標籤分類,並追求最低成本Jev、關閉思考的 Qwen3.8 FlashGLM 5.3 Flash成本相同;除非讀取 log-probabilities,否則 LLM 不會回傳機率
追求最準確的標籤採用預設設定的 GPT-5.6 LunaBanking77 準確率 87.3%,每 1,000 筆成本 $0.11
數字、日期、計數或生成文字聊天模型TypeSafe 將這些列為 Jev 的弱項

本次測試中,最能發揮 Jev 優勢的做法是:把決策拆成多個針對同一段文字的明確小問題;使用自己的標註資料調整門檻,直接處理高於門檻的答案;其餘再交給聊天模型。

常見問題

TypeSafe Jev 是什麼? Jev 是 TypeSafe 的決策模型。它會針對一段文字回答型別化問題,包括是非題、單選題及量表評分,並回傳機率而非生成文字。Jev 1.13 是目前版本,透過 jev-latest 別名提供服務。每百萬個輸入 token 收費 $0.042,輸出免費。

Jev 比 LLM 便宜嗎? 取決於工作型態。針對每份客服對話紀錄詢問 12 個問題時,關閉思考的 GPT-5.6 Luna 成本是 Jev 的 7 倍,Gemini 3.8 Flash 則是 37 倍。若只執行一次 77 類標籤分類,關閉思考的 Qwen3.8 FlashGLM 5.3 Flash 與 Jev 成本相同。

Jev 比 GPT-5.6 Luna 準確嗎? 我們的測試結果並非如此。在每個案例 12 題的測試中,關閉思考的 GPT-5.6 Luna micro F1 為 0.933,Jev 則是 0.909;在 Banking77 上,兩者分別為 85.1% 與 80.2%。不過,在預設門檻下,Jev 偵測到的提示注入比關閉思考的 Luna 更多。

TypeSafe 為何聲稱 Jev 可便宜 444 倍? 該數字比較的是 Jev 與在多步驟工作流程中啟用 reasoning 的前沿模型,TypeSafe 也將其稱為較高的一端。我們與 Flash 模型比較後,測得 Jev 在 12 題工作流程中便宜 4.8 到 37 倍,單一標籤的成本則大致相同。

Jev 的機率有經過校準嗎? 一般意義上沒有。在 Banking77 上,機率達 0.99 以上的答案有 98% 正確,但低於 0.8 時只有約一半正確。在提示注入測試中,一半攻擊的機率低於 0.5。請針對每項工作,使用自己的標註資料調整門檻。

延伸閱讀:2026 年最佳 Flash LLM APILLM 結構化輸出比較LLM 思考控制依使用情境選擇最佳 LLM

← 返回部落格