新人 免费注册,送 10 次调用,最高 $1,免绑卡。

Jev 对比 Flash LLM:工作流便宜 7 倍,单标签成本相同

目录
  1. Jev 是什么?与 LLM 有什么不同?
  2. 我们如何测试?
  3. Jev 在什么情况下比 Flash LLM 便宜?
  4. Jev 快多少?
  5. 这些结果与 TypeSafe 自己的说法相比如何?
  6. Jev 的准确率能达到 Flash LLM 水平吗?
  7. Jev 的置信度可靠吗?
  8. 应该使用 Jev 还是 Flash LLM?
  9. 常见问题

TypeSafe 的 Jev 是否比 Flash LLM 便宜,取决于任务形态。对每段客服对话提出 12 个问题时,Jev 的成本比关闭 thinking 的 GPT-5.6 Luna 低 7 倍;扣除网络耗时后,Jev 用时 0.12 秒,后者为 1.66 秒。对于 77 选 1 的单标签任务,Jev 的成本与 Qwen3.8 FlashGLM 5.3 Flash 相同。Jev 是一种决策模型,不生成文本,而是针对你定义的每个问题返回选项、分数或概率。我们使用 4 组基于公开数据集构建的测试,将 Jev 与 5 款 Flash 级聊天模型进行对比,分别采用各模型成本最低的设置和默认 thinking 设置。Jev 在每项测试中都是最快的,但准确率没有一次最高。

TL;DR

  • 每个样本回答 12 个问题时,Flash LLM 的成本是 Jev 的 4.8 到 37 倍,耗时是 11 到 27 倍,准确率相近。
  • 每条消息只输出一个标签时,关闭 thinking 的 Qwen3.8 Flash 和 GLM 5.3 Flash 与 Jev 成本相同。
  • 使用默认 thinking 时,Flash 模型处理单标签任务的成本是 Jev 的 1.5 到 26 倍。
  • 除提示词注入外,GPT-5.6 Luna 在每项测试中的准确率都高于 Jev。
  • Jev 概率达到 0.99 或以上的答案中,98% 正确。

Jev 是什么?与 LLM 有什么不同?

Jev 是 TypeSafe 的「System One」模型。它读取一段文本或 JSON(即状态),针对内容回答带类型的问题,不生成需要解析的文本。问题分为 3 类:

问题类型提问方式返回内容
Noul(TypeSafe 对是非题的命名)一个是非问题0 到 1 的概率
Choice从你定义的最多 255 个选项中选择一个选中的选项、所有选项的概率、置信度
Score按你定义的 2 到 10 个有序等级评分概率加权后的分数、置信度

请求按名称提交问题,每个名称对应一个答案。下面的请求采用 TypeSafe 文档中的格式(API 参考),针对一段简短的客服对话提出 3 个是非问题:

curl https://api.typesafe.ai/v1/systemone \
  -H "Authorization: Bearer $TYPESAFE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "jev-latest",
    "state": {"transcript": "Customer: My card was declined twice today.\nAgent: One moment.\nCustomer: Also, how do I change my PIN?"},
    "questions": {
      "declined_card": {"type": "noul", "instructions": "In `transcript`, does the customer report a declined card payment?"},
      "change_pin":    {"type": "noul", "instructions": "In `transcript`, does the customer want to change a PIN?"},
      "lost_card":     {"type": "noul", "instructions": "In `transcript`, does the customer report a lost or stolen card?"}
    }
  }'

实际返回结果如下:

{
  "model": "jev-1.13.0",
  "answers": {
    "declined_card": {"type": "noul", "noul": 0.99},
    "change_pin":    {"type": "noul", "noul": 0.98},
    "lost_card":     {"type": "noul", "noul": 0.02}
  },
  "usage": {"input_tokens": 359, "output_tokens": 56}
}

代码读取 answers.<question>.noul,再像比较普通数值一样与阈值比较。model 字段表示实际回答请求的版本。TypeSafe 发布新版本时,jev-latest 会随之更新。如果阈值是针对特定版本调优的,应固定使用 jev-1.13.0

TypeSafe 会并行处理这些问题。Jev 1.13 的输入价格为每百万 token $0.042,输出免费(模型列表)。按输入 token 计价,它比 Qwen3.8 Flash 低 3.6 倍,比 GPT-5.6 Luna 低 4.8 倍,比 Gemini 3.8 Flash 低 18 倍。输入包括 TypeSafe 自带的模板,每次调用约 300 个 token,以及你定义的全部问题和选项。上面的请求计费输入为 359 个 token,成本 $0.000015,56 个输出 token 免费。TypeSafe 在 Jev 的能力短板说明中列出了它不擅长的任务:计数、算术、日期比较、多步问题,以及包含大量无关文本的长状态。

我们如何测试?

我们设计了 4 项测试,并在 2026-09-21 和 2026-09-22 各运行一次。参测模型包括 Jev 和 5 款 Flash 聊天模型:GPT-5.6 LunaQwen3.8 FlashGLM 5.3 FlashDeepSeek V4.1 FlashGemini 3.8 Flash。每款聊天模型都采用能正常工作的最低成本 thinking 设置,支持关闭的就关闭,不支持的则设为 low。在 3 项分类测试中,还额外使用厂商默认设置运行了一遍。

  • 每个样本 12 个问题:150 段客服对话,每段由 Banking77 数据集(PolyAI,CC BY 4.0)中的 1 到 6 条消息组合而成,因此正确答案已知。每个模型都要针对每段对话回答 12 个是非问题,例如「客户是否报告银行卡丢失或被盗?」,并为每个问题给出概率。Jev 在一次调用中提交 12 个 Noul 问题,聊天模型则返回一个 JSON 对象。我们还从中选取 60 段对话重新测试,在对话前分别加入 3,000 个 token 和 12,000 个 token 的参考文档,内容来自 Wikipedia 的银行相关文章。
  • 单标签:308 条 Banking77 消息,77 个意图各取 4 条。Jev 接收一个包含 77 个选项的 Choice,聊天模型接收相同列表并返回意图。
  • 28 个标签:200 条 GoEmotions 评论(Google,Apache 2.0),每条有 28 种可能的情绪。
  • 提示词注入:deepset prompt-injections 测试集(Apache 2.0),共 116 行,每行回答一个是非问题。

成本按各厂商标价乘以计费 token 数计算。延迟来自另一组测试:每个模型连续调用 40 次,复用连接,并扣除网络往返时间。测速方法将在速度一节详细说明。我们还在 3 项分类测试中运行了 GPT-5.6 TerraSeed 2.0 Mini。它们出现在表格中,但不在图表里。

Jev 在什么情况下比 Flash LLM 便宜?

同一段文本需要回答多个问题、文本很长,或者聊天模型原本需要 thinking 时,Jev 更便宜。如果只是给一条短消息打一个标签,并且使用关闭 thinking 的低价模型,Jev 的成本没有优势。

各 Flash 模型在 4 种任务形态下,每个样本成本相对于 Jev 1.13 的倍数柱状图。GPT-5.6 Luna:最低成本设置下单标签为 1.4x,默认设置为 1.5x,每个样本 12 个问题为 7.0x,12 个问题加 12,000-token 参考文档为 4.7x。Qwen3.8 Flash:0.97x、2.7x、4.8x、3.6x。GLM 5.3 Flash:0.95x、1.9x、5.0x、3.5x。DeepSeek V4.1 Flash:2.2x、8.6x、9.8x、7.1x。Gemini 3.8 Flash:14.0x、25.7x、37.0x、18.6x

影响倍数的因素有 3 个。第一是问题数量。聊天模型必须为每个问题生成答案,而输出是其价格较高的一侧,GPT-5.6 Luna 的输出价格为每百万 token $1.20,输入则是 $0.20。Jev 的答案免费,每增加一个问题只会多出约 17 个输入 token。第二是 thinking。采用厂商默认设置时,聊天模型在单标签任务中的输出 token 中位数最高达到 161 个;关闭 thinking 后只有 3 到 8 个,因此相对 Jev 的成本倍数也随之上升。第三是输入长度。参考文档达到 12,000 个 token 后,固定模板和答案的影响很小,成本倍数趋近于输入价格之比:GLM 5.3 Flash 为 3.5 倍,Gemini 3.8 Flash 为 18.6 倍,DeepSeek V4.1 Flash 为 7.1 倍。

在单标签测试中,Jev 面对最低价模型没有节省成本。77 个选项会让 Jev 的每次调用增加约 1,400 个 token,因此处理一行消息时,Jev 的计费输入约为 1,690 个 token,而 Qwen3.8 Flash 只有 440 个。

测试,每 1,000 个样本的成本JevLunaQwen3.8 FlashGLM 5.3 FlashDeepSeek V4.1 FlashGemini 3.8 Flash
每个样本 12 个问题$0.027$0.19$0.13$0.14$0.27$1.02
12 个问题,12,000-token 参考文档$0.43$2.02$1.57$1.53$3.06$8.06
单标签,最低成本设置$0.071$0.098$0.069$0.068$0.16$0.99
单标签,厂商默认设置$0.071$0.11$0.19$0.13$0.61$1.83

Jev 快多少?

扣除网络耗时后,Jev 大约快 7 到 28 倍。其中位延迟为 0.11 到 0.12 秒,聊天模型则需要 0.79 到 3.25 秒。

我们对每个模型和任务依次调用 40 次,全程复用同一连接,并减去在同一连接上用不做模型计算的请求测得的往返时间。剩下的是模型自身的耗时,加上从我们的代理到各家服务商的那段路程,所有模型走的都是同一条路径。

扣除网络后的秒数,中位数(第 95 百分位)JevGPT-5.6 LunaQwen3.8 FlashGLM 5.3 FlashDeepSeek V4.1 FlashGemini 3.8 Flash
单标签,最低成本设置0.11 (0.21)1.33 (1.80)0.96 (1.68)1.22 (3.06)0.79 (1.35)1.95 (3.76)
单标签,厂商默认设置0.11 (0.21)1.45 (5.29)3.25 (21.5)2.97 (7.32)1.19 (10.4)2.18 (8.22)
每个样本 12 个问题0.12 (0.20)1.66 (2.56)3.21 (5.21)3.13 (6.20)1.33 (1.70)2.14 (2.89)

thinking 对第 95 百分位延迟的影响很明显。在厂商默认设置下,Qwen3.8 Flash 每 20 次单标签调用中,就有 1 次耗时超过 21 秒。Jev 最慢的调用仍接近 0.2 秒。

增加问题数量不会让 Jev 变慢:对同一条客服工单,从 1 个问题增加到 60 个是非题,中位延迟的变化不到 0.1 秒,而 60 个问题的那次调用计费 1,371 个输入 token,成本 $0.000058。包含 20 个问题的调用重复运行 5 次,每个答案都正确。

这些结果与 TypeSafe 自己的说法相比如何?

结论方向一致,但我们测得的差距更小,因为比较对象不同。TypeSafe 的发布文章给出的最高数字是便宜 444.6 倍、快 193.6 倍,比较对象是在多步工作流中启用 reasoning 的前沿模型。TypeSafe 将这些数字称为「真实场景收益的较高水平」(发布文章)。

其公开的工作流评测包含 GPT-5.6 Luna:Jev 的准确率为 67.8%,每个样本成本 $0.0004,耗时 0.4 秒;Luna 的准确率为 66.8%,每个样本成本 $0.0033,耗时 12.9 秒。Jev 大约便宜 8 倍、快 32 倍。我们的 12 问测试中,关闭 thinking 的 Luna 成本是 Jev 的 7 倍,扣除网络后耗时是 14 倍,数量级相同。对最低价 Flash 模型执行单标签任务时,成本差距则完全消失。

Jev 的准确率能达到 Flash LLM 水平吗?

工作流测试中接近,分类测试中落后,而且从未排名第一。在每个样本 12 个问题的测试中,Jev 的 micro F1(统计全部问题中的所有「是」和「否」,1.0 表示完全正确)处于各聊天模型的结果区间内。它给出的概率在区分正确答案和错误答案方面,也与表现最好的模型相近。

每个样本 12 个问题(150 段对话)0.5 阈值下的 Micro F112 个答案全部正确AUC
Jev 1.130.90961.3%0.990
GPT-5.6 Luna,thinking 关闭0.93371.3%0.973
GPT-5.6 Luna,默认设置0.93171.3%0.992
Gemini 3.8 Flash,low0.91966.7%0.974
Qwen3.8 Flash,thinking 关闭0.91362.7%0.975
GLM 5.3 Flash,low0.90664.7%0.975
DeepSeek V4.1 Flash,thinking 关闭0.89660.0%0.958

AUC 衡量概率排序能力。1.0 表示每个真实的「是」都获得了比所有「否」更高的概率。在前面加入 12,000 个 token 的参考文档后,Jev 的准确率基本不变。在相同的 60 段对话上,加入文档后的 F1 为 0.914,未加入时为 0.922。

分类测试中,聊天模型的表现更好,使用默认 thinking 设置时尤其明显:

模型和设置单标签(Banking77)28 个标签(GoEmotions micro F1)提示词注入
Jev 1.1380.2%0.22874.1%
GPT-5.6 Luna,thinking 关闭 / 默认85.1% / 87.3%0.301 / 0.34269.6% / 72.2%
GPT-5.6 Terra,thinking 关闭 / 默认83.4% / 85.4%0.273 / 0.32480.9% / 79.1%
Gemini 3.8 Flash,low / 默认84.4% / 83.8%0.373 / 0.37281.9% / 82.8%
Qwen3.8 Flash,关闭 / 默认77.6% / 81.5%0.286 / 0.33881.9% / 80.2%
GLM 5.3 Flash,low / 默认77.9% / 79.9%0.255 / 0.31081.9% / 81.9%
DeepSeek V4.1 Flash,关闭 / 默认77.3% / 81.8%0.289 / 0.36582.8% / 86.2%
Seed 2.0 Mini,thinking 关闭70.8%0.24566.4%

GPT-5.6 Luna 和 Terra 分别成功回答了 116 条注入文本中的 115 条,以及 200 条评论中的 199 条。每种情况下各有 1 个请求返回错误,准确率按成功返回的答案计算。不是「是」或「否」的回复计为错误。在情绪测试中,Jev 过于频繁地回答「是」:概率落在 0.80 到 0.95 之间的情绪,只有 15% 出现在人工标签中。情绪标签本身很稀疏,每条评论的标注者只选择 1 到 2 个,这会压低所有模型的分数,但所有模型收到的指令相同。在提示词注入测试中,Jev 默认的 0.5 并不是合适的阈值,下一节会具体说明。

Jev 的置信度可靠吗?

它的概率能很好地区分正确和错误答案,但按通常意义并未校准,因此每项任务都需要单独设定阈值。所谓已校准,是指概率为 0.8 的答案有 80% 正确。在 Banking77 上,Jev 概率达到 0.99 或以上的答案有 98% 正确,而概率低于 0.8 时,准确率只有约一半。

Jev 1.13 在 Banking77 上按最高选项概率分组的准确率柱状图:0.99 到 1.00,占消息总数的 48%,准确率 98%;0.95 到 0.99,81%;0.90 到 0.95,77%;0.80 到 0.90,75%;0.70 到 0.80,52%;0.50 到 0.70,40%;低于 0.50,42%

Banking77 中接近一半的消息(48%)最高概率达到 0.99 或以上。如果流水线直接接受这些结果,并把其余请求交给更大的模型,就能在这部分流量上保持 98% 的准确率。提示词注入测试展示了另一面。使用默认的 0.5 阈值时,Jev 只识别出一半攻击。另一半攻击的概率落在 0.03 到 0.5 之间,绝对值不高,但通常仍高于正常文本,后者的中位数为 0.02。按概率排序时,Jev 区分攻击和正常文本的 AUC 为 0.984。

注入测试集上的阈值Jev 准确率检出的攻击误报数(56 条正常文本)
0.5(默认)74.1%50.0%0
0.188.8%80.0%1
0.0593.1%91.7%3

这些阈值是在同一组 116 条文本上选出的,因此只能视为上限。如果 API 返回 token log-probabilities,也就是模型对自己生成的每个 token 给出的概率,聊天模型同样可以提供概率。本次参测的聊天模型中,Qwen3.8 FlashSeed 2.0 Mini 在我们的测试中返回了该数据。Qwen3.8 Flash 对「是」的概率在提示词注入文本上的排序 AUC 为 0.977。

应该使用 Jev 还是 Flash LLM?

如果你的任务是选择本次测试中的原因
针对同一段文本回答多个是非问题或单选问题Jev便宜 4.8 到 37 倍,扣除网络后快 11 到 27 倍,准确率相近
循环中的决策,必须在 1 秒内返回Jev扣除网络后 0.11 到 0.12 秒
针对长文档做少量判断Jev成本趋近于输入价格之比,低 3.5 到 18.6 倍
以最低成本为每条短消息输出一个标签Jev、关闭 thinking 的 Qwen3.8 FlashGLM 5.3 Flash成本相同;除非读取 log-probabilities,否则 LLM 不返回概率
追求标签准确率最高默认设置的 GPT-5.6 Luna在 Banking77 上准确率为 87.3%,每 1,000 条成本 $0.11
数字、日期、计数或生成文本聊天模型TypeSafe 将这些列为 Jev 的短板

在我们的测试中,最能发挥 Jev 优势的方式是:把一个决策拆成多个针对同一文本的窄问题;在自己的标注数据上调好阈值;高于阈值的答案直接执行,其余交给聊天模型。

常见问题

TypeSafe Jev 是什么? Jev 是 TypeSafe 推出的决策模型。它针对一段文本回答带类型的问题,包括是非题、单选题和分级评分,并返回概率,而不是生成文本。Jev 1.13 是当前版本,通过 jev-latest 别名提供服务。输入价格为每百万 token $0.042,输出免费。

Jev 比 LLM 便宜吗? 取决于任务。对每段客服对话提出 12 个问题时,关闭 thinking 的 GPT-5.6 Luna 成本是 Jev 的 7 倍,Gemini 3.8 Flash 是 37 倍。对于 77 选 1 的单标签任务,关闭 thinking 的 Qwen3.8 FlashGLM 5.3 Flash 与 Jev 成本相同。

Jev 比 GPT-5.6 Luna 更准确吗? 在我们的测试中不是。每个样本回答 12 个问题时,关闭 thinking 的 GPT-5.6 Luna 的 micro F1 为 0.933,Jev 为 0.909;在 Banking77 上,前者准确率为 85.1%,后者为 80.2%。使用默认的 0.5 阈值时,Jev 检出的提示词注入多于关闭 thinking 的 Luna。

为什么 TypeSafe 说 Jev 便宜 444 倍? 这个数字比较的是 Jev 与在多步工作流中启用 reasoning 的前沿模型,TypeSafe 称其为较高水平。在我们的 Flash 模型测试中,12 问工作流上 Jev 便宜 4.8 到 37 倍,单标签任务的成本则基本相同。

Jev 的概率经过校准吗? 按通常意义没有。在 Banking77 上,概率达到 0.99 或以上的答案有 98% 正确,但低于 0.8 时只有约一半正确。在提示词注入测试中,一半攻击的概率低于 0.5。应使用自己的标注数据,为每项任务单独调优阈值。

相关阅读:2026 年最佳 Flash LLM APILLM 结构化输出对比LLM thinking 控制项按使用场景选择最佳 LLM

← 返回博客