Jev 对比 Flash LLM:工作流便宜 7 倍,单标签成本相同
目录
TypeSafe 的 Jev 是否比 Flash LLM 便宜,取决于任务形态。对每段客服对话提出 12 个问题时,Jev 的成本比关闭 thinking 的 GPT-5.6 Luna 低 7 倍;扣除网络耗时后,Jev 用时 0.12 秒,后者为 1.66 秒。对于 77 选 1 的单标签任务,Jev 的成本与 Qwen3.8 Flash 和 GLM 5.3 Flash 相同。Jev 是一种决策模型,不生成文本,而是针对你定义的每个问题返回选项、分数或概率。我们使用 4 组基于公开数据集构建的测试,将 Jev 与 5 款 Flash 级聊天模型进行对比,分别采用各模型成本最低的设置和默认 thinking 设置。Jev 在每项测试中都是最快的,但准确率没有一次最高。
TL;DR
- 每个样本回答 12 个问题时,Flash LLM 的成本是 Jev 的 4.8 到 37 倍,耗时是 11 到 27 倍,准确率相近。
- 每条消息只输出一个标签时,关闭 thinking 的 Qwen3.8 Flash 和 GLM 5.3 Flash 与 Jev 成本相同。
- 使用默认 thinking 时,Flash 模型处理单标签任务的成本是 Jev 的 1.5 到 26 倍。
- 除提示词注入外,GPT-5.6 Luna 在每项测试中的准确率都高于 Jev。
- Jev 概率达到 0.99 或以上的答案中,98% 正确。
Jev 是什么?与 LLM 有什么不同?
Jev 是 TypeSafe 的「System One」模型。它读取一段文本或 JSON(即状态),针对内容回答带类型的问题,不生成需要解析的文本。问题分为 3 类:
| 问题类型 | 提问方式 | 返回内容 |
|---|---|---|
| Noul(TypeSafe 对是非题的命名) | 一个是非问题 | 0 到 1 的概率 |
| Choice | 从你定义的最多 255 个选项中选择一个 | 选中的选项、所有选项的概率、置信度 |
| Score | 按你定义的 2 到 10 个有序等级评分 | 概率加权后的分数、置信度 |
请求按名称提交问题,每个名称对应一个答案。下面的请求采用 TypeSafe 文档中的格式(API 参考),针对一段简短的客服对话提出 3 个是非问题:
curl https://api.typesafe.ai/v1/systemone \
-H "Authorization: Bearer $TYPESAFE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "jev-latest",
"state": {"transcript": "Customer: My card was declined twice today.\nAgent: One moment.\nCustomer: Also, how do I change my PIN?"},
"questions": {
"declined_card": {"type": "noul", "instructions": "In `transcript`, does the customer report a declined card payment?"},
"change_pin": {"type": "noul", "instructions": "In `transcript`, does the customer want to change a PIN?"},
"lost_card": {"type": "noul", "instructions": "In `transcript`, does the customer report a lost or stolen card?"}
}
}'
实际返回结果如下:
{
"model": "jev-1.13.0",
"answers": {
"declined_card": {"type": "noul", "noul": 0.99},
"change_pin": {"type": "noul", "noul": 0.98},
"lost_card": {"type": "noul", "noul": 0.02}
},
"usage": {"input_tokens": 359, "output_tokens": 56}
}
代码读取 answers.<question>.noul,再像比较普通数值一样与阈值比较。model 字段表示实际回答请求的版本。TypeSafe 发布新版本时,jev-latest 会随之更新。如果阈值是针对特定版本调优的,应固定使用 jev-1.13.0。
TypeSafe 会并行处理这些问题。Jev 1.13 的输入价格为每百万 token $0.042,输出免费(模型列表)。按输入 token 计价,它比 Qwen3.8 Flash 低 3.6 倍,比 GPT-5.6 Luna 低 4.8 倍,比 Gemini 3.8 Flash 低 18 倍。输入包括 TypeSafe 自带的模板,每次调用约 300 个 token,以及你定义的全部问题和选项。上面的请求计费输入为 359 个 token,成本 $0.000015,56 个输出 token 免费。TypeSafe 在 Jev 的能力短板说明中列出了它不擅长的任务:计数、算术、日期比较、多步问题,以及包含大量无关文本的长状态。
我们如何测试?
我们设计了 4 项测试,并在 2026-09-21 和 2026-09-22 各运行一次。参测模型包括 Jev 和 5 款 Flash 聊天模型:GPT-5.6 Luna、Qwen3.8 Flash、GLM 5.3 Flash、DeepSeek V4.1 Flash 和 Gemini 3.8 Flash。每款聊天模型都采用能正常工作的最低成本 thinking 设置,支持关闭的就关闭,不支持的则设为 low。在 3 项分类测试中,还额外使用厂商默认设置运行了一遍。
- 每个样本 12 个问题:150 段客服对话,每段由 Banking77 数据集(PolyAI,CC BY 4.0)中的 1 到 6 条消息组合而成,因此正确答案已知。每个模型都要针对每段对话回答 12 个是非问题,例如「客户是否报告银行卡丢失或被盗?」,并为每个问题给出概率。Jev 在一次调用中提交 12 个 Noul 问题,聊天模型则返回一个 JSON 对象。我们还从中选取 60 段对话重新测试,在对话前分别加入 3,000 个 token 和 12,000 个 token 的参考文档,内容来自 Wikipedia 的银行相关文章。
- 单标签:308 条 Banking77 消息,77 个意图各取 4 条。Jev 接收一个包含 77 个选项的 Choice,聊天模型接收相同列表并返回意图。
- 28 个标签:200 条 GoEmotions 评论(Google,Apache 2.0),每条有 28 种可能的情绪。
- 提示词注入:deepset prompt-injections 测试集(Apache 2.0),共 116 行,每行回答一个是非问题。
成本按各厂商标价乘以计费 token 数计算。延迟来自另一组测试:每个模型连续调用 40 次,复用连接,并扣除网络往返时间。测速方法将在速度一节详细说明。我们还在 3 项分类测试中运行了 GPT-5.6 Terra 和 Seed 2.0 Mini。它们出现在表格中,但不在图表里。
Jev 在什么情况下比 Flash LLM 便宜?
同一段文本需要回答多个问题、文本很长,或者聊天模型原本需要 thinking 时,Jev 更便宜。如果只是给一条短消息打一个标签,并且使用关闭 thinking 的低价模型,Jev 的成本没有优势。
影响倍数的因素有 3 个。第一是问题数量。聊天模型必须为每个问题生成答案,而输出是其价格较高的一侧,GPT-5.6 Luna 的输出价格为每百万 token $1.20,输入则是 $0.20。Jev 的答案免费,每增加一个问题只会多出约 17 个输入 token。第二是 thinking。采用厂商默认设置时,聊天模型在单标签任务中的输出 token 中位数最高达到 161 个;关闭 thinking 后只有 3 到 8 个,因此相对 Jev 的成本倍数也随之上升。第三是输入长度。参考文档达到 12,000 个 token 后,固定模板和答案的影响很小,成本倍数趋近于输入价格之比:GLM 5.3 Flash 为 3.5 倍,Gemini 3.8 Flash 为 18.6 倍,DeepSeek V4.1 Flash 为 7.1 倍。
在单标签测试中,Jev 面对最低价模型没有节省成本。77 个选项会让 Jev 的每次调用增加约 1,400 个 token,因此处理一行消息时,Jev 的计费输入约为 1,690 个 token,而 Qwen3.8 Flash 只有 440 个。
| 测试,每 1,000 个样本的成本 | Jev | Luna | Qwen3.8 Flash | GLM 5.3 Flash | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| 每个样本 12 个问题 | $0.027 | $0.19 | $0.13 | $0.14 | $0.27 | $1.02 |
| 12 个问题,12,000-token 参考文档 | $0.43 | $2.02 | $1.57 | $1.53 | $3.06 | $8.06 |
| 单标签,最低成本设置 | $0.071 | $0.098 | $0.069 | $0.068 | $0.16 | $0.99 |
| 单标签,厂商默认设置 | $0.071 | $0.11 | $0.19 | $0.13 | $0.61 | $1.83 |
Jev 快多少?
扣除网络耗时后,Jev 大约快 7 到 28 倍。其中位延迟为 0.11 到 0.12 秒,聊天模型则需要 0.79 到 3.25 秒。
我们对每个模型和任务依次调用 40 次,全程复用同一连接,并减去在同一连接上用不做模型计算的请求测得的往返时间。剩下的是模型自身的耗时,加上从我们的代理到各家服务商的那段路程,所有模型走的都是同一条路径。
| 扣除网络后的秒数,中位数(第 95 百分位) | Jev | GPT-5.6 Luna | Qwen3.8 Flash | GLM 5.3 Flash | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| 单标签,最低成本设置 | 0.11 (0.21) | 1.33 (1.80) | 0.96 (1.68) | 1.22 (3.06) | 0.79 (1.35) | 1.95 (3.76) |
| 单标签,厂商默认设置 | 0.11 (0.21) | 1.45 (5.29) | 3.25 (21.5) | 2.97 (7.32) | 1.19 (10.4) | 2.18 (8.22) |
| 每个样本 12 个问题 | 0.12 (0.20) | 1.66 (2.56) | 3.21 (5.21) | 3.13 (6.20) | 1.33 (1.70) | 2.14 (2.89) |
thinking 对第 95 百分位延迟的影响很明显。在厂商默认设置下,Qwen3.8 Flash 每 20 次单标签调用中,就有 1 次耗时超过 21 秒。Jev 最慢的调用仍接近 0.2 秒。
增加问题数量不会让 Jev 变慢:对同一条客服工单,从 1 个问题增加到 60 个是非题,中位延迟的变化不到 0.1 秒,而 60 个问题的那次调用计费 1,371 个输入 token,成本 $0.000058。包含 20 个问题的调用重复运行 5 次,每个答案都正确。
这些结果与 TypeSafe 自己的说法相比如何?
结论方向一致,但我们测得的差距更小,因为比较对象不同。TypeSafe 的发布文章给出的最高数字是便宜 444.6 倍、快 193.6 倍,比较对象是在多步工作流中启用 reasoning 的前沿模型。TypeSafe 将这些数字称为「真实场景收益的较高水平」(发布文章)。
其公开的工作流评测包含 GPT-5.6 Luna:Jev 的准确率为 67.8%,每个样本成本 $0.0004,耗时 0.4 秒;Luna 的准确率为 66.8%,每个样本成本 $0.0033,耗时 12.9 秒。Jev 大约便宜 8 倍、快 32 倍。我们的 12 问测试中,关闭 thinking 的 Luna 成本是 Jev 的 7 倍,扣除网络后耗时是 14 倍,数量级相同。对最低价 Flash 模型执行单标签任务时,成本差距则完全消失。
Jev 的准确率能达到 Flash LLM 水平吗?
工作流测试中接近,分类测试中落后,而且从未排名第一。在每个样本 12 个问题的测试中,Jev 的 micro F1(统计全部问题中的所有「是」和「否」,1.0 表示完全正确)处于各聊天模型的结果区间内。它给出的概率在区分正确答案和错误答案方面,也与表现最好的模型相近。
| 每个样本 12 个问题(150 段对话) | 0.5 阈值下的 Micro F1 | 12 个答案全部正确 | AUC |
|---|---|---|---|
| Jev 1.13 | 0.909 | 61.3% | 0.990 |
| GPT-5.6 Luna,thinking 关闭 | 0.933 | 71.3% | 0.973 |
| GPT-5.6 Luna,默认设置 | 0.931 | 71.3% | 0.992 |
| Gemini 3.8 Flash,low | 0.919 | 66.7% | 0.974 |
| Qwen3.8 Flash,thinking 关闭 | 0.913 | 62.7% | 0.975 |
| GLM 5.3 Flash,low | 0.906 | 64.7% | 0.975 |
| DeepSeek V4.1 Flash,thinking 关闭 | 0.896 | 60.0% | 0.958 |
AUC 衡量概率排序能力。1.0 表示每个真实的「是」都获得了比所有「否」更高的概率。在前面加入 12,000 个 token 的参考文档后,Jev 的准确率基本不变。在相同的 60 段对话上,加入文档后的 F1 为 0.914,未加入时为 0.922。
分类测试中,聊天模型的表现更好,使用默认 thinking 设置时尤其明显:
| 模型和设置 | 单标签(Banking77) | 28 个标签(GoEmotions micro F1) | 提示词注入 |
|---|---|---|---|
| Jev 1.13 | 80.2% | 0.228 | 74.1% |
| GPT-5.6 Luna,thinking 关闭 / 默认 | 85.1% / 87.3% | 0.301 / 0.342 | 69.6% / 72.2% |
| GPT-5.6 Terra,thinking 关闭 / 默认 | 83.4% / 85.4% | 0.273 / 0.324 | 80.9% / 79.1% |
| Gemini 3.8 Flash,low / 默认 | 84.4% / 83.8% | 0.373 / 0.372 | 81.9% / 82.8% |
| Qwen3.8 Flash,关闭 / 默认 | 77.6% / 81.5% | 0.286 / 0.338 | 81.9% / 80.2% |
| GLM 5.3 Flash,low / 默认 | 77.9% / 79.9% | 0.255 / 0.310 | 81.9% / 81.9% |
| DeepSeek V4.1 Flash,关闭 / 默认 | 77.3% / 81.8% | 0.289 / 0.365 | 82.8% / 86.2% |
| Seed 2.0 Mini,thinking 关闭 | 70.8% | 0.245 | 66.4% |
GPT-5.6 Luna 和 Terra 分别成功回答了 116 条注入文本中的 115 条,以及 200 条评论中的 199 条。每种情况下各有 1 个请求返回错误,准确率按成功返回的答案计算。不是「是」或「否」的回复计为错误。在情绪测试中,Jev 过于频繁地回答「是」:概率落在 0.80 到 0.95 之间的情绪,只有 15% 出现在人工标签中。情绪标签本身很稀疏,每条评论的标注者只选择 1 到 2 个,这会压低所有模型的分数,但所有模型收到的指令相同。在提示词注入测试中,Jev 默认的 0.5 并不是合适的阈值,下一节会具体说明。
Jev 的置信度可靠吗?
它的概率能很好地区分正确和错误答案,但按通常意义并未校准,因此每项任务都需要单独设定阈值。所谓已校准,是指概率为 0.8 的答案有 80% 正确。在 Banking77 上,Jev 概率达到 0.99 或以上的答案有 98% 正确,而概率低于 0.8 时,准确率只有约一半。
Banking77 中接近一半的消息(48%)最高概率达到 0.99 或以上。如果流水线直接接受这些结果,并把其余请求交给更大的模型,就能在这部分流量上保持 98% 的准确率。提示词注入测试展示了另一面。使用默认的 0.5 阈值时,Jev 只识别出一半攻击。另一半攻击的概率落在 0.03 到 0.5 之间,绝对值不高,但通常仍高于正常文本,后者的中位数为 0.02。按概率排序时,Jev 区分攻击和正常文本的 AUC 为 0.984。
| 注入测试集上的阈值 | Jev 准确率 | 检出的攻击 | 误报数(56 条正常文本) |
|---|---|---|---|
| 0.5(默认) | 74.1% | 50.0% | 0 |
| 0.1 | 88.8% | 80.0% | 1 |
| 0.05 | 93.1% | 91.7% | 3 |
这些阈值是在同一组 116 条文本上选出的,因此只能视为上限。如果 API 返回 token log-probabilities,也就是模型对自己生成的每个 token 给出的概率,聊天模型同样可以提供概率。本次参测的聊天模型中,Qwen3.8 Flash 和 Seed 2.0 Mini 在我们的测试中返回了该数据。Qwen3.8 Flash 对「是」的概率在提示词注入文本上的排序 AUC 为 0.977。
应该使用 Jev 还是 Flash LLM?
| 如果你的任务是 | 选择 | 本次测试中的原因 |
|---|---|---|
| 针对同一段文本回答多个是非问题或单选问题 | Jev | 便宜 4.8 到 37 倍,扣除网络后快 11 到 27 倍,准确率相近 |
| 循环中的决策,必须在 1 秒内返回 | Jev | 扣除网络后 0.11 到 0.12 秒 |
| 针对长文档做少量判断 | Jev | 成本趋近于输入价格之比,低 3.5 到 18.6 倍 |
| 以最低成本为每条短消息输出一个标签 | Jev、关闭 thinking 的 Qwen3.8 Flash 或 GLM 5.3 Flash | 成本相同;除非读取 log-probabilities,否则 LLM 不返回概率 |
| 追求标签准确率最高 | 默认设置的 GPT-5.6 Luna | 在 Banking77 上准确率为 87.3%,每 1,000 条成本 $0.11 |
| 数字、日期、计数或生成文本 | 聊天模型 | TypeSafe 将这些列为 Jev 的短板 |
在我们的测试中,最能发挥 Jev 优势的方式是:把一个决策拆成多个针对同一文本的窄问题;在自己的标注数据上调好阈值;高于阈值的答案直接执行,其余交给聊天模型。
常见问题
TypeSafe Jev 是什么?
Jev 是 TypeSafe 推出的决策模型。它针对一段文本回答带类型的问题,包括是非题、单选题和分级评分,并返回概率,而不是生成文本。Jev 1.13 是当前版本,通过 jev-latest 别名提供服务。输入价格为每百万 token $0.042,输出免费。
Jev 比 LLM 便宜吗? 取决于任务。对每段客服对话提出 12 个问题时,关闭 thinking 的 GPT-5.6 Luna 成本是 Jev 的 7 倍,Gemini 3.8 Flash 是 37 倍。对于 77 选 1 的单标签任务,关闭 thinking 的 Qwen3.8 Flash 和 GLM 5.3 Flash 与 Jev 成本相同。
Jev 比 GPT-5.6 Luna 更准确吗? 在我们的测试中不是。每个样本回答 12 个问题时,关闭 thinking 的 GPT-5.6 Luna 的 micro F1 为 0.933,Jev 为 0.909;在 Banking77 上,前者准确率为 85.1%,后者为 80.2%。使用默认的 0.5 阈值时,Jev 检出的提示词注入多于关闭 thinking 的 Luna。
为什么 TypeSafe 说 Jev 便宜 444 倍? 这个数字比较的是 Jev 与在多步工作流中启用 reasoning 的前沿模型,TypeSafe 称其为较高水平。在我们的 Flash 模型测试中,12 问工作流上 Jev 便宜 4.8 到 37 倍,单标签任务的成本则基本相同。
Jev 的概率经过校准吗? 按通常意义没有。在 Banking77 上,概率达到 0.99 或以上的答案有 98% 正确,但低于 0.8 时只有约一半正确。在提示词注入测试中,一半攻击的概率低于 0.5。应使用自己的标注数据,为每项任务单独调优阈值。
相关阅读:2026 年最佳 Flash LLM API、LLM 结构化输出对比、LLM thinking 控制项、按使用场景选择最佳 LLM。