Jev 对比 LLM 分类器:类型化判断什么时候胜过提示词
如果一个判断的可能答案能事先列出来、而且要反复做,Jev 在成本和速度上是更好的分类器;在现有测试里,准确率大致持平。需要把推理过程写出来、涉及算术或日期、答案是开放式的,或者你要的是最后那几个百分点的准确率时,通用 LLM 仍然是更合适的工具。
一览
这里比较的是 Jev 和一个用提示词让它选标签的通用 LLM(无论是否使用结构化输出)。零样本分类器和你自己训练的模型,请看 Jev 对比开源模型,以及总览文章 Jev 的替代方案。
| Jev | 提示词驱动的 LLM(GPT / Claude 级) | |
|---|---|---|
| 输出 | 你声明的选项之一,类型化的值 | 文本,再解析成标签 |
| 概率 | 每个答案都返回 | 只有你要求时才有,而且是生成的文本 |
| 价格(厂商口径) | 每百万输入 token $0.042,输出免费 | 每百万输入 token $0.20–$10,输出约为输入的 5 倍 |
| 每样本成本(TypeSafe 评测) | 约 $0.0004 | $0.0304–$0.0836 |
| 延迟(TypeSafe 评测) | 0.4 秒 | 10.1–23.3 秒 |
| 准确率(TypeSafe 评测) | 67.8% | 67.9–74.1% |
| 书面推理 | 没有 | 有 |
| 计数、算术、日期 | 官方承认的短板 | 更合适 |
| 开放式答案 | 不支持 | 支持 |
评测相关的几行来自 TypeSafe 公布的四个工作流,数字引自一篇第三方文章。它们是厂商数字,参考答案是两个前沿 LLM 的平均值,而不是人工标注。价格核对于 2026-09-19。
成本
Jev 只对输入 token 计费,而一次分类调用本来就很小。我们实测真实评估的成本为 $0.000012 到 $0.000377,典型的三问题调用约 $0.00002(实测过程)。LLM 一侧取决于具体模型,而且输出 token 同样计费。
两份独立报告指向同一个方向。Bryo AI 的 CTO 告诉 TechCrunch,在他对商务邮件分类的测试中,Gemini 稍微更准,但贵 10 到 20 倍。DevelopersIO 的一次路由测试测得 每次 Jev 调用 $0.000025–$0.000027。
批量提问会把差距拉得更大。Jev 对同一请求里的所有问题并行作答,TypeSafe 文档称把 13 个问题合并成一次调用,比分 13 次调用便宜 11.5 倍、快 9.6 倍。换成 LLM,多问几个问题通常意味着更多输出 token 或更多次调用。
延迟
TypeSafe 声称端到端 70–500 ms,而 LLM 是 3–329 秒。这是厂商口径。独立数字没那么夸张,但更有参考价值:
- 模型路由: DevelopersIO 测得每次 Jev 调用的中位延迟为 0.643–0.674 秒,比 Gemini 3.5 Flash 分类器快约 3 倍,比 DeepSeek V4 Flash 分类器快 10–11 倍。作者说明他是单独调用 TypeSafe 测的,每一档只有一个样本。
- 代码监控: LessWrong 上的一个 AI 控制试点记录的中位延迟为 0.34 秒。
- 命令安全审查: 据 TechCrunch 报道,Vercel 把一个 OpenAI Luna 5.6 分类器换成 Jev 后,结果快了 5 到 18 倍,而且更准。
输出形态:类型化的值还是解析文本
使用结构化输出的 LLM 仍然在生成文本,schema 只是约束了它的形状,你的代码还要解析和校验。Jev 根本不生成文本。你先声明选项,答案必然是其中之一,并附带每个选项的概率。它不可能返回一个你没列出的标签。
TypeSafe 说 Jev 不会出现类型错误,并坦白这是由 schema 匹配保证的,而不是测出来的。这一点在不相关的测试里也能看到:在 LLM Chess 排行榜上,Jev 下完了每一盘棋,协议遵循完全正确。但反过来同样要说清楚:类型正确的答案,内容仍然可能是错的。
准确率:已经测过什么
在我们的来源中,没有 Jev 与 LLM 分类器之间独立的、基于人工标注的正面对比。现有的是:
- TypeSafe 的工作流评测(厂商): Jev 67.8%,GPT-5.6 Terra 67.9%,GPT-5.6 Sol 74.1%。TypeSafe 自己提醒:评测由其团队搭建,参考答案偏向 OpenAI 和 Anthropic 的模型,而且 LLM 是通过他们的封装调用的。
- jev-on-a-laptop 的独立重新评分,基于 TypeSafe 公开样例中的 343 个问题对:Opus 89.8%,Sol 89.2%,Jev 86.6%。作者的解读是,Jev 以零头的价格落在前沿模型的区间里。
- 个案: Bryo AI 发现 Gemini 稍微更准;Vercel 发现 Jev 比被替换的分类器更准。
合起来看:大致持平,视任务不同相差几个百分点。无论选哪一个,都先在你自己的标注数据上测一测。
校准与一致性
这是 LLM 不容易做到的部分。Jev 的训练目标是让概率在一组预测上名副其实,TypeSafe 则称 LLM 往往过度自信且前后不一致(厂商说法)。独立证据有好有坏,值得了解:
- 一致性很高。 在 LessWrong 试点中,对同一段代码重新打分,分数平均只变动 0.008;被标记的那一批样本,92% 在多次调用间保持不变。
- 校准因任务而异。 一项预注册研究发现,Jev 在两个数据集上校准良好,在第三个上很差(细节见 Jev 对比开源模型)。
- Jev 可能偏保守。 LessWrong 作者说它的原始分数是很好的排序依据,却不是好的概率。
- 等价的问题会给出不同答案。 TypeSafe 文档说明,一个 Noul 和等价的是/否 Choice 可能给出不同概率,一个问题和它的否定形式概率相加也可能超过 1。阈值要在你实际上线的那组问题上调。
什么时候 LLM 更合适
- 你需要把推理过程写下来,给审核人、给审计记录,或用于受监管的决策。
- 判断涉及计数、算术或日期比较。TypeSafe 的能力短板说明直说 Jev 不是计算器。
- 你列举不出可能的答案,或者需要返回文本。
- 你的输入大多不是英文;TypeSafe 说包括中日韩文字在内的其他语言能处理,但效果不如英文。
- 几个百分点的准确率比成本和延迟更重要。
什么时候 Jev 更合适
- 答案空间已知,同一个判断要大量重复。
- 你想按置信度行动:高于某个阈值自动处理,低于它就升级。
- 延迟很重要,比如执行前的安全检查,或实时的工单队列。
- 你要对同一份输入问好几个问题,并希望一次调用全部答完。
两者一起用
大多数证据指向的是分工,而不是替换。让 LLM 负责抽取或起草,再让 Jev 用一个类型化的是/否加概率来核验。或者把 Jev 放在前面:对它有把握的答案直接处理,中间那一段交给 LLM 或人工。Jev 作为评判和内容审核分别展示了这两种形态,你也可以在试验台里试试自己的问题。
常见问题
- Jev 做分类比 GPT 更准吗?
- 从现有证据看并不更准。在 TypeSafe 自己的工作流评测里,Jev 得分 67.8%,GPT-5.6 Terra 是 67.9%,GPT-5.6 Sol 是 74.1%。一次独立的重新评分用 TypeSafe 的公开样例测得 Jev 为 86.6%,前沿模型为 89.2–89.8%。选 Jev 的理由是准确率相近、成本和耗时只有零头,而不是更准。
- Jev 比 LLM 分类器便宜多少?
- 在 TypeSafe 的评测里,Jev 每个样本约 $0.0004,GPT-5.6 Terra 是 $0.0304,GPT-5.6 Sol 是 $0.0836(厂商口径)。我们实测单次 Jev 评估的 token 成本为 $0.000012 到 $0.000377。
- 直接让 LLM 输出一个置信度不行吗?
- 可以,但那个数字也是模型生成的文本。Jev 的概率来自你声明的选项上的概率分布,所以可以直接拿来设阈值。它也不完美:独立测试发现 Jev 在一些任务上校准良好,在一个任务上很差,做监控时又偏于保守。
- 应该用 Jev 替换掉我的 LLM 吗?
- 替换的是分类调用,不是模型本身。Jev 不生成文本,起草、推理和信息抽取仍然交给 LLM。常见的分工是:Jev 有把握的判断直接处理,其余的交给 LLM 或人工。
相关页面
把它接进你的流程
注册即送 200 点,保存自己的问题集,并通过 API 调用同样的评估。