Jev 的替代方案:什么时候该用 LLM、GLiNER 或自己训练的分类器
Jev 把文本变成带概率的类型化判断。结构化输出的 LLM、GLiNER 这类零样本分类器、你自己训练的模型也能做到。本文讲清各自擅长什么,并给出有实测的数字。

要把非结构化文本变成代码可以直接分支的判断,Jev 是四种做法之一。 另外三种是:约束为结构化输出的通用 LLM、GLiNER 这类零样本分类器,以及用你自己的标注数据训练的分类器。没有哪一种在所有场景都赢。本文由一个运行 Jev 的站点来写这份对比,所以尽量写得老实:有实测的地方引用实测,没有的地方直接说没有。
| 方案 | 最适合 | 你要放弃的 |
|---|---|---|
| Jev | 答案空间已知、判断反复出现、按置信度行动 | 文字理由;算术;按客户单独调优 |
| 结构化输出的 LLM | 需要推理、文本、数学,或答案空间列不出来 | 单次调用的速度和成本;可设阈值的概率 |
| 零样本分类器(GLiNER) | 标签少,并且希望本地、离线或在自有硬件上运行 | 目前唯一一次对比中,难标签集上的准确率 |
| 自己训练的分类器 | 标签集稳定、标注数据充足、调用量极大 | 前期搭建,以及标签一变就要重训 |
Jev 对比结构化输出的 LLM
结构化输出的 LLM 仍然在生成文本,只是 schema 约束了它的形状。Jev 根本不生成文本。LangChain 的说法是,Jev 不能直接替换 LLM,因为它不生成文本,但它能接手我们现在交给 LLM 做的分类工作。
按 TypeSafe 自己的数字(厂商口径,未经独立复现),换来的是:
- 延迟: 端到端 70–500 ms,TypeSafe 引用的 LLM 区间是 3–329 秒。
- 价格: 输入 $0.042 / 百万 token、输出免费;他们对比的 LLM 输入价格是 $0.20–$10 / 百万 token,输出价格约为输入的 5 倍(TypeSafe 口径)。落到单次调用是多少,我们实测过:每次评估 $0.000012 到 $0.000377。
- 工作流基准: 快 193.6 倍、便宜 444.6 倍,TypeSafe 自己说这是真实场景收益里偏高的一端。
读这些数字时要带上 TypeSafe 自己列出的前提:准确率的参照是两个前沿 LLM 的平均值,而不是真实标签;工作流由他们自己的团队搭建;LLM 调用走的是他们的封装。方向没有疑问,具体倍数是他们的口径。
以下情况选 LLM: 你需要把推理过程写出来;答案涉及计数、算术或日期(TypeSafe 的能力短板说明直说 Jev 不是计算器);你列举不出可能的答案;或者你的输入大多不是英文(文档说其他语言能处理,但效果不如英文)。
Jev 对比 GLiNER 这类零样本分类器
这是唯一有独立、预注册实测的对比。jev-benchmarks 在三个数据集上各取 100 条留出样本,比较 jev-1.13.0 和 fastino/gliner2.5-multi-v1:
| 数据集 | 标签数 | Jev 准确率 | GLiNER 准确率 | Jev 覆盖率(误差 ≤5%) | GLiNER 覆盖率 |
|---|---|---|---|---|---|
| AG News | 4 | 0.910 | 0.700 | 0.830 | 0.240 |
| Banking77 | 72 | 0.870 | 0.610 | 0.860 | 0.270 |
| DAIR Emotion | 6 | 0.480 | 0.440 | 0.000 | 0.020 |
覆盖率指的是:在把错误率控制在 5% 以内的前提下,有多少输入可以自动处理。这比单纯的准确率更接近两个模型的实际用法。在两个数据集上 Jev 明显领先;在第三个数据集上两个模型都不可用,而且 Jev 的校准更差(Brier 0.846 对 0.668)。作者自己说结果是"刻意呈现的有好有坏",而且这只是 300 条样本的试点,不是排行榜。
延迟方面则相反。GLiNER 在 Apple M4 Max 的 CPU 上本地运行,Jev 是从法国调用的托管 API。在 4 标签和 6 标签任务上,GLiNER 的延迟中位数约 44 ms,Jev 是 236–256 ms;在 72 标签任务上 Jev 更快(246 ms 对 296 ms)。
以下情况选 GLiNER: 标签很少,数据不能离开你的机器,或者你需要不走网络就拿到答案。以下情况选 Jev: 标签很多,或者你只想对它有把握的答案自动行动。
Jev 对比自己训练分类器
Jev 不会按客户单独微调。所有账号用的是同一套权重,领域行为来自你在请求里写的内容。这就是它和自训分类器之间的全部取舍。这里我们没有基准可以下定论,只能讲推理:
- 自己的模型更好: 标签集稳定,你已经有大量标注样本,调用量大到即使极便宜的 API 也会累积成可观的成本。它还能学到你数据里的特殊规律,而请求里的说明只能描述这些规律。
- Jev 更好: 你还没有或只有很少的标注;标签经常变化(改一个问题的判定标准只要一分钟,重训可不是);或者同一条流水线需要做十几种不同的判断。
一个实际可行的折中:先用 Jev,把它的回答和人工纠正的结果记下来;等积累出一批规模足够、标签稳定的数据后,再在你自己的数据上测试训练出来的模型能否胜过它。
Jev 对比 LLM 评判
给模型输出打分是一个单独的场景,有它自己的证据:一项独立的 AI 控制试验发现,只问 Jev 一个问题,就达到了推理模型做监控时公开报告的区间,成本只是零头,同时也以具体的方式出错。完整内容见《用 Jev 当评判模型》。
怎么选
三件事同时成立时,Jev 就是合适的工具:你能事先列出可能的答案;同一个判断要反复做很多次;你能根据置信度行动,高于某个阈值自动处理,低于它就交给人。为什么这三个条件就是 System One 的核心,见《System One 模型是什么,不是什么》。
只要有一条不成立,上面的某个替代方案就更合适。如果三条都成立,也别直接相信这里的任何表格,包括我们自己的:把二十条真实输入贴进试验台,问你在生产环境里会问的那个问题,再和你知道的正确答案对一对。前 200 次评估免费。
来源
- Jev 与 GLiNER 的准确率、覆盖率、校准和延迟。jev-benchmarks(独立,预注册,300 条样本的试点)
- 延迟、价格、工作流基准倍数,以及他们自己说明的偏差。TypeSafe 发布文章(厂商)
- "不能直接替换 LLM"。LangChain(第三方)
- 不按客户微调、语言支持。TypeSafe 模型文档(厂商)
- 计数、算术和日期方面的短板。Jev 1.13 能力短板说明(厂商)
- 单次调用成本。《一次 Jev 评估到底花多少钱:实测》(我们的实测)