Jev 对比开源模型:哪些能自己跑,代价是什么
在我们追踪的所有来源里,都没有开放权重的 Jev。现有的开源项目是把它的接口——类型化问题、受约束的答案——搬到本地小模型上;其中做过自测的那一个比 Jev 低约 13 个百分点,而且置信度没能标出它自己的错误。数据不能离开你的机器,或者你有大量稳定的标注数据时,自己跑模型;否则托管的 Jev 是更稳妥的默认选择。
一览
“开源版 Jev”常被当成一样东西来搜。在我们的来源里,它其实是四种不同的东西,只有一种被独立第三方拿来和 Jev 正面比较过。想先看包括通用 LLM 在内所有替代方案的简要总览,请从 Jev 的替代方案 开始;本页深入讲那些你可以自己运行的选项。
| 方案 | 是什么 | 在哪里运行 | 与 Jev 对比测过吗? |
|---|---|---|---|
| Jev | TypeSafe 托管的 System One 模型 | TypeSafe 的 API 或转售方 | — |
| jev-on-a-laptop | 在现成的 1.5B–8B 模型上做 Jev 式约束解码 | 你的笔记本 | 测过,用的是 TypeSafe 的公开样例 |
| open-jev | 基于 DiffusionGemma 的类型化 JSON 推理 | 你的硬件 | 我们的来源里没有 |
| GLiNER 2.5 | 零样本分类器 | 你的硬件,CPU 即可 | 测过,预注册试点 |
| 你自己的分类器 | 用你的标注数据微调的模型 | 你的硬件 | 没有公开基准 |
为什么没有可以下载的 Jev
让 Jev 成为 Jev 的是训练,而训练的部分一样都没公开。TypeSafe 用 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)在自己制作的合成数据上训练它,所有账号共用同一套权重——没有按客户的微调,也没有 LoRA。公开资料里没有参数量、架构、完整的 RLCD 方法或校准曲线(见什么是 System One 模型)。
能复制的是接口:先声明选项,强制模型从中作答,再从概率分布里读出概率。下面两个开源项目做的都是这件事。这样能得到和 Jev 一样的输出形态,但得不到那个本该让概率可信的训练过程。
jev-on-a-laptop:在本地小模型上复刻接口
jev-on-a-laptop 是一项非官方研究,在 Apple Silicon 笔记本上,用现成的 1.5B–8B 模型复现 Jev 式的并行约束解码。它与 TypeSafe 没有关联,也无法访问 Jev 的模型。它是这里最有用的来源,因为它如实测量了自己。
准确率。 作者重建了 TypeSafe 四个工作流里的全部公开样例,并以 TypeSafe 自己的参考答案为准,在 343 个问题对上给每个模型打分:
| 模型 | 一致率 |
|---|---|
| Opus(已公布) | 89.8% |
| DeepSeek v4.1 Flash | 89.5% |
| Sol(已公布) | 89.2% |
| Jev(已公布) | 86.6% |
| Qwen2.5-7B,本地、免费 | 73.8% |
在 Jev 自己的基准上,免费的本地模型比 Jev 落后约 13 个百分点。作者还指出,更早一次只有 5 个样例的测试曾显示两者打平,他认为那是样本太小造成的假象——这对所有小规模测试都是有用的提醒。
置信度。 本地模型的置信度不能可靠地标出错误:7B 模型在 20 个答错的字段中,有 13 个置信度超过 0.90。作者把“校准过的置信度”标为未能复现,因为对候选选项做原始 softmax 只是一个近似,不是训练出来的校准。这是关于复现项目的结论,不是关于 Jev 的。
速度。 与作者自己的朴素 JSON 基线相比,本地约束解码快 3.4–7.9 倍。作者把 TypeSafe 声称的 40–200 倍标为不适用于本地部署。
open-jev:在扩散模型上复刻接口
open-jev 换了一个底座:用 DiffusionGemma 做类型化 JSON 推理,并重放了 Jev 公开样例中的全部 408 个问题。我们的来源里没有 open-jev 自身的准确率或校准结果,所以我们无法告诉你它离 Jev 有多近。它还引用了一组归于 Every 的实验;它的作者说明,那些数字是与某个已保存模型答案的一致率,不是人工标注的准确率,而且我们也没找到这组实验的独立发布。
GLiNER:唯一的独立正面对比
方法最扎实的对比,是与 fastino/gliner2.5-multi-v1 的比较,这是一个可以在 CPU 上运行的零样本分类器。jev-benchmarks 做了一个预注册试点,在三个数据集上各取 100 条留出样本,并设置了均匀分布的阴性对照。准确率和覆盖率表格见 Jev 的替代方案;那张表没有展示的,是每个结果有多可靠:
| 数据集 | 标签数 | Jev 减 GLiNER 的准确率差,95% 置信区间 |
|---|---|---|
| AG News | 4 | +0.130 到 +0.290 |
| Banking77 | 72 | +0.220 到 +0.300 |
| DAIR Emotion | 6 | −0.070 到 +0.150 |
在前两个数据集上,即使取区间下限,Jev 依然明显领先。在 DAIR Emotion 上,准确率差异没有定论,而校准则反过来:Jev 的 Brier 分数是 0.846,GLiNER 是 0.668;对数损失 5.588 对 1.381;并且在 16% 的样本上,Jev 给真实标签的概率是零。作者自己说结果是刻意呈现的有好有坏。
GLiNER 在 Apple M4 Max 的 CPU 上运行,Jev 则是从法国通过网络调用,所以延迟数字(在小标签集上约 44 ms 对 236–256 ms)描述的是那次部署,而不是模型本身。
你自己微调的分类器
这方面我们没有基准,我们的来源里也没有。我们能讲的是取舍。Jev 无法用你的数据训练,它在你的领域上表现如何,只取决于你在请求里写了什么。你自己微调的模型则能直接学到你数据里的特殊规律。一篇上手评测说得很简单:对于稳定、狭窄的领域,传统的小型分类器可能仍然是更简单的选择。
有三点会影响这个决定:
- 数据处理。 Jev 的
state里的所有内容都会发送给 TypeSafe,零数据保留只提供给企业客户。本地模型什么都不外发。 - 语言。 TypeSafe 说 Jev 在英文上最准;包括中日韩文字在内的其他语言能处理,但效果不如英文。用你自己的非英文数据训练的模型可能做得更好。
- 依赖。 TypeSafe 的速率限制可能不经通知就调整,曾因需求过高出过故障,而且它自己说还无法证明其定价没有补贴。自己托管的模型没有这些风险,但所有维护都归你。
什么时候自己跑模型
- 数据不能离开你的基础设施。
- 标签集小而稳定,而且你已经有大量标注样本。
- 你的输入大多不是英文,而且你可以用这些数据训练。
- 你需要不走网络就拿到答案。
什么时候用 Jev
- 你还没有或只有很少的标注,或者标签经常变化:改一个问题只要一分钟,重训可不是。
- 标签集很大——Jev 最明确的独立胜出是在一个 72 标签的任务上。
- 你想要为校准而训练的概率,而不是 softmax 近似值,同时仍会在自己的数据上核对。
一条实际可行的路径是:先用 Jev,把它的回答和人工纠正的结果记下来;等积累出规模足够、标签稳定的数据后,再训练自己的模型,并在你的数据上测试谁更好。你可以从试验台开始积累这份记录;如果你在选择如何接入托管的 Jev,请看怎样获取 Jev;和通用 LLM 的比较,请看 Jev 对比 LLM 分类。
常见问题
- Jev 开源吗?
- 不开源。TypeSafe 没有公布 Jev 的权重、参数量、架构或完整的训练方法。TechCrunch 报道说,外界有人猜测它基于某个开放权重的 LLM 构建,但这一点未经证实。
- 可以在本地运行 Jev 吗?
- 不可以。Jev 只以托管 API 的形式提供。如果数据不能离开你的机器,你需要换一个模型。
- Jev 最好的开源替代是什么?
- 取决于任务。标签少、必须本地运行时,GLiNER 这类零样本分类器是唯一与 Jev 做过独立正面对比的选项。标签集稳定、标注数据充足时,用你自己训练的分类器。在小型 LLM 上模仿 Jev 接口的项目是不错的实验,但还替代不了它。
- 开源复现能给出校准过的概率吗?
- 做过测量的那个不能。jev-on-a-laptop 说明它的置信度只是对候选选项做的原始 softmax,而不是经过训练的校准;它的 7B 模型在 20 个答错的字段里,有 13 个置信度超过 0.90。
相关页面
把它接进你的流程
注册即送 200 点,保存自己的问题集,并通过 API 调用同样的评估。