Jev 对比开源模型:哪些能自己跑,代价是什么

在我们追踪的所有来源里,都没有开放权重的 Jev。现有的开源项目是把它的接口——类型化问题、受约束的答案——搬到本地小模型上;其中做过自测的那一个比 Jev 低约 13 个百分点,而且置信度没能标出它自己的错误。数据不能离开你的机器,或者你有大量稳定的标注数据时,自己跑模型;否则托管的 Jev 是更稳妥的默认选择。

一览

“开源版 Jev”常被当成一样东西来搜。在我们的来源里,它其实是四种不同的东西,只有一种被独立第三方拿来和 Jev 正面比较过。想先看包括通用 LLM 在内所有替代方案的简要总览,请从 Jev 的替代方案 开始;本页深入讲那些你可以自己运行的选项。

方案是什么在哪里运行与 Jev 对比测过吗?
JevTypeSafe 托管的 System One 模型TypeSafe 的 API 或转售方—
jev-on-a-laptop在现成的 1.5B–8B 模型上做 Jev 式约束解码你的笔记本测过,用的是 TypeSafe 的公开样例
open-jev基于 DiffusionGemma 的类型化 JSON 推理你的硬件我们的来源里没有
GLiNER 2.5零样本分类器你的硬件,CPU 即可测过,预注册试点
你自己的分类器用你的标注数据微调的模型你的硬件没有公开基准

为什么没有可以下载的 Jev

让 Jev 成为 Jev 的是训练,而训练的部分一样都没公开。TypeSafe 用 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)在自己制作的合成数据上训练它,所有账号共用同一套权重——没有按客户的微调,也没有 LoRA。公开资料里没有参数量、架构、完整的 RLCD 方法或校准曲线(见什么是 System One 模型)。

能复制的是接口:先声明选项,强制模型从中作答,再从概率分布里读出概率。下面两个开源项目做的都是这件事。这样能得到和 Jev 一样的输出形态,但得不到那个本该让概率可信的训练过程。

jev-on-a-laptop:在本地小模型上复刻接口

jev-on-a-laptop 是一项非官方研究,在 Apple Silicon 笔记本上,用现成的 1.5B–8B 模型复现 Jev 式的并行约束解码。它与 TypeSafe 没有关联,也无法访问 Jev 的模型。它是这里最有用的来源,因为它如实测量了自己。

准确率。 作者重建了 TypeSafe 四个工作流里的全部公开样例,并以 TypeSafe 自己的参考答案为准,在 343 个问题对上给每个模型打分:

模型一致率
Opus(已公布)89.8%
DeepSeek v4.1 Flash89.5%
Sol(已公布)89.2%
Jev(已公布)86.6%
Qwen2.5-7B,本地、免费73.8%

在 Jev 自己的基准上,免费的本地模型比 Jev 落后约 13 个百分点。作者还指出,更早一次只有 5 个样例的测试曾显示两者打平,他认为那是样本太小造成的假象——这对所有小规模测试都是有用的提醒。

置信度。 本地模型的置信度不能可靠地标出错误:7B 模型在 20 个答错的字段中,有 13 个置信度超过 0.90。作者把“校准过的置信度”标为未能复现,因为对候选选项做原始 softmax 只是一个近似,不是训练出来的校准。这是关于复现项目的结论,不是关于 Jev 的。

速度。 与作者自己的朴素 JSON 基线相比,本地约束解码快 3.4–7.9 倍。作者把 TypeSafe 声称的 40–200 倍标为不适用于本地部署。

open-jev:在扩散模型上复刻接口

open-jev 换了一个底座:用 DiffusionGemma 做类型化 JSON 推理,并重放了 Jev 公开样例中的全部 408 个问题。我们的来源里没有 open-jev 自身的准确率或校准结果,所以我们无法告诉你它离 Jev 有多近。它还引用了一组归于 Every 的实验;它的作者说明,那些数字是与某个已保存模型答案的一致率,不是人工标注的准确率,而且我们也没找到这组实验的独立发布。

GLiNER:唯一的独立正面对比

方法最扎实的对比,是与 fastino/gliner2.5-multi-v1 的比较,这是一个可以在 CPU 上运行的零样本分类器。jev-benchmarks 做了一个预注册试点,在三个数据集上各取 100 条留出样本,并设置了均匀分布的阴性对照。准确率和覆盖率表格见 Jev 的替代方案;那张表没有展示的,是每个结果有多可靠:

数据集标签数Jev 减 GLiNER 的准确率差,95% 置信区间
AG News4+0.130 到 +0.290
Banking7772+0.220 到 +0.300
DAIR Emotion6−0.070 到 +0.150

在前两个数据集上,即使取区间下限,Jev 依然明显领先。在 DAIR Emotion 上,准确率差异没有定论,而校准则反过来:Jev 的 Brier 分数是 0.846,GLiNER 是 0.668;对数损失 5.588 对 1.381;并且在 16% 的样本上,Jev 给真实标签的概率是零。作者自己说结果是刻意呈现的有好有坏。

GLiNER 在 Apple M4 Max 的 CPU 上运行,Jev 则是从法国通过网络调用,所以延迟数字(在小标签集上约 44 ms 对 236–256 ms)描述的是那次部署,而不是模型本身。

你自己微调的分类器

这方面我们没有基准,我们的来源里也没有。我们能讲的是取舍。Jev 无法用你的数据训练,它在你的领域上表现如何,只取决于你在请求里写了什么。你自己微调的模型则能直接学到你数据里的特殊规律。一篇上手评测说得很简单:对于稳定、狭窄的领域,传统的小型分类器可能仍然是更简单的选择。

有三点会影响这个决定:

  • 数据处理。 Jev 的 state 里的所有内容都会发送给 TypeSafe,零数据保留只提供给企业客户。本地模型什么都不外发。
  • 语言。 TypeSafe 说 Jev 在英文上最准;包括中日韩文字在内的其他语言能处理,但效果不如英文。用你自己的非英文数据训练的模型可能做得更好。
  • 依赖。 TypeSafe 的速率限制可能不经通知就调整,曾因需求过高出过故障,而且它自己说还无法证明其定价没有补贴。自己托管的模型没有这些风险,但所有维护都归你。

什么时候自己跑模型

  • 数据不能离开你的基础设施。
  • 标签集小而稳定,而且你已经有大量标注样本。
  • 你的输入大多不是英文,而且你可以用这些数据训练。
  • 你需要不走网络就拿到答案。

什么时候用 Jev

  • 你还没有或只有很少的标注,或者标签经常变化:改一个问题只要一分钟,重训可不是。
  • 标签集很大——Jev 最明确的独立胜出是在一个 72 标签的任务上。
  • 你想要为校准而训练的概率,而不是 softmax 近似值,同时仍会在自己的数据上核对。

一条实际可行的路径是:先用 Jev,把它的回答和人工纠正的结果记下来;等积累出规模足够、标签稳定的数据后,再训练自己的模型,并在你的数据上测试谁更好。你可以从试验台开始积累这份记录;如果你在选择如何接入托管的 Jev,请看怎样获取 Jev;和通用 LLM 的比较,请看 Jev 对比 LLM 分类。

常见问题

Jev 开源吗?
不开源。TypeSafe 没有公布 Jev 的权重、参数量、架构或完整的训练方法。TechCrunch 报道说,外界有人猜测它基于某个开放权重的 LLM 构建,但这一点未经证实。
可以在本地运行 Jev 吗?
不可以。Jev 只以托管 API 的形式提供。如果数据不能离开你的机器,你需要换一个模型。
Jev 最好的开源替代是什么?
取决于任务。标签少、必须本地运行时,GLiNER 这类零样本分类器是唯一与 Jev 做过独立正面对比的选项。标签集稳定、标注数据充足时,用你自己训练的分类器。在小型 LLM 上模仿 Jev 接口的项目是不错的实验,但还替代不了它。
开源复现能给出校准过的概率吗?
做过测量的那个不能。jev-on-a-laptop 说明它的置信度只是对候选选项做的原始 softmax,而不是经过训练的校准;它的 7B 模型在 20 个答错的字段里,有 13 个置信度超过 0.90。

相关页面

把它接进你的流程

注册即送 200 点,保存自己的问题集,并通过 API 调用同样的评估。