用 Jev 当评判模型:给 LLM 回答打出带类型的判定
贴上用户问题、参考资料和模型的回答,Jev 会告诉你:回答是否与资料一致、在五级评分上处于什么位置、该不该展示给用户。结果是代码可以直接设阈值的概率,而不是一段需要再解析的文字。
用你自己的文本试试
修改示例后运行。无需账号,每天免费 3 次。
场景
对照参考资料给模型的回答打分,并决定能不能直接展示。
可以随意修改,Jev 会针对这里的内容回答该场景的问题。
这个评判工具检查什么
上面的示例是在评判一个客服机器人的回答:它本应依据知识库里的一段说明来作答。一次调用里问了三个问题:
| 问题 | 类型 | 返回什么 |
|---|---|---|
correct | Noul | 回答与 reference 一致的概率 |
quality | Score | 在"错误 → 优秀"五级上的位置,以及置信度 |
verdict | Choice | ship、revise、reject 各自的概率 |
三个问题仍然只收 1 点,而且它们针对同一份 state 并行作答,多问几个几乎不增加延迟。示例里的回答和参考资料相矛盾——它说免费账户不能用 API——所以值得看的是 correct 有多明显地偏向"否",以及 verdict 选的是 reject 还是 revise。
怎么写好评判问题
一个 Noul 只管一种失败。 "这个回答好不好?"把准确性、语气和完整度揉成一个概率,拿到了也没法据此行动。"回答是否与参考资料矛盾?"只有一个含义。你关心的其他失败,各自再加一个 Noul,比如"回答是否承诺了政策不允许的事?"
给 Noul 写上 criteria。 用 true 和 false 各一句描述告诉 Jev 界线在哪里:
{
"type": "noul",
"instructions": "Does `answer` state or imply something that contradicts `reference`?",
"criteria": {
"true": "The answer asserts a fact the reference contradicts.",
"false": "Everything the answer claims is supported by, or absent from, the reference."
}
}
严重程度重要时用 Score。 大多数输出都是"部分正确"时,一个每级带简短描述的五级评分表,比是非题更能把回答排出先后。
把决策放进 Choice。 直接问 ship / revise / reject,拿到的是一组针对行动的概率分布,比自己组合三个数字更好分流。另外两个问题留着做日志和调阈值。
更多关于问法的内容,见设计 Jev 能回答的问题。
从一次检查到流水线里的一步
- 收集标注样本。 50 到 200 条真实回答,每条由人标好好坏,就足以看出 Jev 的概率在哪里把它们分开。
- 定三个区间,而不是一个阈值。 Jev 有把握的直接放行,中间区间升级给更强的评判模型或人工,其余拦下。在公开试验中,这种做法让 Jev 独自处理掉了约 80% 的队列。
- 记录模型版本。 每次响应都带有
model字段(例如jev-1.13.0)。把它和每条判定一起记下,版本变化时重新校验阈值——JevStation 在部署层固定模型,不需要你在请求里指定。 - 从流水线里调用。 同样的评估可以用 API Key 通过 System One API 调用,扣点规则和试验台一样。
信任之前先验证
- 拿自己的标注对比,而不是拿示例。 在别人数据上好用的阈值,不是你的阈值。
- 测试问法。 一个 Noul 和它的否定问法,或者同一个意思写成 Noul 和写成 Choice,可能给出不同的概率。阈值要在你实际上线的那组问题上调。
- 关注中间区间。 如果大多数回答都落在两个阈值之间,说明问题太笼统——拆开它。
哪些时候 Jev 不是合适的评判模型
- 你需要写出来的理由,给审核人、审计记录,或者反馈给被评判的模型。
- 判定涉及计数、算术或日期。 TypeSafe 自己把这些列为弱项。
- 被评判的系统能调用评判模型。 分数便宜又稳定,反而让对方很容易摸索出什么能蒙混过关。
这些局限背后的证据,以及本页引用的试验数字,都带出处整理在用 Jev 当评判模型:一个是非题能抓住什么、会漏掉什么。
常见问题
- Jev 能替代 LLM-as-a-judge 吗?
- 如果判定结果能事先列举——对或错、通过或不通过、落在评分表的哪一级——可以。它不会写评语或理由,所以需要解释或开放式反馈的场景,仍然保留生成式评判模型。
- Jev 当评判模型准不准?
- 目前最好的公开测试是一项独立的 AI control 试验:只问 Jev 一个是非题,它把植入后门的代码排在正常代码之前的 AUROC 达到 0.976。在你的任务上准不准取决于你的问题,依赖阈值之前,先用自己标注过的样本测一遍。
- 一次评判多少钱?
- 在 JevStation 上一次标准评估 1 点,不管是 1 个问题还是 5 个问题。按 Jev 官方价,一次典型检查的 token 成本约 $0.00002。
- 被评判的回答能操纵判定结果吗?
- Jev 没有指令通道——state 里的文字只被当作内容读取;在公开试验中,写给评判模型的注释也没能帮坏输出过关。但如果被评判的系统可以反复调用评判模型、只保留得分最好的那次,它就能摸索出绕过的方法,所以绝不要把评判分数暴露给它。
相关页面
把它接进你的流程
注册即送 200 点,保存自己的问题集,并通过 API 调用同样的评估。