Jev 回答关于你数据的带类型问题, JevStation 就是你运行它的地方。
Jev 是 TypeSafe 的 System One 模型:提交一份 state,提出 Choice、Score 或 Noul 问题,拿回带概率分布与置信度的结构化答案。JevStation 把这套契约包成一个工作台——会话自动保存、上下文可复用、点数按次计量。
- 问题类型:Choice、Score、Noul
- 3问题类型:Choice、Score、Noul
- 单次评估可提的带类型问题数
- 12单次评估可提的带类型问题数
- 每次评估:标准 1 点,超出 8,000 字符或 5 个问题收 3 点
- 1–3 点每次评估:标准 1 点,超出 8,000 字符或 5 个问题收 3 点
自三月那次 webhook 变更后,计费同步已经失败三次,两位客户正在升级投诉。
答案
- 情感倾向
- 负面91%
- 是否紧急
- 是87%
- 复杂程度
- 3.6/4 · 复杂78%
3 个问题 · 1 次往返
默认私密。你的会话不会被用于训练。
产品能力
Jev 之外的事,都替你办好了
Jev 返回判断本身,JevStation 负责其余那些决定一次评估能否扛住真实工作的部分。标准评估每次 1 点——state 不超过 8,000 字符且问题不超过 5 个;更大的请求 3 点。失败的运行消耗 0 点。
使用方式
输入 state,拿回结构化答案
三步,顺序就是你实际会遇到的那样:粘贴要判断的内容、写下最多 12 个带类型的问题、读取答案。每个问题都以带类型的值连同概率分布返回,因此代码走哪个分支由响应本身决定,而不是靠解析它。
- 01
粘贴 state
打开试验台,把需要 Jev 判断的内容粘进去:一张工单、一条评论、一份规格说明,或一条 JSON 记录。
- 02
写出带类型的问题
添加 Choice、Score 或 Noul 问题,单次评估最多十二个,每个问题都带上定义各选项的判定标准。
- 03
读结构化答案
Jev 返回带类型的取值、完整的概率分布,以及一个置信度。保留这次会话,或把问题集发布成剧本。
定位
JevStation 与生成式大模型
大模型先写出一段散文,你再想办法把它解析回来。Jev 直接给出判断本身,而且是你代码本来就期待的形状。
它是什么
JevStation
一个架在 System One 模型之上的 JevStation 工作台
生成式大模型
一个预测下一个 token 的模型
输出形态
JevStation
一个带类型的取值,外加它背后的概率分布
生成式大模型
一段散文,你得先逼成 JSON 再解析回来
置信度
JevStation
每条 Choice 与 Score 答案都带一个校准过的置信度
生成式大模型
没有,除非你在提示词里要求,然后祈祷它遵守
成本控制
JevStation
标准评估每次 1 点、大请求 3 点,失败自动退回
生成式大模型
token、重试与格式错误都要你自己统计
使用场景
大家拿 Jev 判断什么
Jev 的定位刻意很窄:它做判断,不写作。一次运行最多 12 个带类型的问题,每个问题返回一个带类型的值、完整的概率分布与置信度。下面是最常出现在共享目录里的几种形态。
客服工单分流
把一批工单作为 state 粘进去,用一个 Noul 问题问紧急性,再用一个 Score 问题打复杂度。
评论审核
用 Choice 问一条评论是正面、中立还是负面,然后按答案的概率分流,而不是靠关键词表。
按评分标准打分
把一份长文档变成 state,让每一节都对同一套标准打分,结果之间才具备可比性。
团队剧本
把终于跑通的那套问题集发布出来,下一个人就从你的判定标准出发,而不是从空白提示词开始。
了解 Jev
先弄清 System One 模型是怎么工作的。
几篇有出处的短文:Jev 是什么、一次评估到底花多少钱、团队怎么把它放进 Agent 流程。
System One 模型是什么,不是什么
System One 模型返回的是带类型的判断与校准过的概率,而不是生成的文本。这意味着什么、RLCD 与 RLHF 有何不同,以及独立证据目前还薄弱在哪里。
阅读全文用 Jev 当评判模型:一个是非题能抓住什么、会漏掉什么
一个不写文字的模型能当 LLM 评判吗?目前最好的公开测试显示,只问 Jev 一个是非题,识别后门代码的 AUROC 就达到 0.976,每千次检查约 $0.04。本文讲它在哪里成立、在哪里失效。
阅读全文fast-jev-compaction: Compaction Without the Summary
A Claude Code plugin that replaces the compaction summary with Jev decisions: every tool call and result is scored, stale ones are dropped, and everything kept stays verbatim.
阅读全文一次 Jev 评估到底花多少钱:实测
我们按应用允许的每种 state 规模与问题数量发起了 11 次真实 Jev 调用,拟合出 token 模型并实测成本:每次评估 $0.000012 到 $0.000377。
阅读全文