Jev vs Microsoft-Decision-1:两个 $0.042 的决策模型,同题实测
Microsoft-Decision-1 于 2026-10-09 发布,已经上了 OpenRouter。它和 Jev 接受同样的请求——一份 state 加带类型的问题——返回概率,标价也相同:每百万输入 token $0.042。我们 2026-10-10 的测试里,它在准确率上与 Jev 持平(Banking77 银行卡意图 87.4% 对 86.5%,AG News 都是 91%),校准更好,所有测过的请求里 token 都更少。要留意的是限流:四路并发时 Azure 拒绝过一次请求。
用你自己的文本试试
修改示例后运行。无需账号,每天免费 3 次。
场景
把工单分给对应团队,评估紧急程度,并标记流失风险。
可以随意修改,所选模型会针对这里的内容回答该场景的问题。
Jev 实际返回了什么
下面是上方示例未经修改的输出,采集自线上 API。
Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing with 'invalid redirect'. I'm losing sales every hour this is down. Please help ASAP.
category
choiceWhich team should handle this support ticket?
integrations
- integrations99%
- billing1%
- bug0%
- account0%
置信度 99%
urgency
scoreHow urgent is this ticket?
- 4 · Critical73%
- 3 · Urgent27%
- 0 · Can wait0%
- 1 · Normal0%
- 2 · Soon0%
置信度 77%
churn risk
noulIs the customer at risk of churning?
采集于 2026-10-09 · 0.89 秒 · jev-1.13.0
一览
(厂商) 表示出自模型厂商;(实测) 表示我们经 OpenRouter 自己调用得到的(Jev 在 2026-10-07,Decision-1 在 2026-10-10)。
| Jev | Microsoft-Decision-1 | |
|---|---|---|
| 厂商 | TypeSafe | Microsoft |
| 模型 id | jev-latest | microsoft/microsoft-decision-1 |
| 权重 | 闭源 | 闭源,仅 Foundry 和 OpenRouter |
| 基座模型 | 未披露 | Qwen3.5-9B (厂商) |
| 输入标价 | $0.042 / 百万 token | $0.042 / 百万 token |
| 输出 token | 免费 | 免费 |
| 上下文 | 约 32k token,与最长的问题共享 (厂商) | 32,768 token (厂商) |
| 图片 | 不支持 | 不支持 |
| 输入 token(拟合) | ≈ 260 + 0.163 × 字符数 + 43 × 问题数 | ≈ 0.163 × 字符数 + 35 × 问题数 |
| 延迟中位数 | 412 ms (实测) | 473–491 ms (实测) |
| Banking77 银行卡意图 | 86.5% (实测) | 87.4% (实测) |
| AG News 主题 | 91% (实测) | 91% (实测) |
| JevStation 积分 | 1 / 3 | 1 / 3 |
积分为 标准 / 大档;state 超过 8,000 字符或问题达 5 个即为大档。
准确率与校准
两个模型收到同样的带标签输入,零样本,每个选项一行说明。方法见 决策模型对比,那里用同样的数据跑了其他模型。
| 任务 | Jev | Decision-1 |
|---|---|---|
| Banking77,12 个银行卡意图(96) | 86.5% | 87.4%(95 条有答案) |
| AG News,4 个主题(100) | 91% | 91% |
| Banking77:置信度 ≥ 0.9 的答案 | 占 81%,其中 94.9% 正确 | 占 67%,其中 100% 正确 |
| 置信度 ≥ 0.99 时答错 | 196 条中 4 条 | 195 条中 2 条 |
| AG News 期望校准误差 | 0.086 | 0.053 |
准确率打平。Decision-1 的优势在校准:它很确定时几乎总是对的,也不那么常停在 1.00(195 条里 74 条在 0.99 及以上,Jev 是 196 条里 136 条),更容易区分简单和有风险的输入。代价是覆盖率:能过 0.9 门槛的答案更少,更多要交给人工。
Decision-1 也找到了藏在 20,000 字符无关文本任意位置的那句取消请求(最末尾时 0.998)。
token、延迟与限流
标价相同,账单就看 token 数。Decision-1 同样的请求 token 更少,并且和 Jev 一样只读一遍 state。我们用九个请求拟合(state 100、2,000、8,000 字符,各问 1、3、5 个问题):
| 请求 | Jev token | Decision-1 token | 按标价更便宜 |
|---|---|---|---|
| 1 个问题,短工单(约 300 字符) | 约 350 | 约 85 | Decision-1,约 4 倍 |
| 3 个问题,1,500 字符 | 约 640 | 约 350 | Decision-1,约 2 倍 |
| 5 个问题,8,000 字符 | 约 1,780 | 约 1,470 | Decision-1,约 1.2 倍 |
| 12 个长问题,24,000 字符 | 8,981 | 8,150 | Decision-1,约 1.1 倍 |
延迟与 Jev 接近,但尾部更重:p50 约 480 ms,Banking77 上 p90 最高 1.4 秒。Azure 的限流比预期紧:四路并发时,96 条里有 1 条返回 HTTP 429。突发调用请带退避重试;JevStation 已经替你做了。
怎么选
- 大量短的单问题调用: Decision-1,同价位下我们测到 token 最少的。
- 想用置信度做自动决策: Decision-1 在我们的测试里校准更好,请用自己的数据确认。
- 固定阈值下要最大覆盖率: Jev,过 0.9 的答案更多。
- 需要自托管或数据驻留: 两个都不行,用开源权重的 Perplexity Decider。
- 要判断图片或输入超过约 30k token: Perplexity Decider。
- 要 Azure 上有厂商支持的服务: Decision-1。
两个都试试
在上面免注册试用 Decision-1,或登录后用 并排运行 把同样的文本和问题同时发给 Jev 和 Decision-1。价格计算器 可以按你自己的用量算两者的成本。
来源
- Decision-1 模型、价格与上下文。OpenRouter 模型页 (厂商)
- 发布、基座模型与基准声明。MarkTechPost 与 OrcaRouter (独立)
- Jev 价格与上下文。TypeSafe 模型文档 (厂商)
- 准确率、校准、延迟与 token 数。我们经 OpenRouter 在 2026-10-07(Jev)与 2026-10-10(Decision-1)的实测 (实测)
JevStation 是独立站点。Jev 与 Microsoft-Decision-1 是各自所有者 TypeSafe 和 Microsoft 的名称,我们与两者均无关联。
常见问题
- Microsoft-Decision-1 能直接替换 Jev 吗?
- 请求格式上可以。经 OpenRouter 的 System One 接口或 JevStation,它接受同样的 state 和 Choice、Score、Noul 问题,返回同样结构的答案。有两点不同:只接受文本,上下文约 32k token。
- Microsoft-Decision-1 能下载或自托管吗?
- 不能。微软只通过 Microsoft Foundry(以及路由到 Azure 的 OpenRouter)提供,没有公开权重,只说明它由 Qwen3.5-9B 后训练而来。需要自托管的话,用开源权重的 Perplexity Decider。
- Jev 和 Decision-1 哪个更准?
- 我们的测试里持平。Decision-1 在 95 条有答案的 Banking77 银行卡意图上 87.4%(有一次请求被限流),Jev 在 96 条上 86.5%;100 篇 AG News 上两者都是 91%,在这个样本量下属于噪声范围。微软称在 36 个基准上准确率最高,但数字是它自己的,没有第三方复现。
- Decision-1 的校准比 Jev 好吗?
- 我们的测试里是。Banking77 上置信度 0.9 及以上的答案全部正确(64 条中 64 条),Jev 是 94.9%。置信度 0.99 及以上的 74 条里错了 2 条;Jev 错了 4 条,而且在 196 条里有 136 条给出 1.00。把它当作信号而不是保证,用自己的数据确认。
- Decision-1 在 JevStation 上多少钱?
- 标准评估 1 积分、大档 3 积分,与 Jev 相同。它在免注册试用里,所以不用账号就能在本页同时试两个。
相关页面
把它接进你的流程
注册即送 200 点,保存自己的问题集,并通过 API 调用同样的评估。