Jev vs Microsoft-Decision-1:两个 $0.042 的决策模型,同题实测

Microsoft-Decision-1 于 2026-10-09 发布,已经上了 OpenRouter。它和 Jev 接受同样的请求——一份 state 加带类型的问题——返回概率,标价也相同:每百万输入 token $0.042。我们 2026-10-10 的测试里,它在准确率上与 Jev 持平(Banking77 银行卡意图 87.4% 对 86.5%,AG News 都是 91%),校准更好,所有测过的请求里 token 都更少。要留意的是限流:四路并发时 Azure 拒绝过一次请求。

用你自己的文本试试

修改示例后运行。无需账号,每天免费 3 次。

场景

把工单分给对应团队,评估紧急程度,并标记流失风险。

166 / 2,000

可以随意修改,所选模型会针对这里的内容回答该场景的问题。

模型

Jev 实际返回了什么

下面是上方示例未经修改的输出,采集自线上 API。

Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing with 'invalid redirect'. I'm losing sales every hour this is down. Please help ASAP.

category

choice

Which team should handle this support ticket?

integrations

  • integrations99%
  • billing1%
  • bug0%
  • account0%

置信度 99%

urgency

score

How urgent is this ticket?

3.73/4Critical
  • 4 · Critical73%
  • 3 · Urgent27%
  • 0 · Can wait0%
  • 1 · Normal0%
  • 2 · Soon0%

置信度 77%

churn risk

noul

Is the customer at risk of churning?

是80%
是 80%否 20%

采集于 2026-10-09 · 0.89 秒 · jev-1.13.0

一览

(厂商) 表示出自模型厂商;(实测) 表示我们经 OpenRouter 自己调用得到的(Jev 在 2026-10-07,Decision-1 在 2026-10-10)。

JevMicrosoft-Decision-1
厂商TypeSafeMicrosoft
模型 idjev-latestmicrosoft/microsoft-decision-1
权重闭源闭源,仅 Foundry 和 OpenRouter
基座模型未披露Qwen3.5-9B (厂商)
输入标价$0.042 / 百万 token$0.042 / 百万 token
输出 token免费免费
上下文约 32k token,与最长的问题共享 (厂商)32,768 token (厂商)
图片不支持不支持
输入 token(拟合)≈ 260 + 0.163 × 字符数 + 43 × 问题数≈ 0.163 × 字符数 + 35 × 问题数
延迟中位数412 ms (实测)473–491 ms (实测)
Banking77 银行卡意图86.5% (实测)87.4% (实测)
AG News 主题91% (实测)91% (实测)
JevStation 积分1 / 31 / 3

积分为 标准 / 大档;state 超过 8,000 字符或问题达 5 个即为大档。

准确率与校准

两个模型收到同样的带标签输入,零样本,每个选项一行说明。方法见 决策模型对比,那里用同样的数据跑了其他模型。

任务JevDecision-1
Banking77,12 个银行卡意图(96)86.5%87.4%(95 条有答案)
AG News,4 个主题(100)91%91%
Banking77:置信度 ≥ 0.9 的答案占 81%,其中 94.9% 正确占 67%,其中 100% 正确
置信度 ≥ 0.99 时答错196 条中 4 条195 条中 2 条
AG News 期望校准误差0.0860.053

准确率打平。Decision-1 的优势在校准:它很确定时几乎总是对的,也不那么常停在 1.00(195 条里 74 条在 0.99 及以上,Jev 是 196 条里 136 条),更容易区分简单和有风险的输入。代价是覆盖率:能过 0.9 门槛的答案更少,更多要交给人工。

Decision-1 也找到了藏在 20,000 字符无关文本任意位置的那句取消请求(最末尾时 0.998)。

token、延迟与限流

标价相同,账单就看 token 数。Decision-1 同样的请求 token 更少,并且和 Jev 一样只读一遍 state。我们用九个请求拟合(state 100、2,000、8,000 字符,各问 1、3、5 个问题):

请求Jev tokenDecision-1 token按标价更便宜
1 个问题,短工单(约 300 字符)约 350约 85Decision-1,约 4 倍
3 个问题,1,500 字符约 640约 350Decision-1,约 2 倍
5 个问题,8,000 字符约 1,780约 1,470Decision-1,约 1.2 倍
12 个长问题,24,000 字符8,9818,150Decision-1,约 1.1 倍

延迟与 Jev 接近,但尾部更重:p50 约 480 ms,Banking77 上 p90 最高 1.4 秒。Azure 的限流比预期紧:四路并发时,96 条里有 1 条返回 HTTP 429。突发调用请带退避重试;JevStation 已经替你做了。

怎么选

  • 大量短的单问题调用: Decision-1,同价位下我们测到 token 最少的。
  • 想用置信度做自动决策: Decision-1 在我们的测试里校准更好,请用自己的数据确认。
  • 固定阈值下要最大覆盖率: Jev,过 0.9 的答案更多。
  • 需要自托管或数据驻留: 两个都不行,用开源权重的 Perplexity Decider。
  • 要判断图片或输入超过约 30k token: Perplexity Decider。
  • 要 Azure 上有厂商支持的服务: Decision-1。

两个都试试

在上面免注册试用 Decision-1,或登录后用 并排运行 把同样的文本和问题同时发给 Jev 和 Decision-1。价格计算器 可以按你自己的用量算两者的成本。

来源

  • Decision-1 模型、价格与上下文。OpenRouter 模型页 (厂商)
  • 发布、基座模型与基准声明。MarkTechPost 与 OrcaRouter (独立)
  • Jev 价格与上下文。TypeSafe 模型文档 (厂商)
  • 准确率、校准、延迟与 token 数。我们经 OpenRouter 在 2026-10-07(Jev)与 2026-10-10(Decision-1)的实测 (实测)

JevStation 是独立站点。Jev 与 Microsoft-Decision-1 是各自所有者 TypeSafe 和 Microsoft 的名称,我们与两者均无关联。

常见问题

Microsoft-Decision-1 能直接替换 Jev 吗?
请求格式上可以。经 OpenRouter 的 System One 接口或 JevStation,它接受同样的 state 和 Choice、Score、Noul 问题,返回同样结构的答案。有两点不同:只接受文本,上下文约 32k token。
Microsoft-Decision-1 能下载或自托管吗?
不能。微软只通过 Microsoft Foundry(以及路由到 Azure 的 OpenRouter)提供,没有公开权重,只说明它由 Qwen3.5-9B 后训练而来。需要自托管的话,用开源权重的 Perplexity Decider。
Jev 和 Decision-1 哪个更准?
我们的测试里持平。Decision-1 在 95 条有答案的 Banking77 银行卡意图上 87.4%(有一次请求被限流),Jev 在 96 条上 86.5%;100 篇 AG News 上两者都是 91%,在这个样本量下属于噪声范围。微软称在 36 个基准上准确率最高,但数字是它自己的,没有第三方复现。
Decision-1 的校准比 Jev 好吗?
我们的测试里是。Banking77 上置信度 0.9 及以上的答案全部正确(64 条中 64 条),Jev 是 94.9%。置信度 0.99 及以上的 74 条里错了 2 条;Jev 错了 4 条,而且在 196 条里有 136 条给出 1.00。把它当作信号而不是保证,用自己的数据确认。
Decision-1 在 JevStation 上多少钱?
标准评估 1 积分、大档 3 积分,与 Jev 相同。它在免注册试用里,所以不用账号就能在本页同时试两个。

相关页面

把它接进你的流程

注册即送 200 点,保存自己的问题集,并通过 API 调用同样的评估。