Jev vs Perplexity Decider:两个最便宜的决策模型,同题实测
Perplexity Decider(pplx-decider-v1-27b)和 Jev 接受同样的请求——一份 state 加带类型的问题——返回概率。它们也是按 token 计价最便宜的两个:每百万输入 token $0.04 和 $0.042。我们 2026-10-07 的测试里,两者在 Banking77 银行卡意图上打平(86.5%),AG News 上 Decider 略高(93% 对 91%)。真正的区别在计费:Decider 每个问题都会重新读一遍 state,所以单问题时它更便宜,长文本多问题时反而更贵。
用你自己的文本试试
修改示例后运行。无需账号,每天免费 3 次。
场景
把工单分给对应团队,评估紧急程度,并标记流失风险。
可以随意修改,所选模型会针对这里的内容回答该场景的问题。
一览
(厂商) 是卖模型的公司给的数字;(实测) 是我们 2026-10-07 经 OpenRouter 自己调用测的。
| Jev | Perplexity Decider | |
|---|---|---|
| 厂商 | TypeSafe | Perplexity |
| 模型 id | jev-latest | pplx-decider-v1-27b |
| 权重 | 闭源 | 开放,Apache 2.0 |
| 基座模型 | 未公开 | Qwen3.8-27B (厂商) |
| 输入标价 | $0.042 / 百万 token | $0.04 / 百万 token |
| 输出 token | 免费 | 免费 |
| 上下文 | 约 32k token,与最长的问题共享 (厂商) | 262k token (厂商) |
| 图片 | 不支持 | 支持 |
| 输入 token 拟合 | ≈ 260 + 0.163 × 字符数 + 43 × 问题数 | ≈ 问题数 × (84 + 0.163 × 字符数) |
| 延迟中位数 | 412 ms (实测) | 493 ms (实测) |
| Banking77 银行卡意图 | 86.5% (实测) | 86.5% (实测) |
| AG News 主题 | 91% (实测) | 93% (实测) |
| JevStation 积分 | 1 / 3 | 2 / 6 |
积分为标准 / 大档;state 超过 8,000 字符或问题超过 5 个即为大档。
准确率与校准
我们给两个模型发了同样 196 条带标签输入,零样本,每个选项一行说明。方法详见 决策模型对比,那里五个模型跑的是同一批数据。
| 任务 | Jev | Decider |
|---|---|---|
| Banking77,12 个银行卡意图(96) | 86.5% | 86.5% |
| AG News,4 个主题(100) | 91% | 93% |
| Banking77:置信度 ≥ 0.9 的答案 | 覆盖 81%,其中 94.9% 正确 | 覆盖 77%,其中 98.6% 正确 |
| 置信度 ≥ 0.99 却答错(共 196) | 4 | 1 |
| AG News 期望校准误差(ECE) | 0.086 | 0.052 |
这个样本量下准确率算打平。校准上 Decider 领先:它非常确定的时候几乎总是对的,所以按它的置信度设阈值,漏过去的错误更少。Jev 在 196 条里有 136 条给出了 1.00 的置信度(保留两位小数),很难再从中区分出简单和有风险的情况。
两个模型都找到了藏在 20,000 字符中性文本最末尾的那句取消请求,测试中都没有截断 state。
成本差在 token 数,不在单价
两者标价几乎一样,账单却不一样,因为它们数 token 的方式不同。我们各用九个请求拟合(state 为 100、2,000、8,000 字符,配 1、3、5 个问题):
| 请求 | Jev token | Decider token | 按标价更便宜的 |
|---|---|---|---|
| 1 个问题,短工单(约 300 字符) | 约 350 | 约 130 | Decider |
| 3 个问题,1,500 字符 | 约 640 | 约 990 | Jev |
| 5 个问题,8,000 字符 | 约 1,780 | 6,985 | Jev,约 4 倍 |
| 12 个长问题,24,000 字符 | 8,981 | 51,882 | Jev,约 6 倍 |
Decider 的 token 数随"问题数 × state 长度"增长,相当于每个问题都是一次单独调用;Jev 随 state 长度增长,每加一个问题只多一点。如果你的工作负载是每次一个问题——比如路由器或单个护栏——Decider 是我们测过最便宜的模型。如果要对同一份文档问好几个问题,即使 Jev 标价更高,它也更便宜。
这也是 JevStation 对 Decider 收 2 积分而不是 1 积分的原因。价格计算器可以按你自己的数字比较两者。
怎么选
- 高频的单问题调用:Decider。
- 对同一段文本问多个问题:Jev。
- 需要判断图片:Decider。Jev 不支持图片。
- 需要能直接据此自动执行的置信度:这次测试里 Decider 校准更好;请在你自己的数据上确认。
- 自托管或数据驻留要求:Decider,开放权重。Jev 只有 API。
- 输入超过约 3 万 token:Decider,上下文 262k。
两个都试试
上面可以免注册运行 Decider;登录后用并排运行器把同样的文本和问题同时发给 Jev 和 Decider。
来源
- Decider 模型、价格与上下文。OpenRouter 模型页 与 Perplexity Decisions API 文档 (厂商)
- 发布、基座模型与许可证。AGTP on X 与 AGI Hunt (第三方)
- Jev 价格与上下文。TypeSafe 模型文档 (厂商);Jev 最坏 token 数见 一次 Jev 评估要花多少钱 (实测)
- 准确率、校准、延迟与 token 数。我们 2026-10-07 经 OpenRouter 的实测 (实测)
JevStation 是独立站点。Jev 与 Decider 分别是 TypeSafe 与 Perplexity 的名称;我们与两者均无关联。
常见问题
- Perplexity Decider 能直接替换 Jev 吗?
- 请求格式上可以。经 OpenRouter 的 System One 接口或 JevStation 调用时,Decider 接受同样的 state 和同样的 Choice、Score、Noul 问题,返回同样结构的答案。如果你的调用一次带多个问题,换之前先算成本:Decider 每个问题都按一次 state 计费。
- Perplexity Decider 开源吗?
- 权重以 Apache 2.0 发布在 Hugging Face 上,Perplexity 称它基于 Qwen3.8-27B 微调。Jev 没有开放权重。数据不能离开你自己的机器时,Decider 可以自托管,Jev 不行。
- Jev 和 Decider 哪个更准?
- 我们的测试里很接近。96 条 Banking77 银行卡意图消息上两者都是 86.5%;100 篇 AG News 上 Decider 93%、Jev 91%,在这个样本量下属于噪声范围。Decider 的校准略好:置信度 0.99 及以上时它只错了 1 次,Jev 错了 4 次。
- 为什么长文本多问题时 Decider 更贵?
- 它的输入 token 随问题数增长。8,000 字符的 state,我们测到 1 个问题 1,392 token、3 个问题 4,192、5 个问题 6,985,差不多每个问题完整读一遍 state。Jev 只读一遍,加问题时 token 几乎不变。
- Decider 在 JevStation 上多少钱?
- 因为按问题重复计费,标准评估 2 积分、大档 6 积分;Jev 是 1 和 3。Decider 在免注册试用里开放,不用注册就能在本页对比两者。
相关页面
把它接进你的流程
注册即送 200 点,保存自己的问题集,并通过 API 调用同样的评估。