Jev vs Perplexity Decider:两个最便宜的决策模型,同题实测

Perplexity Decider(pplx-decider-v1-27b)和 Jev 接受同样的请求——一份 state 加带类型的问题——返回概率。它们也是按 token 计价最便宜的两个:每百万输入 token $0.04 和 $0.042。我们 2026-10-07 的测试里,两者在 Banking77 银行卡意图上打平(86.5%),AG News 上 Decider 略高(93% 对 91%)。真正的区别在计费:Decider 每个问题都会重新读一遍 state,所以单问题时它更便宜,长文本多问题时反而更贵。

用你自己的文本试试

修改示例后运行。无需账号,每天免费 3 次。

场景

把工单分给对应团队,评估紧急程度,并标记流失风险。

166 / 2,000

可以随意修改,所选模型会针对这里的内容回答该场景的问题。

模型

一览

(厂商) 是卖模型的公司给的数字;(实测) 是我们 2026-10-07 经 OpenRouter 自己调用测的。

JevPerplexity Decider
厂商TypeSafePerplexity
模型 idjev-latestpplx-decider-v1-27b
权重闭源开放,Apache 2.0
基座模型未公开Qwen3.8-27B (厂商)
输入标价$0.042 / 百万 token$0.04 / 百万 token
输出 token免费免费
上下文约 32k token,与最长的问题共享 (厂商)262k token (厂商)
图片不支持支持
输入 token 拟合≈ 260 + 0.163 × 字符数 + 43 × 问题数≈ 问题数 × (84 + 0.163 × 字符数)
延迟中位数412 ms (实测)493 ms (实测)
Banking77 银行卡意图86.5% (实测)86.5% (实测)
AG News 主题91% (实测)93% (实测)
JevStation 积分1 / 32 / 6

积分为标准 / 大档;state 超过 8,000 字符或问题超过 5 个即为大档。

准确率与校准

我们给两个模型发了同样 196 条带标签输入,零样本,每个选项一行说明。方法详见 决策模型对比,那里五个模型跑的是同一批数据。

任务JevDecider
Banking77,12 个银行卡意图(96)86.5%86.5%
AG News,4 个主题(100)91%93%
Banking77:置信度 ≥ 0.9 的答案覆盖 81%,其中 94.9% 正确覆盖 77%,其中 98.6% 正确
置信度 ≥ 0.99 却答错(共 196)41
AG News 期望校准误差(ECE)0.0860.052

这个样本量下准确率算打平。校准上 Decider 领先:它非常确定的时候几乎总是对的,所以按它的置信度设阈值,漏过去的错误更少。Jev 在 196 条里有 136 条给出了 1.00 的置信度(保留两位小数),很难再从中区分出简单和有风险的情况。

两个模型都找到了藏在 20,000 字符中性文本最末尾的那句取消请求,测试中都没有截断 state。

成本差在 token 数,不在单价

两者标价几乎一样,账单却不一样,因为它们数 token 的方式不同。我们各用九个请求拟合(state 为 100、2,000、8,000 字符,配 1、3、5 个问题):

请求Jev tokenDecider token按标价更便宜的
1 个问题,短工单(约 300 字符)约 350约 130Decider
3 个问题,1,500 字符约 640约 990Jev
5 个问题,8,000 字符约 1,7806,985Jev,约 4 倍
12 个长问题,24,000 字符8,98151,882Jev,约 6 倍

Decider 的 token 数随"问题数 × state 长度"增长,相当于每个问题都是一次单独调用;Jev 随 state 长度增长,每加一个问题只多一点。如果你的工作负载是每次一个问题——比如路由器或单个护栏——Decider 是我们测过最便宜的模型。如果要对同一份文档问好几个问题,即使 Jev 标价更高,它也更便宜。

这也是 JevStation 对 Decider 收 2 积分而不是 1 积分的原因。价格计算器可以按你自己的数字比较两者。

怎么选

  • 高频的单问题调用:Decider。
  • 对同一段文本问多个问题:Jev。
  • 需要判断图片:Decider。Jev 不支持图片。
  • 需要能直接据此自动执行的置信度:这次测试里 Decider 校准更好;请在你自己的数据上确认。
  • 自托管或数据驻留要求:Decider,开放权重。Jev 只有 API。
  • 输入超过约 3 万 token:Decider,上下文 262k。

两个都试试

上面可以免注册运行 Decider;登录后用并排运行器把同样的文本和问题同时发给 Jev 和 Decider。

来源

JevStation 是独立站点。Jev 与 Decider 分别是 TypeSafe 与 Perplexity 的名称;我们与两者均无关联。

常见问题

Perplexity Decider 能直接替换 Jev 吗?
请求格式上可以。经 OpenRouter 的 System One 接口或 JevStation 调用时,Decider 接受同样的 state 和同样的 Choice、Score、Noul 问题,返回同样结构的答案。如果你的调用一次带多个问题,换之前先算成本:Decider 每个问题都按一次 state 计费。
Perplexity Decider 开源吗?
权重以 Apache 2.0 发布在 Hugging Face 上,Perplexity 称它基于 Qwen3.8-27B 微调。Jev 没有开放权重。数据不能离开你自己的机器时,Decider 可以自托管,Jev 不行。
Jev 和 Decider 哪个更准?
我们的测试里很接近。96 条 Banking77 银行卡意图消息上两者都是 86.5%;100 篇 AG News 上 Decider 93%、Jev 91%,在这个样本量下属于噪声范围。Decider 的校准略好:置信度 0.99 及以上时它只错了 1 次,Jev 错了 4 次。
为什么长文本多问题时 Decider 更贵?
它的输入 token 随问题数增长。8,000 字符的 state,我们测到 1 个问题 1,392 token、3 个问题 4,192、5 个问题 6,985,差不多每个问题完整读一遍 state。Jev 只读一遍,加问题时 token 几乎不变。
Decider 在 JevStation 上多少钱?
因为按问题重复计费,标准评估 2 积分、大档 6 积分;Jev 是 1 和 3。Decider 在免注册试用里开放,不用注册就能在本页对比两者。

相关页面

把它接进你的流程

注册即送 200 点,保存自己的问题集,并通过 API 调用同样的评估。