AI 决策模型对比:OpenAI、Perplexity、TypeSafe、Cloudflare 并排实测

决策模型读一段文本或一张图,按你事先定义的问题给出概率,不写一句话。9 月底以来能调用的有五个:TypeSafe 的 Jev、Cloudflare 的 Clef 与 Clef-flash、Perplexity 的 Decider、OpenAI 的 GPT-6 Luna Decisions。我们在 2026-10-07 用同样 196 条带标签输入把五个都跑了一遍:细粒度意图上 Clef-flash 最准,单问题调用 Perplexity Decider 最便宜,没有哪个模型全面胜出。下面可以免注册试用其中四个。

免费试用四个决策模型

可选 OpenAI Luna Decisions、Perplexity Decider、Jev 或 Clef-flash,改一下示例就能运行。无需注册,每天 3 次免费。

场景

把工单分给对应团队,评估紧急程度,并标记流失风险。

166 / 2,000

可以随意修改,所选模型会针对这里的内容回答该场景的问题。

模型

任选两个并排运行

同一段输入、同一组问题,同时交给两个模型:Jev、Clef、Clef-flash、Perplexity Decider 和 OpenAI Luna Decisions。可以看到答案在哪里一致,以及各自花了多少。

场景

166 / 24,000
本次对比消耗 3 积分。

按你的用量,每个模型要花多少

token 数来自我们 2026-10-07 的实测调用,不是厂商数字。Perplexity Decider 每个问题都会重新读一遍 state,所以问题越多成本涨得越快。

  • JevTypeSafe · $0.042 / 百万输入

    直连,每月
    $2.66最便宜
    在 JevStation,每月
    $137.10
    每次输入 token
    634
    每次积分
    1
  • Clef-flashCloudflare · $0.09 / 百万输入

    直连,每月
    $5.53
    在 JevStation,每月
    $137.10
    每次输入 token
    614
    每次积分
    1
  • ClefCloudflare · $0.24 / 百万输入

    直连,每月
    $14.74
    在 JevStation,每月
    $270.30
    每次输入 token
    614
    每次积分
    2
  • DeciderPerplexity · $0.04 / 百万输入

    直连,每月
    $3.94
    在 JevStation,每月
    $270.30
    每次输入 token
    986
    每次积分
    2
  • Luna DecisionsOpenAI · $0.10 / 百万输入

    直连,每月
    $6.84
    在 JevStation,每月
    $137.10
    每次输入 token
    684
    每次积分
    1

按实测调用拟合的 token 模型估算。五个模型的输出 token 都免费。直连价格不含网关手续费;JevStation 一列是扣除注册赠送的 200 积分后,一次性积分包的最便宜组合。

五个模型一览

每个数字都标了来源:(厂商) 是卖模型的公司给的,(实测) 是我们 2026-10-07 自己调用测的。

JevClef-flashClefPerplexity DeciderOpenAI Luna Decisions
厂商TypeSafeCloudflareCloudflarePerplexityOpenAI
发布五个里最早2026-10-012026-10-012026-10-022026-09-29 预览
权重闭源开放,Apache 2.0开放,Apache 2.0开放,Apache 2.0闭源
基座模型未公开Qwen3.5-9BQwen3.8-27BQwen3.8-27B (厂商)GPT-6 Luna
输入标价$0.042 / 百万$0.09 / 百万$0.24 / 百万$0.04 / 百万$0.10 / 百万(OpenRouter)
输出 token免费免费免费免费免费
上下文约 32k 共享 (厂商)65k (厂商)65k (厂商)262k (厂商)1.05M (厂商)
图片不支持支持支持支持支持
state 怎么计费读一次读一次读一次每个问题读一次 (实测)读一次
延迟中位数412 ms (实测)594 ms (实测)649 ms (实测)493 ms (实测)486 ms (实测)
直连方式排队自助开通自助开通自助开通有限预览;OpenRouter
JevStation 积分1 / 31 / 32 / 62 / 61 / 3
本站免注册试用有有无有有

积分为标准 / 大档:state 超过 8,000 字符或问题超过 5 个即为大档。延迟是从同一台机器到 OpenRouter 的往返时间,只能在表内互相比较,不能和厂商数字比。

决策模型不止这五个。我们测试当天,OpenRouter 上输出类型为 "decisions" 的模型有 14 个,还包括 Liquid d1、Upstage Solar Decide、Inception Mercury Decide 和 Together 的实验模型 Tev1。这里只覆盖背后投入最大的五个。

我们测了什么

同样的输入、同样的问题、同一个接口(OpenRouter 的 /api/v1/systemone),五个模型,两轮完整运行结果一致。所有问题都是零样本:每个选项一行说明,没有任何调优。

  • Banking77 银行卡意图:Banking77 测试集里 12 个容易混淆的意图,共 96 条消息——卡还没到 vs 问配送时间、卡丢了 vs 卡信息泄露、付款被拒 vs 不认识的扣款。一个 12 选项的 Choice 问题。
  • AG News:AG News 测试集 100 篇新闻,每个类别 25 篇。一个 4 选项的 Choice 问题。
  • 长 state:把一句"取消订阅"藏在 20,000 字符中性文本的开头、第 6,000 字符、第 12,000 字符或最末尾,外加一个没有这句话的对照组。一个 Noul 问题。
模型Banking77 银行卡(96)AG News(100)置信度 ≥ 0.9 的覆盖率与其中准确率(Banking77)置信度 ≥ 0.99 却答错(共 196)
Jev86.5%91%81%,其中 94.9% 正确4
Clef-flash97.9%92%73%,其中 100% 正确0
Clef94.8%93%60%,其中 100% 正确0
Perplexity Decider86.5%93%77%,其中 98.6% 正确1
OpenAI Luna Decisions90.5%89%69%,其中 98.5% 正确6

值得注意的几点:

  • 最小的 Clef-flash 在细粒度意图上最准。 这与 Cloudflare 自己公布的 Banking77 结果一致——在此之前还没有 Cloudflare 以外的人验证过。
  • Clef 系列最谨慎。 它们很少给出 0.99 以上的置信度,给出时从没错过。Luna Decisions 和 Jev 经常给出 1.00 的置信度,错误也集中在这里:Luna 有 6 个、Jev 有 4 个错误发生在 0.99 及以上。打算超过阈值就自动执行的话,阈值要按模型分别用你自己的标注数据来定。
  • OpenAI 拒答了一条输入。 一句普通的银行问题 "How do I freeze my account?"(怎么冻结我的账户?)两轮都返回错误 "OpenAI refused to answer"。要把拒答当成一种失败来处理;在 JevStation 上这次调用的积分会退回。
  • 五个模型都读完了 20,000 字符的 state。 即使取消请求放在最末尾,五个模型也都找到了。2026-10-04 我们在 Cloudflare Workers AI 上测到 Clef 只读 state 的前约 2,048 token;2026-10-07 无论经 OpenRouter 还是直接复测 Workers AI,它都读完了全部,这个截断已经没有了。

每个任务约 100 条样本,6 个百分点左右以内的差距可能是噪声,只有 Clef-flash 在 Banking77 上的领先明显超出这个范围。这是一份小样本测试,不是排行榜。

成本陷阱:Perplexity Decider 每个问题都按一次 state 计费

Decider 标价最低,单问题时也是我们测过最便宜的:每千次 AG News 调用 $0.007。但它的 token 数会随问题数增长,因为每个问题都会把整段 state 重新读一遍。8,000 字符的文本,1 个问题 1,392 个输入 token,3 个问题 4,192,5 个问题 6,985。作为对比,同样的文本 5 个问题,Luna Decisions 只用了约 2,000。

所以哪个模型最便宜,取决于请求的形状。用上面的计算器代入你自己的数字。JevStation 也因此对 Decider 收 2 积分,其他只读一遍 state 的模型收 1 积分。

怎么选

  • 固定意图列表、标签彼此相近:先试 Clef-flash。它在 Banking77 上领先,本站每次 1 积分。
  • 高频的单问题调用:Perplexity Decider,这种形状下每次最便宜。
  • 对长文本问多个问题:Jev 或 Luna Decisions,它们只读一遍 state。
  • 想用 OpenAI 的模型又不想等预览名额:经 OpenRouter 或本站用 Luna Decisions,但要预期偶尔拒答。
  • 数据不能离开你的机器:Clef、Clef-flash 或 Decider,都是 Apache 2.0 开放权重。
  • 需要能放心设阈值的置信度:在你自己的数据上测校准;我们这次测试里 Clef 系列最保守。

最终还是要看你自己的数据。把二十条真实输入粘进上面的并排运行器,同时跑两个模型,再和你知道的正确答案对一对。

更多对比

来源

JevStation 是独立站点。Jev、Clef、Decider 与 GPT-6 Luna 分别是 TypeSafe、Cloudflare、Perplexity 与 OpenAI 的名称;我们与它们均无关联。

常见问题

什么是决策模型?
返回带类型答案而不是文本的模型:从你列出的选项里选一个、按你定义的等级打分,或给出某个判断为真的概率。内容作为 state 发送,问题作为 schema 发送,拿回可以直接设阈值的概率。TypeSafe 把这一类叫 System One,OpenAI 把自己的版本叫 Decisions API。
哪个决策模型最准?
看任务。我们 2026-10-07 的测试里,12 个容易混淆的 Banking77 银行卡意图上,Clef-flash 97.9%,领先 Clef(94.8%)、OpenAI Luna Decisions(90.5%)、Jev 和 Perplexity Decider(各 86.5%)。AG News 四分类上五个模型都在 89%–93% 之间。每个任务约 100 条样本,6 个百分点以内的差距可能只是噪声。
不排队能用上 OpenAI Decisions API 吗?
我们查看时,OpenAI 自己的 Decisions API 仍是有限预览。OpenRouter 从 2026-10-06 起以 openai/gpt-6-luna-decisions 提供同一个模型,JevStation 经 OpenRouter 运行它:免注册试用里免费,注册后标准评估每次 1 积分。
哪个决策模型最便宜?
按 token 单价是 Perplexity Decider(每百万输入 token $0.04),其次是 Jev($0.042)。但 Decider 每个问题都会把 state 重新读一遍:8,000 字符的文本配 5 个问题,我们测到 6,985 token,同样的请求 Luna Decisions 约 2,000。单问题时 Decider 最便宜,长文本多问题时则不是。
请求格式兼容吗?
兼容。经 OpenRouter 的 System One 接口或 JevStation 调用时,五个模型都接受同样的 state 加 Choice、Score、Noul 问题,返回同样结构的答案。换模型只需改一个 model 字段。
决策模型能替代 LLM 吗?
不能。它们不会写作、总结或用文字推理。它们替代的是你拿来当分类器、路由器、评判器或护栏的那次 LLM 调用——前提是可能的答案能提前列出来。

相关页面

把它接进你的流程

注册即送 200 点,保存自己的问题集,并通过 API 调用同样的评估。