AI 决策模型对比:OpenAI、Perplexity、TypeSafe、Cloudflare 并排实测
决策模型读一段文本或一张图,按你事先定义的问题给出概率,不写一句话。9 月底以来能调用的有五个:TypeSafe 的 Jev、Cloudflare 的 Clef 与 Clef-flash、Perplexity 的 Decider、OpenAI 的 GPT-6 Luna Decisions。我们在 2026-10-07 用同样 196 条带标签输入把五个都跑了一遍:细粒度意图上 Clef-flash 最准,单问题调用 Perplexity Decider 最便宜,没有哪个模型全面胜出。下面可以免注册试用其中四个。
免费试用四个决策模型
可选 OpenAI Luna Decisions、Perplexity Decider、Jev 或 Clef-flash,改一下示例就能运行。无需注册,每天 3 次免费。
场景
把工单分给对应团队,评估紧急程度,并标记流失风险。
可以随意修改,所选模型会针对这里的内容回答该场景的问题。
任选两个并排运行
同一段输入、同一组问题,同时交给两个模型:Jev、Clef、Clef-flash、Perplexity Decider 和 OpenAI Luna Decisions。可以看到答案在哪里一致,以及各自花了多少。
场景
按你的用量,每个模型要花多少
token 数来自我们 2026-10-07 的实测调用,不是厂商数字。Perplexity Decider 每个问题都会重新读一遍 state,所以问题越多成本涨得越快。
JevTypeSafe · $0.042 / 百万输入
- 直连,每月
- $2.66最便宜
- 在 JevStation,每月
- $137.10
- 每次输入 token
- 634
- 每次积分
- 1
Clef-flashCloudflare · $0.09 / 百万输入
- 直连,每月
- $5.53
- 在 JevStation,每月
- $137.10
- 每次输入 token
- 614
- 每次积分
- 1
ClefCloudflare · $0.24 / 百万输入
- 直连,每月
- $14.74
- 在 JevStation,每月
- $270.30
- 每次输入 token
- 614
- 每次积分
- 2
DeciderPerplexity · $0.04 / 百万输入
- 直连,每月
- $3.94
- 在 JevStation,每月
- $270.30
- 每次输入 token
- 986
- 每次积分
- 2
Luna DecisionsOpenAI · $0.10 / 百万输入
- 直连,每月
- $6.84
- 在 JevStation,每月
- $137.10
- 每次输入 token
- 684
- 每次积分
- 1
按实测调用拟合的 token 模型估算。五个模型的输出 token 都免费。直连价格不含网关手续费;JevStation 一列是扣除注册赠送的 200 积分后,一次性积分包的最便宜组合。
五个模型一览
每个数字都标了来源:(厂商) 是卖模型的公司给的,(实测) 是我们 2026-10-07 自己调用测的。
| Jev | Clef-flash | Clef | Perplexity Decider | OpenAI Luna Decisions | |
|---|---|---|---|---|---|
| 厂商 | TypeSafe | Cloudflare | Cloudflare | Perplexity | OpenAI |
| 发布 | 五个里最早 | 2026-10-01 | 2026-10-01 | 2026-10-02 | 2026-09-29 预览 |
| 权重 | 闭源 | 开放,Apache 2.0 | 开放,Apache 2.0 | 开放,Apache 2.0 | 闭源 |
| 基座模型 | 未公开 | Qwen3.5-9B | Qwen3.8-27B | Qwen3.8-27B (厂商) | GPT-6 Luna |
| 输入标价 | $0.042 / 百万 | $0.09 / 百万 | $0.24 / 百万 | $0.04 / 百万 | $0.10 / 百万(OpenRouter) |
| 输出 token | 免费 | 免费 | 免费 | 免费 | 免费 |
| 上下文 | 约 32k 共享 (厂商) | 65k (厂商) | 65k (厂商) | 262k (厂商) | 1.05M (厂商) |
| 图片 | 不支持 | 支持 | 支持 | 支持 | 支持 |
| state 怎么计费 | 读一次 | 读一次 | 读一次 | 每个问题读一次 (实测) | 读一次 |
| 延迟中位数 | 412 ms (实测) | 594 ms (实测) | 649 ms (实测) | 493 ms (实测) | 486 ms (实测) |
| 直连方式 | 排队 | 自助开通 | 自助开通 | 自助开通 | 有限预览;OpenRouter |
| JevStation 积分 | 1 / 3 | 1 / 3 | 2 / 6 | 2 / 6 | 1 / 3 |
| 本站免注册试用 | 有 | 有 | 无 | 有 | 有 |
积分为标准 / 大档:state 超过 8,000 字符或问题超过 5 个即为大档。延迟是从同一台机器到 OpenRouter 的往返时间,只能在表内互相比较,不能和厂商数字比。
决策模型不止这五个。我们测试当天,OpenRouter 上输出类型为 "decisions" 的模型有 14 个,还包括 Liquid d1、Upstage Solar Decide、Inception Mercury Decide 和 Together 的实验模型 Tev1。这里只覆盖背后投入最大的五个。
我们测了什么
同样的输入、同样的问题、同一个接口(OpenRouter 的 /api/v1/systemone),五个模型,两轮完整运行结果一致。所有问题都是零样本:每个选项一行说明,没有任何调优。
- Banking77 银行卡意图:Banking77 测试集里 12 个容易混淆的意图,共 96 条消息——卡还没到 vs 问配送时间、卡丢了 vs 卡信息泄露、付款被拒 vs 不认识的扣款。一个 12 选项的 Choice 问题。
- AG News:AG News 测试集 100 篇新闻,每个类别 25 篇。一个 4 选项的 Choice 问题。
- 长 state:把一句"取消订阅"藏在 20,000 字符中性文本的开头、第 6,000 字符、第 12,000 字符或最末尾,外加一个没有这句话的对照组。一个 Noul 问题。
| 模型 | Banking77 银行卡(96) | AG News(100) | 置信度 ≥ 0.9 的覆盖率与其中准确率(Banking77) | 置信度 ≥ 0.99 却答错(共 196) |
|---|---|---|---|---|
| Jev | 86.5% | 91% | 81%,其中 94.9% 正确 | 4 |
| Clef-flash | 97.9% | 92% | 73%,其中 100% 正确 | 0 |
| Clef | 94.8% | 93% | 60%,其中 100% 正确 | 0 |
| Perplexity Decider | 86.5% | 93% | 77%,其中 98.6% 正确 | 1 |
| OpenAI Luna Decisions | 90.5% | 89% | 69%,其中 98.5% 正确 | 6 |
值得注意的几点:
- 最小的 Clef-flash 在细粒度意图上最准。 这与 Cloudflare 自己公布的 Banking77 结果一致——在此之前还没有 Cloudflare 以外的人验证过。
- Clef 系列最谨慎。 它们很少给出 0.99 以上的置信度,给出时从没错过。Luna Decisions 和 Jev 经常给出 1.00 的置信度,错误也集中在这里:Luna 有 6 个、Jev 有 4 个错误发生在 0.99 及以上。打算超过阈值就自动执行的话,阈值要按模型分别用你自己的标注数据来定。
- OpenAI 拒答了一条输入。 一句普通的银行问题 "How do I freeze my account?"(怎么冻结我的账户?)两轮都返回错误 "OpenAI refused to answer"。要把拒答当成一种失败来处理;在 JevStation 上这次调用的积分会退回。
- 五个模型都读完了 20,000 字符的 state。 即使取消请求放在最末尾,五个模型也都找到了。2026-10-04 我们在 Cloudflare Workers AI 上测到 Clef 只读 state 的前约 2,048 token;2026-10-07 无论经 OpenRouter 还是直接复测 Workers AI,它都读完了全部,这个截断已经没有了。
每个任务约 100 条样本,6 个百分点左右以内的差距可能是噪声,只有 Clef-flash 在 Banking77 上的领先明显超出这个范围。这是一份小样本测试,不是排行榜。
成本陷阱:Perplexity Decider 每个问题都按一次 state 计费
Decider 标价最低,单问题时也是我们测过最便宜的:每千次 AG News 调用 $0.007。但它的 token 数会随问题数增长,因为每个问题都会把整段 state 重新读一遍。8,000 字符的文本,1 个问题 1,392 个输入 token,3 个问题 4,192,5 个问题 6,985。作为对比,同样的文本 5 个问题,Luna Decisions 只用了约 2,000。
所以哪个模型最便宜,取决于请求的形状。用上面的计算器代入你自己的数字。JevStation 也因此对 Decider 收 2 积分,其他只读一遍 state 的模型收 1 积分。
怎么选
- 固定意图列表、标签彼此相近:先试 Clef-flash。它在 Banking77 上领先,本站每次 1 积分。
- 高频的单问题调用:Perplexity Decider,这种形状下每次最便宜。
- 对长文本问多个问题:Jev 或 Luna Decisions,它们只读一遍 state。
- 想用 OpenAI 的模型又不想等预览名额:经 OpenRouter 或本站用 Luna Decisions,但要预期偶尔拒答。
- 数据不能离开你的机器:Clef、Clef-flash 或 Decider,都是 Apache 2.0 开放权重。
- 需要能放心设阈值的置信度:在你自己的数据上测校准;我们这次测试里 Clef 系列最保守。
最终还是要看你自己的数据。把二十条真实输入粘进上面的并排运行器,同时跑两个模型,再和你知道的正确答案对一对。
更多对比
- Jev vs Perplexity Decider:两个最便宜的模型正面对比。
- OpenAI Decisions API 替代方案:预览名额没开放时用什么,以及怎么迁移请求。
- Jev vs Clef:Cloudflare 的模型,包括发布时我们测到的 Workers AI 截断,以及发现它已消失的复测(英文)。
- 决策模型价格计算器:五个模型按你的用量算月成本。
来源
- OpenAI Decisions API 预览,DevDay 2026-09-29。Hugging Face 与 r/OpenAI 的报道 (第三方)
- Perplexity Decider 模型、价格与上下文。OpenRouter 模型页 与 Perplexity Decisions API 文档 (厂商)
- System One 接口与请求格式。OpenRouter TypeSafe SDK 指南 (厂商)
- Clef。Cloudflare 博客 (厂商) 与 Cloudflare Clef 实测 (实测)
- 数据集。Banking77 与 AG News 测试集
- 准确率、校准、延迟、token 数与长 state 测试。我们 2026-10-07 的实测 (实测)
JevStation 是独立站点。Jev、Clef、Decider 与 GPT-6 Luna 分别是 TypeSafe、Cloudflare、Perplexity 与 OpenAI 的名称;我们与它们均无关联。
常见问题
- 什么是决策模型?
- 返回带类型答案而不是文本的模型:从你列出的选项里选一个、按你定义的等级打分,或给出某个判断为真的概率。内容作为 state 发送,问题作为 schema 发送,拿回可以直接设阈值的概率。TypeSafe 把这一类叫 System One,OpenAI 把自己的版本叫 Decisions API。
- 哪个决策模型最准?
- 看任务。我们 2026-10-07 的测试里,12 个容易混淆的 Banking77 银行卡意图上,Clef-flash 97.9%,领先 Clef(94.8%)、OpenAI Luna Decisions(90.5%)、Jev 和 Perplexity Decider(各 86.5%)。AG News 四分类上五个模型都在 89%–93% 之间。每个任务约 100 条样本,6 个百分点以内的差距可能只是噪声。
- 不排队能用上 OpenAI Decisions API 吗?
- 我们查看时,OpenAI 自己的 Decisions API 仍是有限预览。OpenRouter 从 2026-10-06 起以 openai/gpt-6-luna-decisions 提供同一个模型,JevStation 经 OpenRouter 运行它:免注册试用里免费,注册后标准评估每次 1 积分。
- 哪个决策模型最便宜?
- 按 token 单价是 Perplexity Decider(每百万输入 token $0.04),其次是 Jev($0.042)。但 Decider 每个问题都会把 state 重新读一遍:8,000 字符的文本配 5 个问题,我们测到 6,985 token,同样的请求 Luna Decisions 约 2,000。单问题时 Decider 最便宜,长文本多问题时则不是。
- 请求格式兼容吗?
- 兼容。经 OpenRouter 的 System One 接口或 JevStation 调用时,五个模型都接受同样的 state 加 Choice、Score、Noul 问题,返回同样结构的答案。换模型只需改一个 model 字段。
- 决策模型能替代 LLM 吗?
- 不能。它们不会写作、总结或用文字推理。它们替代的是你拿来当分类器、路由器、评判器或护栏的那次 LLM 调用——前提是可能的答案能提前列出来。
相关页面
把它接进你的流程
注册即送 200 点,保存自己的问题集,并通过 API 调用同样的评估。