AI 意思決定モデル比較:OpenAI・Perplexity・TypeSafe・Cloudflare を並べて実測
意思決定モデルはテキストや画像を読み、事前に定義した質問に確率で答えます。文章は書きません。9 月末から呼び出せるのは 5 つ:TypeSafe の Jev、Cloudflare の Clef と Clef-flash、Perplexity の Decider、OpenAI の GPT-6 Luna Decisions です。2026-10-07 に同じ 196 件のラベル付き入力で 5 つすべてを実行しました。細かい意図分類では Clef-flash が最も正確で、1 問だけの呼び出しでは Perplexity Decider が最安。すべてで勝ったモデルはありません。下のフォームで 4 つを登録なしで試せます。
4つの意思決定モデルを無料で試す
OpenAI Luna Decisions、Perplexity Decider、Jev、Clef-flash から選び、例文を編集して実行できます。登録不要、1日 3 回まで無料です。
シナリオ
チケットを適切なチームに振り分け、緊急度を評価し、解約リスクを検知します。
自由に編集できます。ここに入力した内容について、選んだモデルがシナリオの質問に回答します。
任意の2モデルを並べて実行
同じ入力と同じ質問を、Jev・Clef・Clef-flash・Perplexity Decider・OpenAI Luna Decisions のうち2つに同時に送ります。答えが一致する箇所と、それぞれのコストがわかります。
シナリオ
利用量ごとのモデル別コスト
トークン数は 2026-10-07 に私たちが実際に呼び出して測った値で、ベンダーの数字ではありません。Perplexity Decider は質問ごとに state を読み直すため、質問数に比例してコストが増えます。
JevTypeSafe · $0.042 / 100万入力
- 直接利用・月額
- $2.66最安
- JevStation・月額
- $137.10
- 1回の入力トークン
- 634
- 1回のクレジット
- 1
Clef-flashCloudflare · $0.09 / 100万入力
- 直接利用・月額
- $5.53
- JevStation・月額
- $137.10
- 1回の入力トークン
- 614
- 1回のクレジット
- 1
ClefCloudflare · $0.24 / 100万入力
- 直接利用・月額
- $14.74
- JevStation・月額
- $270.30
- 1回の入力トークン
- 614
- 1回のクレジット
- 2
DeciderPerplexity · $0.04 / 100万入力
- 直接利用・月額
- $3.94
- JevStation・月額
- $270.30
- 1回の入力トークン
- 986
- 1回のクレジット
- 2
Luna DecisionsOpenAI · $0.10 / 100万入力
- 直接利用・月額
- $6.84
- JevStation・月額
- $137.10
- 1回の入力トークン
- 684
- 1回のクレジット
- 1
実測した呼び出しに当てはめたトークンモデルによる推定です。5モデルとも出力トークンは無料。直接利用の価格にゲートウェイ手数料は含みません。JevStation の列は、登録時の 200 クレジットを差し引いた後の買い切りクレジットパックの最安組み合わせです。
5 モデルの概要
数値には出典を付けています。(ベンダー) はモデルを販売する会社の数値、(実測) は 2026-10-07 に私たちが呼び出して測った値です。
| Jev | Clef-flash | Clef | Perplexity Decider | OpenAI Luna Decisions | |
|---|---|---|---|---|---|
| 提供元 | TypeSafe | Cloudflare | Cloudflare | Perplexity | OpenAI |
| 公開 | 5 つの中で最初 | 2026-10-01 | 2026-10-01 | 2026-10-02 | 2026-09-29 プレビュー |
| 重み | 非公開 | 公開、Apache 2.0 | 公開、Apache 2.0 | 公開、Apache 2.0 | 非公開 |
| ベースモデル | 非公開 | Qwen3.5-9B | Qwen3.8-27B | Qwen3.8-27B (ベンダー) | GPT-6 Luna |
| 入力の定価 | $0.042 / 100万 | $0.09 / 100万 | $0.24 / 100万 | $0.04 / 100万 | $0.10 / 100万(OpenRouter) |
| 出力トークン | 無料 | 無料 | 無料 | 無料 | 無料 |
| コンテキスト | 約 32k 共有 (ベンダー) | 65k (ベンダー) | 65k (ベンダー) | 262k (ベンダー) | 1.05M (ベンダー) |
| 画像 | 非対応 | 対応 | 対応 | 対応 | 対応 |
| state の課金 | 1 回 | 1 回 | 1 回 | 質問ごとに 1 回 (実測) | 1 回 |
| レイテンシ中央値 | 412 ms (実測) | 594 ms (実測) | 649 ms (実測) | 493 ms (実測) | 486 ms (実測) |
| 直接利用 | 順番待ち | セルフサービス | セルフサービス | セルフサービス | 限定プレビュー;OpenRouter |
| JevStation クレジット | 1 / 3 | 1 / 3 | 2 / 6 | 2 / 6 | 1 / 3 |
| 登録不要のお試し | あり | あり | なし | あり | あり |
クレジットは標準 / 大:state が 8,000 文字か質問が 5 つを超えると大になります。レイテンシは 1 台のマシンから OpenRouter までの往復時間なので、表の中でのみ比較してください。
測定内容
同じ入力、同じ質問、同じエンドポイント(OpenRouter の /api/v1/systemone)で 5 モデルを 2 回ずつ実行し、結果は一致しました。質問はすべてゼロショットで、選択肢ごとに 1 行の説明だけを付けています。
- Banking77 カード意図:Banking77 テストセットから紛らわしい 12 意図、計 96 件。12 択の Choice 質問 1 つ。
- AG News:AG News テストセットから 4 カテゴリ各 25 件、計 100 件。4 択の Choice 質問 1 つ。
- 長い state:20,000 文字の中立的なテキストの先頭・6,000 文字目・12,000 文字目・末尾に「サブスクリプションを解約したい」という 1 文を置き、文がない対照も用意。Noul 質問 1 つ。
| モデル | Banking77 カード(96) | AG News(100) | 信頼度 ≥ 0.9 の割合とその正解率(Banking77) | 信頼度 ≥ 0.99 での誤答(196 件中) |
|---|---|---|---|---|
| Jev | 86.5% | 91% | 81%、うち 94.9% 正解 | 4 |
| Clef-flash | 97.9% | 92% | 73%、うち 100% 正解 | 0 |
| Clef | 94.8% | 93% | 60%、うち 100% 正解 | 0 |
| Perplexity Decider | 86.5% | 93% | 77%、うち 98.6% 正解 | 1 |
| OpenAI Luna Decisions | 90.5% | 89% | 69%、うち 98.5% 正解 | 6 |
ポイント:
- 最小の Clef-flash が細かい意図分類で最も正確でした。 Cloudflare 自身の Banking77 の結果と一致します。
- Clef 系が最も慎重です。 0.99 を超える信頼度はまれで、その場合に間違えたことはありませんでした。Luna Decisions と Jev はよく信頼度 1.00 を返し、誤りもそこに集中しました。しきい値はモデルごとに自分のラベル付きデータで決めてください。
- OpenAI は 1 件を拒否しました。 ごく普通の質問 "How do I freeze my account?" が 2 回とも「OpenAI refused to answer」というエラーになりました。拒否は失敗の一種として扱ってください。JevStation ではクレジットが返金されます。
- 5 つとも 20,000 文字の state を最後まで読みました。 2026-10-04 に Cloudflare Workers AI で測った Clef は先頭約 2,048 トークンしか読みませんでしたが、2026-10-07 には OpenRouter 経由でも Workers AI を直接再測定しても全文を読みました。この切り捨てはなくなっています。
各タスク約 100 件のため、約 6 ポイント以内の差はノイズの可能性があります。小さなサンプルであり、ランキングではありません。
コストの落とし穴:Perplexity Decider は質問ごとに state を課金
Decider は定価が最も低く、1 問だけなら最安でした(AG News 1,000 回で $0.007)。しかし質問ごとに state 全体を読み直すため、トークン数は質問数に比例します。8,000 文字のテキストで 1 問 1,392、3 問 4,192、5 問 6,985 トークン。同じテキストで 5 問の Luna Decisions は約 2,000 でした。JevStation が Decider を 2 クレジットにしているのはこのためです。
選び方
- 似たラベルが多い固定の意図リスト:まず Clef-flash。
- 大量の 1 問だけの呼び出し:Perplexity Decider。
- 長文に複数の質問:state を 1 回だけ読む Jev か Luna Decisions。
- プレビュー枠を待たずに OpenAI のモデルを使いたい:OpenRouter か本サイトで Luna Decisions。ときどき拒否がある前提で。
- データを外に出せない:Apache 2.0 で重みが公開されている Clef、Clef-flash、Decider。
最終的には自分のデータで確かめてください。実際の入力を 20 件、上の並列実行に貼り付けて 2 つのモデルを同時に走らせ、正解と照らし合わせるのが一番確実です。
出典
- OpenAI Decisions API のプレビュー(DevDay 2026-09-29)。Hugging Face、r/OpenAI (第三者)
- Perplexity Decider のモデル・価格・コンテキスト。OpenRouter のモデルページ、Perplexity Decisions API ドキュメント (ベンダー)
- System One エンドポイント。OpenRouter TypeSafe SDK ガイド (ベンダー)
- データセット。Banking77、AG News のテスト分割
- 精度、キャリブレーション、レイテンシ、トークン数、長い state のテスト。2026-10-07 の実測 (実測)
JevStation は独立したサイトです。Jev・Clef・Decider・GPT-6 Luna はそれぞれ TypeSafe・Cloudflare・Perplexity・OpenAI の名称で、いずれとも提携していません。
よくある質問
- 意思決定モデルとは何ですか?
- テキストではなく型付きの答えを返すモデルです。指定した選択肢から 1 つを選ぶ、定義した段階で評価する、ある記述が正しい確率を返す、のいずれかです。内容を state として、質問をスキーマとして送ると、コードでしきい値を設定できる確率が返ります。TypeSafe はこの分類を System One、OpenAI は自社版を Decisions API と呼んでいます。
- 最も正確な意思決定モデルはどれですか?
- タスクによります。2026-10-07 の測定では、紛らわしい Banking77 のカード関連 12 意図で Clef-flash が 97.9%、続いて Clef(94.8%)、OpenAI Luna Decisions(90.5%)、Jev と Perplexity Decider(各 86.5%)でした。AG News の 4 分類では 5 つとも 89〜93% に収まりました。各タスク約 100 件なので、6 ポイント程度までの差はノイズの範囲です。
- 順番待ちなしで OpenAI Decisions API を使えますか?
- 確認した時点で OpenAI 自身の Decisions API は限定プレビューでした。OpenRouter は 2026-10-06 から同じモデルを openai/gpt-6-luna-decisions として提供しており、JevStation は OpenRouter 経由で実行します。登録不要のお試しでは無料、アカウントでは標準評価 1 回 1 クレジットです。
- 最も安い意思決定モデルはどれですか?
- トークン単価では Perplexity Decider(100 万入力トークンあたり $0.04)、次が Jev($0.042)です。ただし Decider は質問ごとに state を読み直すため、8,000 文字のテキストに 5 問では 6,985 トークンかかり、同じリクエストで Luna Decisions は約 2,000 でした。1 問なら Decider が最安ですが、長文で質問が多いとそうではありません。
- リクエスト形式は互換ですか?
- はい。OpenRouter の System One エンドポイントか JevStation 経由なら、5 つとも同じ state と Choice・Score・Noul の質問を受け付け、同じ形の答えを返します。モデルの切り替えは model フィールドを 1 つ変えるだけです。
関連
- Decisions API alternativesOpenAI Decisions API without the waitlist, plus Jev, Clef and Perplexity Decider: measured accuracy, cost, and how to port a request.
- Jev vs DeciderPerplexity Decider against Jev: same contract, measured accuracy, calibration, latency, and per-question billing.
- Model pricingMonthly cost of five decision models for your volume, text length and question count, from measured token counts.
パイプラインに組み込む
新規登録で 200 クレジットを無料進呈。独自の質問セットを保存し、同じ評価を API から呼び出せます。