Jev は、あなたのデータについての型付きの質問に答えます。 それを実行する場所が JevStation です。
Jev は TypeSafe の System One モデルです。state を送り、Choice・Score・Noul の質問を投げると、確率分布と信頼度付きの構造化された回答が返ってきます。JevStation はこの仕組みをワークスペースとして提供し、スレッドの保存、再利用できるコンテキスト、クレジット課金を備えています。
- 質問タイプ:Choice、Score、Noul
- 3質問タイプ:Choice、Score、Noul
- 1 回の評価あたりの型付き質問数
- 121 回の評価あたりの型付き質問数
- 1 回の評価あたり:標準は 1 クレジット、8,000 文字または 5 問を超える場合は 3 クレジット
- 1〜3 クレジット1 回の評価あたり:標準は 1 クレジット、8,000 文字または 5 問を超える場合は 3 クレジット
3 月の Webhook 変更以降、請求の同期が 3 回失敗しており、2 社の顧客がエスカレーションしています。
回答
- 感情
- ネガティブ91%
- 緊急?
- はい87%
- 複雑さ
- 3.6/4 · 複雑78%
3 問 · 1 往復
デフォルトで非公開。スレッドが学習に使われることはありません。
機能
Jev の周辺はすべておまかせ
Jev は判定を返し、JevStation は評価を実務で使えるものにするための周辺すべてを担います。標準の実行は 1 クレジット(state は 8,000 文字まで、質問は 5 問まで)、それより大きい実行は 3 クレジットです。失敗した実行は 0 クレジットです。
クレジット課金
標準の評価は 1 クレジット(state は 8,000 文字まで、質問は 5 問まで)。それより大きい実行は 3 クレジットです。クレジットは回答が返った時点で差し引かれ、プロバイダー側のエラー時は自動的に返還されます。
残高を確認使い方
state を入れて、構造化された回答を受け取る
実際に行う順に 3 ステップです。判定したいものを貼り付け、最大 12 問の型付き質問を書き、回答を読みます。各質問は確率分布付きの型付きの値として返るため、コードがどの分岐に進むかはレスポンスを解析するまでもなく決まります。
- 01
state を貼り付ける
プレイグラウンドを開き、Jev に判定させたいもの(サポートチケット、レビュー、仕様書、JSON レコードなど)を貼り付けます。
- 02
型付きの質問を書く
Choice・Score・Noul の質問を 1 回の評価につき最大 12 問まで追加し、それぞれに選択肢を定義する基準を付けます。
- 03
回答を読む
Jev は型付きの値、その確率分布、信頼度スコアを返します。スレッドを保存することも、質問セットをプレイブックとして公開することもできます。
位置づけ
JevStation とテキスト生成 LLM
言語モデルは文章を書き、それを解析する必要があります。Jev は判定そのものを、コードが想定している形で返します。
概要
JevStation
System One モデル上の JevStation ワークスペース
テキスト生成 LLM
次のトークンを予測するモデル
出力の形式
JevStation
型付きの値と、その背後にある確率分布
テキスト生成 LLM
JSON に無理やり変換して解析し直す文章
信頼度
JevStation
すべての Choice・Score の回答に校正済みの信頼度
テキスト生成 LLM
プロンプトで求めない限りなし
コスト管理
JevStation
標準の評価は 1 クレジット、大きい評価は 3 クレジット。失敗時は自動返還
テキスト生成 LLM
トークン数、リトライ、不正な出力を自分で数える
ユースケース
Jev への質問例
Jev はあえて用途を絞っています。判定はしますが、文章は書きません。1 回の実行で最大 12 問の型付き質問を受け取り、それぞれについて型付きの値、完全な確率分布、信頼度スコアを返します。以下は共有カタログで特によく見られるパターンです。
サポートチケットの振り分け
複数のチケットを state として貼り付け、緊急度を Noul の質問で、複雑さを Score の質問で尋ねます。
レビューのモデレーション
レビューがポジティブ・ニュートラル・ネガティブのどれかを Choice で尋ね、キーワードリストではなく回答の確率に基づいて振り分けます。
ルーブリック採点
長い文書を state にして各セクションを同じルーブリックで採点すれば、結果を比較可能に保てます。
チームのプレイブック
うまくいった質問セットを公開すれば、次の人は白紙のプロンプトではなく、あなたの基準から始められます。
Jev を学ぶ
まずは System One モデルの仕組みから。
Jev とは何か、評価に実際いくらかかるか、チームがエージェントループの中でどう使っているかを、出典付きで簡潔に解説します。
System One モデルとは何か、そして何ではないのか
System One モデルは生成テキストではなく、型付きの判断とキャリブレーションされた確率を返します。その意味、RLCD と RLHF の違い、そして独立した検証がまだ乏しい点を解説します。
ガイドを読むJev のユースケース:System One モデルが下せる 12 の判断
Jev に何ができるのか。チケットのトリアージからツール呼び出しのガードまで、エージェントやパイプラインで Jev が下す 12 の判断を、質問セットと無料のツールページ付きで紹介します。
ガイドを読むJev as a Judge: What One Yes/No Question Catches
Can a text-free model judge LLM output? One Jev question ranks backdoored code at AUROC 0.976 for ~$0.04 per 1,000 checks. Where it holds, where it breaks.
ガイドを読むWhat One Jev Evaluation Costs, Measured
We made 11 real Jev calls across every state size and question count, fitted the token model and measured the cost: $0.000012 to $0.000377 per evaluation.
ガイドを読む最初の Jev 評価を実行しましょう。
アカウントを作成すると 200 クレジットを無料進呈。標準評価 200 回分です。カードもプロバイダーの API Key も設定も不要。プレイグラウンドを開いて、ブラウザで最初の評価を実行できます。