ホーム / ベンチマーク・評価・較正
ベンチマーク・評価・較正
22 件
このページは英語版リストから生成しています。
こんなときに役立ちます: ベンチマークと評価
20jev-rerank-bench
14 のデータセットで Jev を Cohere Rerank、ZeroEntropy、チャットのベースラインと比較し、生のレスポンスも同梱しています。
jev-search-rerank-eval
Jev のリランクは埋め込み検索に勝てるのでしょうか。9,831 組の採点済みペアで、判定の循環によるバイアスも測定しています。
jev-eval-agent
100 個のモックツールを持つパーソナルアシスタントのエージェントで、Jev でゲートしたエージェントが何ステップを要するかを測定します。
jev-synergy-screening
Choice と Noul の質問を、抄録スクリーニングにおける ASReview SYNERGY の正解ラベルに照らして採点します。
jev-orderby-bench
Jev の確率に対する ORDER BY が妥当かを測定し、事前登録されたゲートのもとでペアごとの逆転、人間の評点に対する Score の順序性、較正、言い回しの不変性を検査し、20 Newsgroups のトピックでは合格、Amazon ESCI の商品関連度では 6 条件中 4 つで不合格となり、DuckDB 拡張を通した 40 行のバッチ状態では、1 リクエスト 1 行なら通るランキングのゲートに落ちることを示しています。
jev-eval by 4esv
ラベル付きの 3 つのタスクで Jev と GPT-5.6 Terra を比較し、易しいタスクでは互角、77 分類のルーティングでは 6.7 ポイント低く、5 倍速く、41 倍から 50 倍安いという結果です。
jev-benchmark by themsquared
ツール呼び出しのリスク分類を実行ごとの分散付きで報告し、誤答はいずれも confidence が低めに出ていました。
こんなときに役立ちます: 出力の検証
1jev-harness
confidence のゲート、シャドーモード、レシピ、評価を備え、同じ行フィルタの処理で Claude CLI の 48.9 秒に対し Jev は 1.3 秒と報告しています。
