ホーム /ベンチマーク・評価・較正 /jev-eval by 4esv

jev-eval by 4esv

ラベル付きの 3 つのタスクで Jev と GPT-5.6 Terra を比較し、易しいタスクでは互角、77 分類のルーティングでは 6.7 ポイント低く、5 倍速く、41 倍から 50 倍安いという結果です。

このページは英語版リストから生成しています。

readme より

jev-eval Benchmark TypeSafe Jev against any OpenRouter model on labelled classification data: accuracy, calibration, latency, cost, determinism. Runs on your own data or the three public tasks included; the results below are those three against GPT-5.6 Terra. Results 300 items per task, run 2026-09-17 with jev-1.13.0 and openai/gpt-5.6-terra via OpenRouter. …

詳細

セクション
ベンチマーク・評価・較正
owner
4esv
スター
1
フォーク
0
最終更新
2026-09-19
言語
Python

これは何か

形態
データセットやベンチマーク
ホストエージェント
単体で動作
対象
研究者
成熟度
ドキュメント
実測値を報告しています

こんなときに役立ちます

近い用途