ホーム /ベンチマーク・評価・較正 /jev-eval by 4esv
jev-eval by 4esv
ラベル付きの 3 つのタスクで Jev と GPT-5.6 Terra を比較し、易しいタスクでは互角、77 分類のルーティングでは 6.7 ポイント低く、5 倍速く、41 倍から 50 倍安いという結果です。
このページは英語版リストから生成しています。
readme より
jev-eval Benchmark TypeSafe Jev against any OpenRouter model on labelled classification data: accuracy, calibration, latency, cost, determinism. Runs on your own data or the three public tasks included; the results below are those three against GPT-5.6 Terra. Results 300 items per task, run 2026-09-17 with jev-1.13.0 and openai/gpt-5.6-terra via OpenRouter. …
詳細
- セクション
- ベンチマーク・評価・較正
- owner
- 4esv
- スター
- 1
- フォーク
- 0
- 最終更新
- 2026-09-19
- 言語
- Python
これは何か
- 形態
- データセットやベンチマーク
- ホストエージェント
- 単体で動作
- 対象
- 研究者
成熟度
ドキュメント
実測値を報告しています