首页 / 基准、评测与校准

基准、评测与校准

22 条

本页由英文清单自动生成。

适合用来: 基准与评测

20

jev-benchmarks

面向带类型决策模型的概率感知评估:校准、选择性风险、延迟,可复现。

★ 12Python数据集或基准
基准与评测输出校验

jevcal

别再猜阈值了:对照一个 LLM 教师做校准、定阈值和漂移检查。

★ 8Python命令行工具
基准与评测输出校验

jev-rerank-bench

在 14 个数据集上把 Jev 与 Cohere Rerank、ZeroEntropy 和一个聊天基线作对比,附原始响应。

★ 2Python数据集或基准
基准与评测输出校验

jev-search-rerank-eval

Jev 重排能胜过向量检索吗?9,831 对评分样本,并测量了评判循环性带来的偏差。

★ 4Python数据集或基准
基准与评测搜索重排

jev-sec-bench

针对提示注入和漏洞代码检测的盲测基准。

★ 2Go数据集或基准
基准与评测输出校验

jev-phishing-bench

在 2,000 封钓鱼邮件上把 Jev 与 Claude Haiku 作对比:准确率、校准、延迟、成本。

★ 2Python数据集或基准
基准与评测输出校验

jev-spam-eval

用 Noul 问题做零样本垃圾邮件过滤,对照 TF-IDF 基线。

★ 0Jupyter Notebook数据集或基准
基准与评测试玩与演示

jev-agent-failure-benchmark

在 Who and When 智能体失败归因基准上把 Jev 与一个强力 LLM 作对比。

★ 1Python数据集或基准
基准与评测输出校验

jev-korean-benchmark

韩语理解与医学文本,附运行时间与成本证据。

★ 5Python数据集或基准
基准与评测输出校验

jev-report

独立的中文研究报告:52 页,50 项可复现测试,143 行可追溯数据。

★ 0Python数据集或基准
基准与评测输出校验

jev-benchmark

两项基准测试,国际象棋和猛兽辨识,一项在 Jev 的能力区内、一项在区外,都附结果。

★ 2Python数据集或基准
基准与评测试玩与演示

jev-dspy-lab

针对 DSPy 中 Jev 决策的可复现校准与选择性风险基准测试。

★ 0Python数据集或基准
基准与评测输出校验

jev-eval-agent

带 100 个模拟工具的个人助理智能体,测量受 Jev 门禁的智能体需要多少步。

★ 95HTML数据集或基准
基准与评测工具调用把关

jev-synergy-screening

用 Choice 和 Noul 问题做摘要筛查,对照 ASReview SYNERGY 的金标准标注计分。

★ 1Python数据集或基准
基准与评测输出校验

jev-orderby-bench

衡量按 Jev 概率做 ORDER BY 是否站得住脚:成对逆序、Score 与人工评级的序数一致性、校准,以及预注册门禁下的措辞不变性;在 20 Newsgroups 主题上通过,在 Amazon ESCI 商品相关性上六项条件中有四项不通过,并表明通过 DuckDB 扩展做 40 行批量状态会不通过排序门禁,而每请求一行则通过。

★ 0Python数据集或基准
基准与评测输出校验

cultivar

Pinecone 的技能测试 CLI,带 Jev 评分后端,据报比 LLM 评分器便宜约 30 倍。

★ 40Python命令行工具
基准与评测输出校验

jev-eval by 4esv

在三项带标注的任务上把 Jev 与 GPT-5.6 Terra 作对比:简单任务打平,77 路路由低 6.7 分,速度快 5 倍,成本低 41 到 50 倍。

★ 1Python数据集或基准
基准与评测输出校验

jev-benchmark by themsquared

工具调用风险分类,附多次运行的方差;每一个错误答案都伴随着含糊的置信度。

★ 0Python数据集或基准
基准与评测输出校验

jev-research-eval

基于钉住的 jev-ultrafast 提交的可复现载体,含基线套件和压力套件。

★ 2HTML数据集或基准
基准与评测输出校验

jev-playground by hegargarcia

在状态明确、合法动作明确、结果可衡量的游戏中把 Jev 与其他模型作对比。

★ 0TypeScript数据集或基准
基准与评测输出校验

适合用来: 输出校验

1

jev-harness

置信度门禁、影子模式、配方和评估;在同一个行过滤任务上报告 Claude CLI 用时 48.9 秒,Jev 用时 1.3 秒。

★ 5TypeScript库或 SDK
输出校验基准与评测

适合用来: 试玩与演示

1

jev-behavior-study

在 jev-1.13.0 上做的受控提示词实验,含原始结果和离线验证。

★ 3Python数据集或基准
试玩与演示基准与评测