首页 /基准、评测与校准 /jev-search-rerank-eval
jev-search-rerank-eval
Jev 重排能胜过向量检索吗?9,831 对评分样本,并测量了评判循环性带来的偏差。
本页由英文清单自动生成。
来自 readme
jev-search-rerank-eval Does a TypeSafe Jev rerank beat embedding search? Measured, with the judge-bias removed. A graded relevance evaluation over the Agent Skills Hub catalog (33,047 skills, MCP servers and coding-agent tools; snapshot 2026-09-18) with 164 real Chinese / English / mixed queries, 9,831 labelled (query, skill) pairs, and a bake-off of: - …
这是什么
- 形态
- 数据集或基准
- 宿主智能体
- 独立运行
- 面向人群
- 研究人员
成熟度
文档
报告了实测数据