首页 /基准、评测与校准 /jev-search-rerank-eval

jev-search-rerank-eval

Jev 重排能胜过向量检索吗?9,831 对评分样本,并测量了评判循环性带来的偏差。

本页由英文清单自动生成。

来自 readme

jev-search-rerank-eval Does a TypeSafe Jev rerank beat embedding search? Measured, with the judge-bias removed. A graded relevance evaluation over the Agent Skills Hub catalog (33,047 skills, MCP servers and coding-agent tools; snapshot 2026-09-18) with 164 real Chinese / English / mixed queries, 9,831 labelled (query, skill) pairs, and a bake-off of: - …

详情

分区
基准、评测与校准
owner
zhuyansen
星标
4
复刻
0
最近提交
2026-09-18
语言
Python
许可证
MIT

这是什么

形态
数据集或基准
宿主智能体
独立运行
面向人群
研究人员
成熟度
文档
报告了实测数据

适合用来

最匹配的意图