每日 Harness 开源 · Source
返回本期 · Back to 2026-10-03

论文 · Papers2026-10-03 · Saturday, October 3, 2026

Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard

arxiv.org原文 ↗

评测方法基准研究·科学
Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard
作者用 Bayesian 方差分解分析 Holistic Agent Leaderboard 与 Harbor Index 的 22 个基准,把服务于目标结论的 signal 与会改变名次的无关 noise 分开。由此得到的警告是“可重复排序部署系统”不等于“可重复排序底层模型”,排行榜的可靠性要先明确测量对象,盲目加任务并不保证收敛。
–浏览

评论 · Comments