Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard
arxiv.org原文 ↗
作者用 Bayesian 方差分解分析 Holistic Agent Leaderboard 与 Harbor Index 的 22 个基准,把服务于目标结论的 signal 与会改变名次的无关 noise 分开。由此得到的警告是“可重复排序部署系统”不等于“可重复排序底层模型”,排行榜的可靠性要先明确测量对象,盲目加任务并不保证收敛。
–浏览
评论 · Comments