DailyReport
arxiv.org原文 ↗
DailyReport 试图把 search agent 评测从专业问答拉回真实日常信息需求:数据集包含 150 个开放任务和 3,546 条相关 rubrics。它把任务分解为 subtasks,再用 cascade performance attribution 和 user-centric aggregation 输出维度分数与用户偏好分数;论文报告评估了 17 个 agentic systems。值得注意的是它强调可解释评分,而不是只给一个 task-level pass/fail。
–浏览
评论 · Comments