每日 Harness 开源 · Source
返回本期 · Back to 2026-06-13

论文 · Papers2026-06-13 · Saturday, June 13, 2026

DailyReport

arxiv.org原文 ↗

DailyReport
DailyReport 试图把 search agent 评测从专业问答拉回真实日常信息需求:数据集包含 150 个开放任务和 3,546 条相关 rubrics。它把任务分解为 subtasks,再用 cascade performance attribution 和 user-centric aggregation 输出维度分数与用户偏好分数;论文报告评估了 17 个 agentic systems。值得注意的是它强调可解释评分,而不是只给一个 task-level pass/fail。
浏览

评论 · Comments