返回本期 · Back to 2026-07-15 论文 · Papers2026-07-15 · Wednesday, July 15, 2026 Who&When Pro: Can LLMs Really Attribute Failures in AI Agents? arxiv.org原文 ↗ 基准评测方法可观测性与调试其他垂直 论文提出 Who&When Pro,用来评估 LLM 是否能判断 agent 失败由谁造成、发生在哪一步。benchmark 面向多轮 agent 轨迹和多种失败原因,要求模型同时处理责任归因与时间定位;摘要强调当前 LLM 在长交互中明显不如人工标注稳定。它把“agent 出错了”拆成可操作的诊断问题,比只看最终成功/失败更适合调试复杂工作流。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments