每日 Harness 开源 · Source
返回本期 · Back to 2026-07-09

论文 · Papers2026-07-09 · Thursday, July 9, 2026

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

arxiv.org原文 ↗

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents
这篇不是新 benchmark,而是把 2023-2026 年的 27 篇 benchmark、taxonomy、audit paper 统一整理成 agent limitation taxonomy,覆盖 19 个不同 benchmark。作者归纳出 6 类失败:工具调用与参数错误、规划和约束满足失败、长程上下文积累导致退化、多 agent 协调失败、对抗或欠约束条件下的安全失败,以及测量有效性问题。它的价值在于横向拼接原本分散的评测证据,指出任务长度会使失败非线性叠加,单项能力强并不可靠地转化为端到端成功。
浏览

评论 · Comments