返回本期 · Back to 2026-07-08 论文 · Papers2026-07-08 · Wednesday, July 8, 2026 ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents arxiv.org原文 ↗ 基准工具使用其他垂直 ToolFailBench 给工具调用失败做了更细的诊断切分,包括该调用时没有调用、选择了错误工具、参数填错、调用后不使用返回结果等。这样的 benchmark 比单一成功率更接近 agent 调试现场,因为同样失败可能来自 planner、schema grounding、参数抽取或结果整合。它的技术价值在于把“工具使用不行”拆成可修补的子问题。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments