每日 Harness 开源 · Source
返回本期 · Back to 2026-07-08

论文 · Papers2026-07-08 · Wednesday, July 8, 2026

ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents

arxiv.org原文 ↗

基准工具使用其他垂直
ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents
ToolFailBench 给工具调用失败做了更细的诊断切分,包括该调用时没有调用、选择了错误工具、参数填错、调用后不使用返回结果等。这样的 benchmark 比单一成功率更接近 agent 调试现场,因为同样失败可能来自 planner、schema grounding、参数抽取或结果整合。它的技术价值在于把“工具使用不行”拆成可修补的子问题。
浏览

评论 · Comments