ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents
arxiv.org原文 ↗
ToolMenuBench 把可见工具菜单本身作为 agent 评测对象。它系统改变菜单大小、干扰工具、状态依赖和风险暴露,并同时记录 visible-tool count、risky-tool exposure、wrong-tool calls、premature actions 与 token usage。七个模型后端、三种菜单大小、六种过滤方法和七个评测设置中,CMTF 把 all-tools exposure 下的 32.1% 成功率提到 85.7%,同时平均 token 使用约降 98%;结果说明 tool exposure 是 agent 接口设计问题,不只是上下文长度问题。
–浏览
评论 · Comments