每日 Harness 开源 · Source
返回本期 · Back to 2026-06-17

论文 · Papers2026-06-17 · Wednesday, June 17, 2026

ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

arxiv.org原文 ↗

ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents
ToolMenuBench 把可见工具菜单本身作为 agent 评测对象。它系统改变菜单大小、干扰工具、状态依赖和风险暴露,并同时记录 visible-tool count、risky-tool exposure、wrong-tool calls、premature actions 与 token usage。七个模型后端、三种菜单大小、六种过滤方法和七个评测设置中,CMTF 把 all-tools exposure 下的 32.1% 成功率提到 85.7%,同时平均 token 使用约降 98%;结果说明 tool exposure 是 agent 接口设计问题,不只是上下文长度问题。
浏览

评论 · Comments