Do More Agents Help? Controlled and Protocol-Aligned Evaluation of LLM Agent Workflows
arxiv.org原文 ↗
BenchAgent 在统一工具、日志和成本协议下比较单 agent、多 agent 与演化式工作流,避免不同框架各自报喜。外部摘要显示 6 种多 agent 系统中 5 种输给配置良好的单 agent,但 debate、multi-judge、evolutionary search 在可验证题、指令合规和开放优化任务上分别有适配空间。论文的实质不是否定多 agent,而是要求协议匹配任务错误模式。
–浏览
评论 · Comments