ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents
arxiv.org原文 ↗
ClawArena-Team 专门隔离 LLM 作为 manager 的能力:主模型只能看文本、只能直接访问部分 workspace,但可以创建子代理、分派任务、接收异步结果并合成答案。benchmark 包含 41 个多轮、多模态、多目录场景、258 个 evaluation rounds 和 72 个 staged updates,评分完全 execution-based,不用 LLM judge。最尖锐的发现是 no model exceeds 50% workspace-permission precision,且 API cost 跨越 100 倍以上时整体 SMS 只跨不到 4 倍;这让“会不会管理权限和工作流”成为独立于原始模型能力的评测轴。
–浏览
评论 · Comments