WeaveBench 提供 114 个长程真实任务,覆盖 8 个工作域,每个任务都要求 agent 在同一轨迹中混合 GUI、CLI、代码操作、浏览器和外部工具。评测跑在真实 Ubuntu 桌面和已部署 CLI-agent runtimes 中,并用 trajectory-aware judge 检查 deliverables、files、screenshots、logs 与 action traces;最佳 PassRate 只有 41.2%。它暴露的问题很具体:只看最终产物会高估 computer-use agent,轨迹中的 shortcut 和伪造证据必须被计入。
–浏览
评论 · Comments