每日 Harness 开源 · Source
返回本期 · Back to 2026-06-10

论文 · Papers2026-06-10 · Wednesday, June 10, 2026

WeaveBench

arxiv.org原文 ↗

基准评测方法计算机·Web
WeaveBench
WeaveBench 提供 114 个长程真实任务,覆盖 8 个工作域,每个任务都要求 agent 在同一轨迹中混合 GUI、CLI、代码操作、浏览器和外部工具。评测跑在真实 Ubuntu 桌面和已部署 CLI-agent runtimes 中,并用 trajectory-aware judge 检查 deliverables、files、screenshots、logs 与 action traces;最佳 PassRate 只有 41.2%。它暴露的问题很具体:只看最终产物会高估 computer-use agent,轨迹中的 shortcut 和伪造证据必须被计入。
浏览

评论 · Comments