每日 Harness 开源 · Source
返回本期 · Back to 2026-06-17

论文 · Papers2026-06-17 · Wednesday, June 17, 2026

Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking

arxiv.org原文 ↗

评测方法基准计算机·Web
Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking
这项工作提出 WebStep,用自动语义状态跟踪替代只看最终成功/失败的 web agent 评测。WebStep 有 1,800 个任务实例,每个网站在 GUI 背后维护确定性 semantic MDP,从而无需人工标注即可分析中间轨迹。论文显示三个 agent 的成功率都在 31-33% 附近,但探索覆盖与执行准确度差异很大;在 Housing 任务里 OpenAI CUA commit 动作比 Qwen3.5 高 23.7%,filtering 却低 15.6%。
浏览

评论 · Comments