Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking
arxiv.org原文 ↗
这项工作提出 WebStep,用自动语义状态跟踪替代只看最终成功/失败的 web agent 评测。WebStep 有 1,800 个任务实例,每个网站在 GUI 背后维护确定性 semantic MDP,从而无需人工标注即可分析中间轨迹。论文显示三个 agent 的成功率都在 31-33% 附近,但探索覆盖与执行准确度差异很大;在 Housing 任务里 OpenAI CUA commit 动作比 Qwen3.5 高 23.7%,filtering 却低 15.6%。
–浏览
评论 · Comments