Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields
arxiv.org原文 ↗
Workflow-GYM 把 GUI agent 评测推向专业软件里的端到端长流程,而不是网页点击或通用桌面小任务。实验显示即使最强模型成功率也只是略高于 30%,失败集中在阶段遗漏、错误传播、目标漂移和对专业软件环境理解不足;这给“computer-use agent 已可替代知识工作流”的说法提供了清晰边界。
–浏览
评论 · Comments