GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents
arxiv.org原文 ↗
论文构建 440 个桌面任务、18 个应用、12 类 workflow 的匹配 benchmark,控制 goal、初始状态和 verifier,仅改变执行通道。最强 GUI agent full pass rate 为 59.1%,原始 skill CLI 为 48.2%,但 verifier-guided skill augmentation 把 CLI 提到 69.3%。结论不是 GUI 或 CLI 单方面胜出,而是 GUI 受长程 grounded interaction 限制,CLI 受 skill coverage 限制。
–浏览
评论 · Comments