Learn How to Act from Your Own Interactions: On-Policy Self-Distillation for GUI Agents
arxiv.org原文 ↗
GUI-SD-v2 先在相同 GUI 状态联合优化带特权指导和无指导的 rollout,再蒸馏步骤相关推理与记忆提示,使模型保留当前动作和后续交互所需信息。AndroidWorld 与 MobileWorld 上 Pass@1、Pass@3 都超过现有方法;论文承诺公开代码和训练数据,但摘要没有报告绝对提升幅度。它把 GUI 学习从单步 grounding 扩展到多轮 on-policy 反馈,适合继续观察数据公开后的可复现性。
–浏览
评论 · Comments