每日 Harness 开源 · Source
返回本期 · Back to 2026-09-25

论文 · Papers2026-09-25 · Friday, September 25, 2026

Learn How to Act from Your Own Interactions: On-Policy Self-Distillation for GUI Agents

arxiv.org原文 ↗

GUI-SD-v2 先在相同 GUI 状态联合优化带特权指导和无指导的 rollout,再蒸馏步骤相关推理与记忆提示,使模型保留当前动作和后续交互所需信息。AndroidWorld 与 MobileWorld 上 Pass@1、Pass@3 都超过现有方法;论文承诺公开代码和训练数据,但摘要没有报告绝对提升幅度。它把 GUI 学习从单步 grounding 扩展到多轮 on-policy 反馈,适合继续观察数据公开后的可复现性。
–浏览

评论 · Comments