Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation
arxiv.org原文 ↗
这项工作用视觉语言模型自动评估 GUI agent 的最终截图和原始指令,再把评估结果转成 RL 终端奖励。作者把 evaluator 输出视为 noisy binary reward,并在 PPO 中加入噪声校正估计器;在 macOSWorld、Windows Agent Arena 与 OSWorld 上,平均比 zero-shot 高 12.6 个百分点,比直接使用原始 evaluator 奖励高 5.1 点。它的价值在于绕开人工打分瓶颈,同时承认自动 evaluator 会错,并把这个噪声显式建模进训练。
–浏览
评论 · Comments