每日 Harness 开源 · Source
返回本期 · Back to 2026-06-25

论文 · Papers2026-06-25 · Thursday, June 25, 2026

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

arxiv.org原文 ↗

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation
这项工作用视觉语言模型自动评估 GUI agent 的最终截图和原始指令,再把评估结果转成 RL 终端奖励。作者把 evaluator 输出视为 noisy binary reward,并在 PPO 中加入噪声校正估计器;在 macOSWorld、Windows Agent Arena 与 OSWorld 上,平均比 zero-shot 高 12.6 个百分点,比直接使用原始 evaluator 奖励高 5.1 点。它的价值在于绕开人工打分瓶颈,同时承认自动 evaluator 会错,并把这个噪声显式建模进训练。
浏览

评论 · Comments