每日 Harness 开源 · Source
返回本期 · Back to 2026-07-02

论文 · Papers2026-07-02 · Thursday, July 2, 2026

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

arxiv.org原文 ↗

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents
ReGRPO 关注工具调用型 VLM agent 在失败后的恢复能力,而不是只从成功轨迹做 SFT。方法先执行 near-miss actions 来收集 grounded failure observations,再构造 Reflection-of-Thought triplets,包括 ErrorType、Evidence 和 FixPlan,与纠正动作配对 warm-start;RL 阶段则用 group-relative advantages 联合优化反思 token 和 corrective action,并加 reflection-cost 抑制不必要反思。在 GTA 与 GAIA 上,它在同 backbone 和 tool suite 下超过强开源 baseline,说明“失败解释”可以成为可训练的过程信号,而不只是日志分析材料。
浏览

评论 · Comments