ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents
arxiv.org原文 ↗
ReGRPO 关注工具调用型 VLM agent 在失败后的恢复能力,而不是只从成功轨迹做 SFT。方法先执行 near-miss actions 来收集 grounded failure observations,再构造 Reflection-of-Thought triplets,包括 ErrorType、Evidence 和 FixPlan,与纠正动作配对 warm-start;RL 阶段则用 group-relative advantages 联合优化反思 token 和 corrective action,并加 reflection-cost 抑制不必要反思。在 GTA 与 GAIA 上,它在同 backbone 和 tool suite 下超过强开源 baseline,说明“失败解释”可以成为可训练的过程信号,而不只是日志分析材料。
–浏览
评论 · Comments