TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
arxiv.org原文 ↗
Agent RL / 可验证奖励计算机·Web
TRIAGE 指出标准 GRPO 把最终 verifier outcome 均匀赋给所有 action token,会奖励成功轨迹里的冗余/倒退动作,也会惩罚失败轨迹里的有用探索。它让 structured judge 把 segment 标成 decisive progress、useful exploration、no-progress infrastructure 或 regression,再用固定 role-conditioned rule 产生 bounded process reward。ALFWorld、Search-QA 和 WebShop 上 TRIAGE 均优于 GRPO;完成的 ALFWorld 与 WebShop rollout 中,它还相对 GRPO 额外减少 10.4% 和 14.8% 的 environment-facing turns,说明角色标签在降低方差之外也影响行动效率。
–浏览
评论 · Comments