SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning
arxiv.org原文 ↗
Agent RL / 可验证奖励其他垂直
SAPO 用同一自回归骨干在不同因果边界输出策略和值预测,把 PPO 目标与 on-policy SARSA 辅助目标合在一次 rollout 中,并以轨迹级 GAE 分配回合信用。
–浏览
arxiv.org原文 ↗
评论 · Comments