每日 Harness 开源 · Source
返回本期 · Back to 2026-08-22

论文 · Papers2026-08-22 · Saturday, August 22, 2026

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

arxiv.org原文 ↗

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning
SAPO 用同一自回归骨干在不同因果边界输出策略和值预测,把 PPO 目标与 on-policy SARSA 辅助目标合在一次 rollout 中,并以轨迹级 GAE 分配回合信用。
浏览

评论 · Comments