[PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs](https://arxiv.org/abs/2608.17289) - PlanPO 在同一任务的成功轨迹内部比较总步数和逐轮响应长度,提供 coarse-to-fine advantage,避免所有成功样本被压成同一奖励。ALFWorld、WebShop、SciWorld 上平均超过 GRPO 27.2%,并未显著增加训练成本;作者刻意约束奖励设计,防止策略退化成无脑缩短输出。
arxiv.org原文 ↗
–浏览
评论 · Comments