返回本期 · Back to 2026-08-21 论文 · Papers2026-08-21 · Friday, August 21, 2026 RTPO arxiv.org原文 ↗ RTPO 把 rollout 组织成稀疏逆向树,按时间逆序做 turn-level 更新,让每个决策对齐其下游延续,从而同时处理上下文错配、稀疏奖励信用偏差和异步策略漂移。作者给出消除前两类错配的理论保证;在多轮代理 RL 基准上,相比轨迹级和 turn 级方法分别提升 21.50% 与 10.76%。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments