MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents
arxiv.org原文 ↗
MemOPD 记录每次调用的输入/采样输出,恢复原始位置和因果可见性后再让 teacher 打分,修补 memory rewriting 让 teacher 看到 student 从未经历状态的问题。匹配控制中 F1 提高 7.0%;MemOPD-3B 相对 PPO 的最高提升为 416.2%,序列打包使 actor 计算最高加速 1.63 倍。它把 on-policy 的定义从“动作来自该策略”推进到“动作和记忆状态都来自同一轨迹”。
–浏览
评论 · Comments