每日 Harness 开源 · Source
返回本期 · Back to 2026-08-11

论文 · Papers2026-08-11 · Tuesday, August 11, 2026

MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents

arxiv.org原文 ↗

MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents
MemOPD 记录每次调用的输入/采样输出,恢复原始位置和因果可见性后再让 teacher 打分,修补 memory rewriting 让 teacher 看到 student 从未经历状态的问题。匹配控制中 F1 提高 7.0%;MemOPD-3B 相对 PPO 的最高提升为 416.2%,序列打包使 actor 计算最高加速 1.63 倍。它把 on-policy 的定义从“动作来自该策略”推进到“动作和记忆状态都来自同一轨迹”。
浏览

评论 · Comments