Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents
arxiv.org原文 ↗
MMPO 的出发点是长程 agent 的递归摘要会逐步丢失任务相关信息并引入语义噪声,仅用最终成功率训练很难定位哪一步记忆变坏。论文提出 Belief Entropy,用当前 memory 对 latent task state 的不确定性作为 self-supervised proxy,并把它作为 memory-specific dense supervision。实验报告 MMPO 在多类 long-horizon task 上优于既有方法,并在 1.75M-token contexts 下保持 97.1% performance。
–浏览
评论 · Comments