每日 Harness 开源 · Source
返回本期 · Back to 2026-06-06

论文 · Papers2026-06-06 · Saturday, June 6, 2026

Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents

arxiv.org原文 ↗

Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents
MMPO 的出发点是长程 agent 的递归摘要会逐步丢失任务相关信息并引入语义噪声,仅用最终成功率训练很难定位哪一步记忆变坏。论文提出 Belief Entropy,用当前 memory 对 latent task state 的不确定性作为 self-supervised proxy,并把它作为 memory-specific dense supervision。实验报告 MMPO 在多类 long-horizon task 上优于既有方法,并在 1.75M-token contexts 下保持 97.1% performance。
浏览

评论 · Comments