返回本期 · Back to 2026-08-06 论文 · Papers2026-08-06 · Thursday, August 6, 2026 Verifiable Memory arxiv.org原文 ↗ Agent RL / 可验证奖励Agent 记忆其他垂直 该方法把长期记忆、活跃上下文和 episodic 状态置于同一操作空间,用监督微调加三阶段强化学习训练代理执行 7 种记忆操作。局部验证器检查状态转移,全局验证器约束证据一致性和终态记忆;在 5 个基准、2 个骨干模型的大多数指标上取得最佳结果。验证器只在训练期使用,因而推理时没有额外裁判成本,但效果仍取决于训练时可判定的记忆规范。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments