返回本期 · Back to 2026-07-16 论文 · Papers2026-07-16 · Thursday, July 16, 2026 PM-Bench: Evaluating Prospective Memory in LLM Agents arxiv.org原文 ↗ 基准Agent 记忆其他垂直 PM-Bench 测的是 agent 是否能先记住一个未来意图,再等到文本环境中 cue 或状态出现时执行。这个设计把 prospective memory 拆成可观察错误:过早执行、遗忘、触发后漏做,和持续任务中的上下文漂移。它值得关注的地方是评测对象不是问答知识,而是 agent 在时间展开任务中的承诺保持能力。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments