每日 Harness 开源 · Source
返回本期 · Back to 2026-07-16

论文 · Papers2026-07-16 · Thursday, July 16, 2026

PM-Bench: Evaluating Prospective Memory in LLM Agents

arxiv.org原文 ↗

基准Agent 记忆其他垂直
PM-Bench: Evaluating Prospective Memory in LLM Agents
PM-Bench 测的是 agent 是否能先记住一个未来意图,再等到文本环境中 cue 或状态出现时执行。这个设计把 prospective memory 拆成可观察错误:过早执行、遗忘、触发后漏做,和持续任务中的上下文漂移。它值得关注的地方是评测对象不是问答知识,而是 agent 在时间展开任务中的承诺保持能力。
浏览

评论 · Comments