MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents
arxiv.org原文 ↗
MemPoison 构建了 1227 个 adversarial memory 实例,用来评估恶意内容如何经普通交互渠道进入长期记忆并在后续任务中生效。论文强调的 structural blind spots 是:很多系统会过滤即时 prompt,却默认已保存记忆可信。它与 Bad Memory 形成互补,把持久状态安全从概念风险推进到可跑的基准。
–浏览
评论 · Comments