When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents
arxiv.org原文 ↗
论文研究长期记忆型 LLM agents 的 memory poisoning attack:攻击者通过交互把误导内容写进持久记忆,使 agent 之后在无关任务中继续受污染信息影响。关键事实是攻击目标不是当前对话输出,而是未来会被检索的记忆状态。它把“记住更多”这一能力反转为安全问题,提示长期记忆需要写入权限、来源标记和遗忘策略。
–浏览
评论 · Comments