PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection
arxiv.org原文 ↗
论文不再把 prompt injection 只看成单个执行代理的问题,而是直接攻击负责拆解目标的 planner。作者构造了 4 种攻击设置,并报告在 GPT-4o、GPT-4o-mini、Qwen3-235B 与 Llama-3.3-70B 上,平均攻击成功率可达 96%;现有防护仍有约 90% 的平均成功率。这个结果说明,规划阶段一旦被污染,后续多个代理会把恶意步骤当成正常计划执行,风险具有结构性放大效应。
–浏览
评论 · Comments