每日 Harness 开源 · Source
返回本期 · Back to 2026-07-23

论文 · Papers2026-07-23 · Thursday, July 23, 2026

PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection

arxiv.org原文 ↗

PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection
论文不再把 prompt injection 只看成单个执行代理的问题,而是直接攻击负责拆解目标的 planner。作者构造了 4 种攻击设置,并报告在 GPT-4o、GPT-4o-mini、Qwen3-235B 与 Llama-3.3-70B 上,平均攻击成功率可达 96%;现有防护仍有约 90% 的平均成功率。这个结果说明,规划阶段一旦被污染,后续多个代理会把恶意步骤当成正常计划执行,风险具有结构性放大效应。
浏览

评论 · Comments