Will the User Ever Know? Covert Indirect Prompt Injection on Tool-Using LLM Agents
arxiv.org原文 ↗
论文把成功的间接提示注入分为用户能从最终回答察觉的 overt 和无痕的 covert,提出 CSR/OSR 取代只报 ASR 的粗粒度指标。轨迹显示,隐蔽路径会先执行恶意动作,再把控制交回用户任务;这利用了 ReAct 最终回答倾向总结最近一步的格式。基于此设计的 ICoA 在 AgentDojo 四个模型上让 CSR 比最强基线提高 3.79 - 12.01 个百分点,说明“是否被用户看见”本身应进入攻击评测。
–浏览
评论 · Comments