每日 Harness 开源 · Source
返回本期 · Back to 2026-06-23

论文 · Papers2026-06-23 · Tuesday, June 23, 2026

Prompt Injection as Role Confusion

role-confusion.github.io原文 ↗

安全与攻防系统·基础设施
Prompt Injection as Role Confusion
这篇论文把 prompt injection 的根源放在模型内部角色感知上:模型会根据文本风格判断“谁在说话”,而不是稳定服从外部 role label。作者设计 role probes,并用 CoT Forgery 把伪造推理注入用户提示和工具输出;摘要报告前沿模型攻击成功率约 60%,且生成前的 role confusion 程度可以预测攻击结果。它的价值在于把安全边界从 prompt 模板讨论推进到可测的表示空间问题。
浏览

评论 · Comments