返回本期 · Back to 2026-06-23 论文 · Papers2026-06-23 · Tuesday, June 23, 2026 Prompt Injection as Role Confusion role-confusion.github.io原文 ↗ 安全与攻防系统·基础设施 这篇论文把 prompt injection 的根源放在模型内部角色感知上:模型会根据文本风格判断“谁在说话”,而不是稳定服从外部 role label。作者设计 role probes,并用 CoT Forgery 把伪造推理注入用户提示和工具输出;摘要报告前沿模型攻击成功率约 60%,且生成前的 role confusion 程度可以预测攻击结果。它的价值在于把安全边界从 prompt 模板讨论推进到可测的表示空间问题。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments