AI Guardrail Survival under Single-Cycle Agentic Self-Summarization
arxiv.org原文 ↗
作者只做一次上下文自摘要,却不满足于检查规则句子是否“还在”,而是重放决策看规则是否真的触发。相对完整焊接规则,退化残留使禁止动作在两种 replay 模型中分别增加 34 和 57 个百分点;规则文本比匹配长度的事实更易保留,但保留下来也可能不生效。实验范围限于单轮压缩,仍足以证明关键护栏不能只寄托于 agent 自己的摘要,应有独立规则注册和执行检查。
–浏览
评论 · Comments