SAE Interventions are Unreliable: Post-Intervention Recovery of Suppressed Behavior
arxiv.org原文 ↗
这篇论文直接压力测试 SAE 特征干预:即便目标特征继续被 clamp,模型仍可能通过残差空间别的路径恢复被压制行为。作者在 TPP、unlearning、IOI 和 refusal steering 上都观察到 post-intervention recovery,refusal steering 有效样本恢复率达到 95.8%,且 defended-feature drift 低于 suffix baseline。它把“控制可解释特征”与“控制真实行为”之间的差距说得很清楚。
–浏览
评论 · Comments