每日 Harness 开源 · Source
返回本期 · Back to 2026-07-11

论文 · Papers2026-07-11 · Saturday, July 11, 2026

Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs

arxiv.org原文 ↗

Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs
论文用 internal attribution graph 分析 jailbreak prompt 如何改变模型内部计算路径。重点不是再收集一批越狱样例,而是把越狱时的注意力、中间激活和输出倾向关联成图,观察安全拒答链路如何被改写。它为安全研究提供了更细的观察面:攻击成功不只是输入文本绕过规则,而是内部计算路线被重新引导。
浏览

评论 · Comments