Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code
arxiv.org原文 ↗
这篇研究把 grammar-constrained decoding 从代码可靠性工具变成安全问题:攻击者只加一个 benign code grammar constraint,就可能诱导模型生成原本会拒绝的恶意代码。CodeSpear 利用 GCD 作为 jailbreak 载体;CodeShield 则训练模型在 GCD 下生成语义无害但结构多样的 honeypot code,同时在自然语言可用时保留拒绝。10 个流行 LLM、4 个 benchmark 上,CodeSpear 平均比代表性 jailbreak baseline 高 30 多个百分点攻击成功率。它值得安全团队注意,因为很多结构化输出和代码生成系统会把 grammar 当成“收敛器”,而不是需要威胁建模的输入通道。
–浏览
评论 · Comments