Generating Attacks for LLMs with GFlowNets
arxiv.org原文 ↗
论文把红队输入生成建模成奖励分布采样,让攻击者、受害模型和评估器形成 GFlowNet 反馈环,并覆盖英语与土耳其语。一个实验中加入 GFN 与 MLE 后攻击成功率从 0.08 跃升到 0.79、毒性从 0.14 到 0.71;跨模型迁移和评估器偏差仍是明显限制。
–浏览
arxiv.org原文 ↗
评论 · Comments