每日 Harness 开源 · Source
返回本期 · Back to 2026-08-13

论文 · Papers2026-08-13 · Thursday, August 13, 2026

Generating Attacks for LLMs with GFlowNets

arxiv.org原文 ↗

Generating Attacks for LLMs with GFlowNets
论文把红队输入生成建模成奖励分布采样,让攻击者、受害模型和评估器形成 GFlowNet 反馈环,并覆盖英语与土耳其语。一个实验中加入 GFN 与 MLE 后攻击成功率从 0.08 跃升到 0.79、毒性从 0.14 到 0.71;跨模型迁移和评估器偏差仍是明显限制。
浏览

评论 · Comments