garak
github.com原文 ↗
garak 像面向 LLM 的 nmap/Metasploit,用静态、动态和自适应 probes 主动测试幻觉、数据泄露、提示注入、毒性、错误信息与越狱。它支持 Hugging Face、Replicate、OpenAI、Bedrock、LiteLLM、GGUF 和 REST,测量目标是“能否被诱导失败”,而不是给模型一个脱离攻击面的平均分。
–浏览
github.com原文 ↗
评论 · Comments