Black-Box Red Teaming of Agentic AI: A Taxonomy-Driven Framework for Automated Risk Discovery
arxiv.org原文 ↗
框架以七域风险分类约束黑盒红队,SAGE-RT 为每个域自动生成 120 个对抗场景,再用人工校验的 LLM judge 归因。CrewAI 与 AutoGen、四个基础模型的验证中,平均治理风险 56.25%,多 agent 配置隐私风险 65%,行为漏洞最高 85%;它的价值在于只需系统描述即可找架构级问题,但风险数字依赖场景生成和 judge 设计。
–浏览
评论 · Comments