ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm
arxiv.org原文 ↗
ANCHOR 针对 CLI agents 做自动化 alignment auditing,把真实危害任务放进可控命令行环境中观察 agent 行动。它评估的不是聊天拒答,而是代理是否会执行不该执行的文件、网络或系统操作。这个框架的意义在于把安全审计落到可复现的工具轨迹,适合发现“文字上安全、行动上越界”的问题。
–浏览
评论 · Comments