Runtime Skill Audit: Targeted Runtime Probing for Agent Skill Security
arxiv.org原文 ↗
RSA 把 skill 安全审计从静态读文档推进到运行时:问题不只是 skill 写了什么,而是 agent 在特定用户请求、本地资产、状态和工具交互下会做什么。方法先 profile risk-relevant interfaces,再准备执行上下文触发行为,最后根据 trace evidence 给安全标签。在 OpenClaw 的 100 个 skills 上,RSA 达到 90.0% accuracy、88.0% true positive rate、8.0% false positive rate,比最佳静态 baseline 高 13.0 个百分点;面对 self-evolving attacks,静态检测一两轮后崩掉,而 RSA 每轮仍能抓到 19-20/20 个恶意 skill。它为 skill marketplace 和企业内部 skill 审批提供了更接近真实 agent 行为的测试思路。
–浏览
评论 · Comments