AutoSpec
arxiv.org原文 ↗
AutoSpec 试图让 agent 安全规则像可审计程序一样演化,而不是在手写规则和黑箱分类器之间二选一。它从专家规则和 safe/unsafe trace 出发,用 CEGIS 挖反例,再用归纳逻辑编程筛选能区分 false positives 与 false negatives 的 predicate;291 条执行轨迹上,代码执行与 embodied agent 两个领域的规则 F1 分别达到 0.98 和 0.93。最硬的数字是 false positive 最多降低 94%,并在 4-5 次迭代内收敛。
–浏览
评论 · Comments