Agent Safety Should Be a Runtime Contract
arxiv.org原文 ↗
论文把代码执行、文件修改、发信和数据库写入视为必须由 harness 约束的运行时行为,而非只靠 RLHF/DPO 内化。它提出预防面(sandbox、权限门、轨迹监视)和证据面(测试、日志、diff、引用 grounding),并审计 52 起事故、31 个 false-completion 核心案例、12 个公开系统 schema。对 2023-2025 年 NeurIPS、ICML、ICLR 共 28,560 篇论文的标题审计还发现训练期与部署期研究存在 8-12 倍失衡,论点因此落在“带可检查证据的轨迹”而非单个模型上。
–浏览
评论 · Comments