OSGuard 针对 computer-use agent “达成目标但破坏环境”的失败模式建立评测。它有 action-level benchmark,也有从 OSWorld 手工构造的 risk-augmented execution suite,后者在原任务仍可完成的前提下引入破坏性 overwrite 等 latent hazards,并用状态安全不变量扩展评分器。论文的关键观察是 multimodal guardrail 在孤立动作判断上可以表现好,但放进完整执行链仍会暴露局部监督与端到端安全之间的落差。
–浏览
评论 · Comments