每日 Harness 开源 · Source
返回本期 · Back to 2026-07-01

论文 · Papers2026-07-01 · Wednesday, July 1, 2026

Agent Safety Is Action Alignment

arxiv.org原文 ↗

Agent Safety Is Action Alignment
作者批评把聊天机器人时代的拒答训练直接搬到 agent 安全中,因为 agent 已经能代表用户调用工具、转移资金、删除记录和发送消息。论文提出 action alignment:每个模型发出的动作都要与用户授权和上下文意图一致。它把“安全”从输入过滤转成动作级授权问题,也解释了为什么简单 capability gate 会带来能力损失却仍不能覆盖真实风险。
浏览

评论 · Comments