Guardrails as Scapegoats: Auditing Unfaithful Safety Refusals in Tool-Augmented LLM Agents
arxiv.org原文 ↗
作者向工具响应注入空值、畸形字段、超时和不一致数据,测试 Agent 是否把基础设施故障错误解释成“因安全政策拒绝”。这种不忠实归因会掩盖真正的系统缺陷,也会让运维方误判 guardrail 的触发率。论文把拒绝审计从内容合规扩展到因果归因,提醒评测必须区分安全阻断、工具失败与模型能力不足。
–浏览
评论 · Comments