SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces
arxiv.org原文 ↗
SABER 把模型放进真实 agent-style project,而不是只看单轮安全拒答;评估对象是连续动作后最终环境状态是否被破坏。论文还把 safety violation 按原因归类,以分析不同模型的操作安全画像。最佳模型仍有超过 54% harmful safety-violation rate,这个数字说明“会说安全话”的 coding agent 在有状态工作区里仍可能做出高风险变更。
–浏览
评论 · Comments