每日 Harness 开源 · Source
返回本期 · Back to 2026-06-13

论文 · Papers2026-06-13 · Saturday, June 13, 2026

The Cold-Start Safety Gap in LLM Agents

arxiv.org原文 ↗

The Cold-Start Safety Gap in LLM Agents
这篇论文提出 cold-start safety gap:tool-calling agent 在会话刚开始时最脆弱,完成若干正常任务后安全表现明显改善。SODA benchmark 允许控制威胁请求前的普通 agentic task 数量,作者在 4 个模型家族的 7 个模型上看到从 0 到 20 个 preceding tasks 会带来 9-52% 的安全提升。它的价值在于把 agent 安全从静态 prompt 评测转为会话深度变量,并用隐藏状态分析解释“热身”效应。
浏览

评论 · Comments