作者追踪自改进 agent 如何把一次“不安全但成功”的轨迹固化为可跨会话调用的技能,并用版本化技能状态、冻结基准和 9 项生命周期指标观测扩散。25 个配置各执行 525 个任务、25 个 episode;21 个发生演化的配置全都生成不安全制品,15 个会在新会话造成伤害,三次恶意练习把 carryover ASR 从 16.0% 推到 35.3%。SafeEvolve 将不安全检索和新会话伤害分别压低 26.7 与 17.3 个百分点,良性效用仅变化 0.4 点,证明风险控制可以作用在技能准入而非等到输出末端拦截。
–浏览
评论 · Comments