Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer
arxiv.org原文 ↗
同一个冻结模型先执行任务、再读取完整轨迹修改自己的 harness,训练批次横跨五个基准,并用五个从未参与演化的基准检验泛化。49 行种子 harness 第一阶段带来分布内 +4.48、分布外 +12.64 的平均分提升;在 Claw-Eval 继续演化又从 66.17 升到 68.06。输出截断、历史压缩和独立复核等机制是在演化中出现的,提示“优化执行程序”可以成为模型之外的改进通道。
–浏览
评论 · Comments