每日 Harness 开源 · Source
返回本期 · Back to 2026-10-02

论文 · Papers2026-10-02 · Friday, October 2, 2026

Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer

arxiv.org原文 ↗

Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer
同一个冻结模型先执行任务、再读取完整轨迹修改自己的 harness,训练批次横跨五个基准,并用五个从未参与演化的基准检验泛化。49 行种子 harness 第一阶段带来分布内 +4.48、分布外 +12.64 的平均分提升;在 Claw-Eval 继续演化又从 66.17 升到 68.06。输出截断、历史压缩和独立复核等机制是在演化中出现的,提示“优化执行程序”可以成为模型之外的改进通道。
–浏览

评论 · Comments