每日 Harness 开源 · Source
返回本期 · Back to 2026-08-20

论文 · Papers2026-08-20 · Thursday, August 20, 2026

[LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents](https://arxiv.org/abs/2608.17393) - LEGO-RL 用进程内 LLM proxy 保留原始 token 流,配合镜像缓存、分阶段 sandbox 防御和 Live UI,把 harness 运行细节纳入训练闭环。Qwen3.5-35B-A3B 在 OpenHands SDK、Claude Code、OpenCode 上的 SWE-bench Verified 分别由 64.0→70.4%、62.4→68.2%、57.2→66.6%,rollout 与重算概率相关性保持在 0.99 以上。

arxiv.org原文 ↗

[LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents](https://arxiv.org/abs/2608.17393) - LEGO-RL 用进程内 LLM proxy 保留原始 token 流,配合镜像缓存、分阶段 sandbox 防御和 Live UI,把 harness 运行细节纳入训练闭环。Qwen3.5-35B-A3B 在 OpenHands SDK、Claude Code、OpenCode 上的 SWE-bench Verified 分别由 64.0→70.4%、62.4→68.2%、57.2→66.6%,rollout 与重算概率相关性保持在 0.99 以上。
浏览

评论 · Comments