[LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents](https://arxiv.org/abs/2608.17393) - LEGO-RL 用进程内 LLM proxy 保留原始 token 流,配合镜像缓存、分阶段 sandbox 防御和 Live UI,把 harness 运行细节纳入训练闭环。Qwen3.5-35B-A3B 在 OpenHands SDK、Claude Code、OpenCode 上的 SWE-bench Verified 分别由 64.0→70.4%、62.4→68.2%、57.2→66.6%,rollout 与重算概率相关性保持在 0.99 以上。
arxiv.org原文 ↗
–浏览
评论 · Comments