OpenForgeRL: Train Harness-native Agents in Any Environment
arxiv.org原文 ↗
OpenForgeRL 用代理记录 harness 模型调用,把 rollout 放进 Kubernetes 独立容器,再接入标准 RL 代码库,因而训练对象就是部署时的真实有状态 harness。OpenForgeGUI 在 OSWorld-Verified、Online-Mind2Web、WebVoyager 分别达到 37.7、63.0、72.3,工具型 OpenForgeClaw 也在 ClawEval/QwenClawBench 超过同尺寸开放基线。分析指出 RL 能提高自验证、工具覆盖和多步计划,但错误恢复仍是明显短板。
–浏览
评论 · Comments