每日 Harness 开源 · Source
返回本期 · Back to 2026-08-26

论文 · Papers2026-08-26 · Wednesday, August 26, 2026

MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning

arxiv.org原文 ↗

MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning
MCP-U RL 用 MCP 作为环境接口,让现有工具服务器无需编写 RL 专用胶水即可加入训练;环境层负责在可插拔容器后端配置、隔离与回收数百条轨迹。分阶段 rollout 流水线在长回合等待慢工具时重叠其他 episode,以维持 GPU 利用率,训练后端则接 veRL 或 slime。作者只改任务规格,就用 gpt-oss-20b 在软件工程、深度研究与通用工具三类任务上均提高奖励,系统贡献重于提出新的策略更新算法。
–浏览

评论 · Comments