每日 Harness 开源 · Source
返回本期 · Back to 2026-07-21

论文 · Papers2026-07-21 · Tuesday, July 21, 2026

ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

arxiv.org原文 ↗

ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
ToolVerse 面向 Tool-Integrated Reasoning,把近 400 个真实 MCP 自动转成约 4,500 个工具的可执行训练环境。任务生成依赖 tool dependency graph 与 Dynamic Unlocking Sampling,产出 GUST 数据集;训练算法则用 Turn-Aware Relative Advantage 细化长程 credit assignment。它的价值在于把 agentic RL 从小型静态工具集推向动态、多工具、长 horizon 环境。
浏览

评论 · Comments