RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents
arxiv.org原文 ↗
RODS 观察到 GRPO 的梯度信号集中在 rollout reward 方差最高的任务上,也就是模型刚好会一半、错一半的能力边界。方法从 400 个人类种子出发,维护约 800 个活跃样本,通过 skill-aligned resampling 持续合成多轮工具任务。它用约少 20 倍轨迹达到接近 17K 离线样本管线的表现,适合关注 RL 数据效率的人读。
–浏览
评论 · Comments