每日 Harness 开源 · Source
返回本期 · Back to 2026-06-19

论文 · Papers2026-06-19 · Friday, June 19, 2026

RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents

arxiv.org原文 ↗

RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents
RODS 观察到 GRPO 的梯度信号集中在 rollout reward 方差最高的任务上,也就是模型刚好会一半、错一半的能力边界。方法从 400 个人类种子出发,维护约 800 个活跃样本,通过 skill-aligned resampling 持续合成多轮工具任务。它用约少 20 倍轨迹达到接近 17K 离线样本管线的表现,适合关注 RL 数据效率的人读。
浏览

评论 · Comments