Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories
arxiv.org原文 ↗
论文把 DPO 扩展到多轮 agent trajectory,不再只让模型模仿专家下一步动作。Agentic-DPO 将行动选择、工具调用路径和最终结果纳入偏好优化,目标是学习哪条轨迹整体更优。它适合放在 agent training 脉络里看,因为行为克隆容易复制表面步骤,而轨迹级偏好更接近实际执行质量。
–浏览
评论 · Comments