每日 Harness 开源 · Source
返回本期 · Back to 2026-07-15

论文 · Papers2026-07-15 · Wednesday, July 15, 2026

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories

arxiv.org原文 ↗

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories
论文把 DPO 扩展到多轮 agent trajectory,不再只让模型模仿专家下一步动作。Agentic-DPO 将行动选择、工具调用路径和最终结果纳入偏好优化,目标是学习哪条轨迹整体更优。它适合放在 agent training 脉络里看,因为行为克隆容易复制表面步骤,而轨迹级偏好更接近实际执行质量。
浏览

评论 · Comments