返回本期 · Back to 2026-08-11 论文 · Papers2026-08-11 · Tuesday, August 11, 2026 DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training arxiv.org原文 ↗ Agent RL / 可验证奖励编码 DiDPO 读取多轮代码 diff,把整段改动拆成子 diff,用 groupability score 找出语义范围与群体规模平衡的 anchors,再把 diff-level advantage 反投到响应 token。它不需要 critic,直接利用跨轨迹代码差异解决“一个动作同时改了多个区域”的归因模糊。Qwen2.5-7B-Coder 上比可比方法高 10% 以上,并配套开源 verl-code 训练栈。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments