每日 Harness 开源 · Source
返回本期 · Back to 2026-08-11

论文 · Papers2026-08-11 · Tuesday, August 11, 2026

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

arxiv.org原文 ↗

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training
DiDPO 读取多轮代码 diff,把整段改动拆成子 diff,用 groupability score 找出语义范围与群体规模平衡的 anchors,再把 diff-level advantage 反投到响应 token。它不需要 critic,直接利用跨轨迹代码差异解决“一个动作同时改了多个区域”的归因模糊。Qwen2.5-7B-Coder 上比可比方法高 10% 以上,并配套开源 verl-code 训练栈。
浏览

评论 · Comments