SWE-Doctor: Guiding Software Engineering Agents with Runtime Diagnosis from Multi-Faceted Bug Reproduction Tests
arxiv.org原文 ↗
SWE-Doctor 先指出一个反直觉现象:直接用高级 BRT generator 指导 patch generation 不一定有效,fail-to-fail BRT 会误导 agent,fail-to-pass BRT 也可能只覆盖 issue 的一个表现。它改为生成多面向 BRT,执行并调试这些测试,形成 runtime-grounded diagnosis records,再结合 BRT 生成阶段推断的定位信息指导 patch。五个 LLM backends、SWE-bench Verified 与 SWE-bench Pro 的 10 个组合上,它平均达到 75.7% 和 59.4% resolution rate;在更难的 SWE-bench Pro 上比 baseline agents 高 8.0-8.9 个百分点。
–浏览
评论 · Comments