Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents
arxiv.org原文 ↗
评测方法编码
研究 3 个 coding agent 的 411 条执行标注轨迹和 101 个控制案例,发现审阅模型大小不是可靠质量指标。冻结两种证据格式后,6 个审阅器有 5 个在 122 条留出轨迹上同时提高缺陷捕获和拒绝控制,2 个做到全量正确;在没有官方测试时,作者改用 patch-caused static error 与“未修改仓库先失败”的生成测试做级联审计。
–浏览
评论 · Comments