每日 Harness 开源 · Source
返回本期 · Back to 2026-10-03

论文 · Papers2026-10-03 · Saturday, October 3, 2026

Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents

arxiv.org原文 ↗

Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents
研究 3 个 coding agent 的 411 条执行标注轨迹和 101 个控制案例,发现审阅模型大小不是可靠质量指标。冻结两种证据格式后,6 个审阅器有 5 个在 122 条留出轨迹上同时提高缺陷捕获和拒绝控制,2 个做到全量正确;在没有官方测试时,作者改用 patch-caused static error 与“未修改仓库先失败”的生成测试做级联审计。
–浏览

评论 · Comments