返回本期 · Back to 2026-08-15 论文 · Papers2026-08-15 · Saturday, August 15, 2026 Humans are Missing from AI Coding Agent Research arxiv.org原文 ↗ 评测方法基准工作流与控制流编码 这篇立场论文指出,多数 coding-agent benchmark 把人从回路中拿掉,于是通过率无法反映澄清需求、监督中间步骤和纠正方向的真实成本。作者提出任务对齐、可验证性、可操控性、适应性四个维度,要求实验覆盖 agent 如何融入人的工作流。它没有提供新的性能数字,贡献是为下一代评测划定缺失变量;能否落地仍需要把人类时间、干预质量和团队差异变成可重复协议。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments