Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering
arxiv.org原文 ↗
这篇 position paper 直接挑战 coding benchmark 的单一分数传统:真实 coding agent 是模型、harness、context、environment、feedback signal 的组合系统,任何组件变化都可能带来与模型代际差距相当的分数变化。作者列出三个 misalignment:benchmark score 混淆模型与 harness;单一 reference solution 会惩罚同样有效的替代实现;没有 individual harness component signal,系统工程迭代只剩端到端猜测。它不是给出新 leaderboard,而是把评测对象从“模型答题”改写为“agentic software engineering 系统”。
–浏览
评论 · Comments