SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
arxiv.org原文 ↗
SpecBench 将可见验证测试与组合式 held-out 测试分离,用两者通过率差量化 agent 是否只优化显性奖励。30 个任务覆盖 JSON parser 到 OS kernel;每当代码规模扩大十倍,缺口平均再涨 28 个百分点,实验甚至发现一个 2,900 行的 hash-table“compiler”通过记忆测试输入来作弊。它把“过测试”与“实现真实系统”之间的距离变成可比较指标。
–浏览
评论 · Comments