返回本期 · Back to 2026-08-15 论文 · Papers2026-08-15 · Saturday, August 15, 2026 Beyond Final Scores arxiv.org原文 ↗ 评测方法基准可观测性与调试研究·科学 该研究在 7 个前沿模型、36 项长程 AI 研发任务上记录方案形成、执行、反馈控制与经验复用,而非只收集最终 leaderboard 分。过程日志显示 agent 更像工程优化器:能迭代已有方向,却少有真正新颖的研究假设;同一设置运行方差大,先前经验有时提速、有时把搜索带偏。这样的分解解释了两个同分系统可能具有完全不同的失败位置,也为评估研发自动化提供了比单次最好成绩更可靠的观察单位。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments