每日 Harness 开源 · Source
返回本期 · Back to 2026-08-15

论文 · Papers2026-08-15 · Saturday, August 15, 2026

Beyond Final Scores

arxiv.org原文 ↗

Beyond Final Scores
该研究在 7 个前沿模型、36 项长程 AI 研发任务上记录方案形成、执行、反馈控制与经验复用,而非只收集最终 leaderboard 分。过程日志显示 agent 更像工程优化器:能迭代已有方向,却少有真正新颖的研究假设;同一设置运行方差大,先前经验有时提速、有时把搜索带偏。这样的分解解释了两个同分系统可能具有完全不同的失败位置,也为评估研发自动化提供了比单次最好成绩更可靠的观察单位。
浏览

评论 · Comments