每日 Harness 开源 · Source
返回本期 · Back to 2026-09-25

论文 · Papers2026-09-25 · Friday, September 25, 2026

WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents

arxiv.org原文 ↗

WhatWorkedBench 要求 agent 检查代码、选择有限测量并提交覆盖配置的 response surface,CPU 穷举则提供组件效应真值,测试的是“改哪里会怎样”而非单纯运行实验。基准包括 36 个任务、30 个数据源、8 类工作流、1,248 条配置记录,以及 4,206 条数值控制记录和 108 个 agent episode。用 8 次新测量的 pair-effect ridge 在 22 个数据源中 15 个选出最优;Flash cohort 的高斯过程恢复从 0.632 提到 0.698,给实验设计能力提供了可量化起点。
–浏览

评论 · Comments