每日 Harness 开源 · Source
返回本期 · Back to 2026-07-16

论文 · Papers2026-07-16 · Thursday, July 16, 2026

How Many Tasks Are Enough for Agent Benchmark Decisions?

arxiv.org原文 ↗

评测方法基准其他垂直
How Many Tasks Are Enough for Agent Benchmark Decisions?
这项研究用 SWE-bench、AppWorld 和 tau-bench 的公开任务级记录做 replay analysis,衡量部分任务运行能否复现完整 benchmark 的两两模型结论。论文把 benchmark 子采样变成统计决策问题:目标不是估一个漂亮均值,而是判断排序是否足够稳定。对昂贵 agent eval 来说,这提供了一个比“全量跑或不跑”更细的成本控制视角。
浏览

评论 · Comments