返回本期 · Back to 2026-07-16 论文 · Papers2026-07-16 · Thursday, July 16, 2026 How Many Tasks Are Enough for Agent Benchmark Decisions? arxiv.org原文 ↗ 评测方法基准其他垂直 这项研究用 SWE-bench、AppWorld 和 tau-bench 的公开任务级记录做 replay analysis,衡量部分任务运行能否复现完整 benchmark 的两两模型结论。论文把 benchmark 子采样变成统计决策问题:目标不是估一个漂亮均值,而是判断排序是否足够稳定。对昂贵 agent eval 来说,这提供了一个比“全量跑或不跑”更细的成本控制视角。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments