返回本期 · Back to 2026-07-04 论文 · Papers2026-07-04 · Saturday, July 4, 2026 PACE: A Proxy for Agentic Capability Evaluation arxiv.org原文 ↗ 评测方法基准其他垂直 PACE 试图用更便宜的非 agentic 能力测试预测昂贵 agent benchmark 的结果,目标包括 SWE-Bench、GAIA 这类需要长轨迹和环境验证的评测。关键事实是它把模型筛选前置为 proxy evaluation,减少每次都运行完整 agent benchmark 的成本。这个方向适合评测工程,因为 agent benchmark 的价格、时延和不稳定性正在成为模型迭代的现实瓶颈。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments