Efficient Benchmarking in Production: A Study of an Evolving LLM Agent
arxiv.org原文 ↗
作者没有在静态 benchmark 上模拟生产,而是分析一个服务数万月活用户的代理的 574 次历史运行,比较缓存、固定子集和 IRT 自适应抽题。二维 2PL 只执行 200 题、即完整评测的 38.5%,MAE 为 1.03 个百分点;最终部署却选了无需重校准、可迁移到五个代理家族的难度分层固定集,说明运营摩擦本身也是评测设计变量。
–浏览
评论 · Comments