Deployment Decision Reliability
arxiv.org原文 ↗
这项工作用四面体 Generalizability Theory 拆解 TheAgentCompany、tau2-bench、AppWorld 的长时程评测方差,并把结果封装成部署决策报告。三个数据集里 agent 主效应都不到总方差的 3%,agent-by-task 交互却占 7%-23%;tau2 action_checks 在最难四分位的可靠度从 0.752 直接降到 0。结论不是再造一个排行榜,而是提醒采购方报告任务抽样和不确定性,否则榜单很可能只是在排“专长”。
–浏览
评论 · Comments