Who Thinks Best Depends on How Long You Let Them
arxiv.org原文 ↗
论文在三个推理基准、四个模型和 64-4,096 token 七档预算上做了 56,476 次推理。3%-19% 的样本随预算增加出现非单调下降,所有基准都发生统计显著的模型排名反转;oracle 显示模型互补最高可达 27.8 个百分点,而预算感知路由跨域只追回 oracle gap 的 14.1%。因此“哪个模型最好”必须连同 token budget 和域一起报告。
–浏览
评论 · Comments