每日 Harness 开源 · Source
返回本期 · Back to 2026-06-27

论文 · Papers2026-06-27 · Saturday, June 27, 2026

When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models

arxiv.org原文 ↗

When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models
论文给多模型组合方法加了一个很硬的上限:如果系统输出必须来自某个成员模型,准确率最多是 1 减去所有模型共同答错的 beta。作者测了 21 家提供商的 67 个模型,开放数学任务观察 beta=0.052,而 Gaussian copula 估计只有 0.023,执行判分代码任务 beta=0.079。它的贡献是提醒路由、投票和 MoA 的收益来自“错在不同题”,不是模型越多越稳。
浏览

评论 · Comments