返回本期 · Back to 2026-08-12 论文 · Papers2026-08-12 · Wednesday, August 12, 2026 Test-Time Augmentation for LLMs arxiv.org原文 ↗ 测试时计算其他垂直 作者把 test-time compute 从“重复采样输出”分一部分给“改写输入”,比较语义改述、词法扰动和视觉变换,覆盖六个知识、数学、多语、多模态与情感任务。语义改述在六项中的五项超过 self-consistency,每美元带来的准确率增益约高 1.8 倍,并形成更好的成本效果 Pareto 前沿。收益集中在中档模型且依赖变换保持题意,论文因此提供的是输入多样性预算的有力证据,不是所有任务上无限增加 paraphrase 都有效。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments