每日 Harness 开源 · Source
返回本期 · Back to 2026-08-12

论文 · Papers2026-08-12 · Wednesday, August 12, 2026

Test-Time Augmentation for LLMs

arxiv.org原文 ↗

测试时计算其他垂直
Test-Time Augmentation for LLMs
作者把 test-time compute 从“重复采样输出”分一部分给“改写输入”,比较语义改述、词法扰动和视觉变换,覆盖六个知识、数学、多语、多模态与情感任务。语义改述在六项中的五项超过 self-consistency,每美元带来的准确率增益约高 1.8 倍,并形成更好的成本效果 Pareto 前沿。收益集中在中档模型且依赖变换保持题意,论文因此提供的是输入多样性预算的有力证据,不是所有任务上无限增加 paraphrase 都有效。
浏览

评论 · Comments