返回本期 · Back to 2026-08-26 论文 · Papers2026-08-26 · Wednesday, August 26, 2026 There Is No Neutral Harness: Measurement Instability in LLM Evaluation arxiv.org原文 ↗ 评测方法基准其他垂直 作者把 12 个开源模型放进 26 种提示、解码与计分配置,在 ARC、HellaSwag、MMLU、TruthfulQA 共 3679 道题上重跑。Gemma4-31B 的汇总分可从 31% 变到 89%,脆弱题解释相邻模型差距的 95.7%,而且 12 个模型里有 4 个能在某种配置下成为第一。结论不只是“模板会影响分数”,而是模型排名若没有完整 harness 规范便缺乏可复现含义。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments