每日 Harness 开源 · Source
返回本期 · Back to 2026-08-26

论文 · Papers2026-08-26 · Wednesday, August 26, 2026

There Is No Neutral Harness: Measurement Instability in LLM Evaluation

arxiv.org原文 ↗

评测方法基准其他垂直
There Is No Neutral Harness: Measurement Instability in LLM Evaluation
作者把 12 个开源模型放进 26 种提示、解码与计分配置,在 ARC、HellaSwag、MMLU、TruthfulQA 共 3679 道题上重跑。Gemma4-31B 的汇总分可从 31% 变到 89%,脆弱题解释相邻模型差距的 95.7%,而且 12 个模型里有 4 个能在某种配置下成为第一。结论不只是“模板会影响分数”,而是模型排名若没有完整 harness 规范便缺乏可复现含义。
–浏览

评论 · Comments