The Wording Effect
arxiv.org原文 ↗
BenchDrift 沿语言、指称、语用和结构四个维度生成保持答案不变的改写,再观察 GSM8K、MMLU、MATH-Hard 上八个模型的双向漂移。弱模型从改写中得到的正确答案多于丢失,强模型却相反,且强模型在榜单上越高,分数越依赖碰巧采用的措辞;模型之间还大体同意哪些改写最伤正确答案。由此看,单一 phrasing 的 benchmark 分数同时混入了模型能力和题面脆弱性。
–浏览
评论 · Comments