Precision Is Not Faithfulness
arxiv.org原文 ↗
这篇论文指出 grounded generation 的许多 faithfulness metrics 只检查“说出来的事实是否被支持”,因此会奖励模型少说。作者用 Formula 1 telemetry 构造完整 oracle,覆盖 150 场比赛、7,253 个决策实例,并在 NOAA 天气预测上复现同类现象;最精确的前沿模型覆盖不到一半相关事实,按 F1 反而排在最后。它值得看的是评估口径本身:faithfulness 不能只看 precision,还要把 coverage 纳入同一张成绩单。
–浏览
评论 · Comments