Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus
arxiv.org原文 ↗
论文检验多数 LLM judge 是否真的提供独立证据,发现十个评审的平均错误相关为 0.21,统计信息量约等于 3.5 个独立评审。在最多 28% 的比较中,忽略共享失误会把“不显著”误判成显著优越;作者因此主张先用可信样本估计错误结构,再决定投票方法。
–浏览
arxiv.org原文 ↗
评论 · Comments