返回本期 · Back to 2026-07-11 论文 · Papers2026-07-11 · Saturday, July 11, 2026 When LLMs Agree, Are They Right? arxiv.org原文 ↗ 评测方法测试时计算其他垂直 论文审计 self-consistency 和跨模型一致性作为置信信号的可靠性。结果方向很清楚:一致性通常与正确性相关,但在困难、歧义或共享偏差题上会系统性高估可信度;跨模型投票能降低一部分风险,却不能消除共同推理捷径。它给评测和产品置信度展示泼了一盆冷水,因为“多个模型同意”仍可能只是错在同一个模式里。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments