[Do LLMs Know a Good Hypothesis When They See One?](https://arxiv.org/abs/2608.17270) - 研究以模型 logits 的 energy score 评估科学假设,绕开 prompted judge 对熟悉表述的偏好;七个模型在 1323 篇论文、每篇 15 个错误选项上进行配对测试。intrinsic scoring 的 pooled Hit@1 为 33.0%,listwise judge 为 16.6%,最高组合 53.1% 来自事后选择,结果应被视为可行性信号而非稳定上限。
arxiv.org原文 ↗
–浏览
评论 · Comments