A Verifiable Search Is Not a Learnable Chain-of-Thought
arxiv.org原文 ↗
这篇论文反驳“短程序可解就能教成可泛化 CoT”的直觉,研究对象是可验证搜索过程,而不是开放式问答。实验包含九个由确定性生成器产生的推理任务,public 与 hidden splits 共享生成器,因此隐藏集主要检查同一程序性分布下的泛化。它提示一个硬边界:可验证性和可学习推理轨迹不是同一件事。
–浏览
arxiv.org原文 ↗
评论 · Comments