论文用提前终止和轨迹解码检验 Coconut、CODI 一类连续潜在推理模型,区分隐藏状态“存在”与它是否真的改变答案。多项逻辑任务中,移除潜在推理步几乎不影响最终输出;当任务确实依赖这些步骤时,正确预测样本的金标准推理轨迹有 65% - 93% 能从隐藏表示中恢复。作者还在没有金标准轨迹时验证出,多数正确答案能找到可信轨迹,而错误答案只有少数能通过同样检验,这让可解释性具备了结果校验价值。局限也很明确:结论来自两种模型和逻辑任务,不能直接外推到开放式推理。
–浏览
评论 · Comments