"Next-token predictor" is the wrong mental model for LLMs
gmcgoldr.github.io原文 ↗
文章承认自回归 next-token 是训练与生成机制,却反对用它概括模型学到的内部结构及接入工具、记忆后的系统行为。作者把可靠拒答和事实校验列为目标函数之外的能力,主张讨论模型时同时考虑上下文、检索、工具和反馈闭环。
–浏览
gmcgoldr.github.io原文 ↗
评论 · Comments