Rethinking Normalization Placement for LLMs
arxiv.org原文 ↗
研究用 Qwen3-8B 教师和 9 层学生重新检验 pre-norm 与 post-norm,关键变量不是架构单独训练,而是逐步增加 Transformer 深度的课程。联合训练时两者验证交叉熵只差 0.0004;采用扩深课程后 post-norm 领先 0.0328,控制实验把反转定位到新 block 的追加。pre-norm 出现结构 token 尺度漂移且末层近似恒等,提示所谓稳定性优势会随增长式训练路径改变,不能从固定深度实验直接外推。
–浏览
评论 · Comments