From Parameters to Answers: How LLMs Retrieve and Use Their Internal Knowledge
arxiv.org原文 ↗
逐层干预把 hidden state 中“指向哪类知识”的 routing 与“最终形成的内容”分开测量,在 Qwen、Llama、Gemma 上比较国家 - 洲及不同答案形式。冻结 Qwen 显示 pair-conditioned 路由先增强、随后才影响拟合知识;Gemma 出现部分重叠的中层窗口,Llama 在同样门控下没有持续窗口,说明知识读取并非单一跨模型时序。
–浏览
评论 · Comments