作者先让 DeepSeek 自述 prompt stack、生成、隐藏推理、工具、记忆、MoE 与 MLA,再把回答标成直接观察、推断或猜测,并回查公开论文。模型明确无法查看自己的权重、hidden state、expert routing 和 serving 参数,却对 V3 论文已公开的 256 experts、671B 总参数/37B 激活参数也过度保守,展示“诚实校准”同样会漏掉公共事实。文章最稳健的方法论是把聊天当产品行为访谈,把架构数值交给论文;模型自我解释并不是对内部计算的观测报告。
–浏览
评论 · Comments