Comparing Transformers and Hybrid Models at the Token Level
arxiv.org原文 ↗
这篇论文把 Transformer 与 hybrid 模型的对比从整体 benchmark 分数推进到 token 级行为,关注不同架构在具体词元位置上的预测差异。这样的分析能把“hybrid 是否接近 Transformer”拆成更细的问题:哪些 token 上一致、哪些上下文里分歧扩大、错误是否集中在特定生成阶段。它的价值在于提供架构比较的诊断视角,而不是只给一个最终胜负表。
–浏览
评论 · Comments