LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs
arxiv.org原文 ↗
论文针对混合 LLM 中线性递归层没有 token-indexed KV、无法执行片段拼接的问题,提出训练免费、解耦初始化的 PIC 框架。每个线性层把 K 个命中局部状态映射为一个初始状态,注意力层仍沿用原缓存路径;在 Mamba-2 上单缓存块恢复 86.8% 的全量质量,精确组合仅 46.6%,并将 TTFT 降到完整预填充的 0.46 倍。它的价值在于证明“代数上更精确”并不等于 serving 质量更高,尤其适合已有 PIC selector 的混合模型部署。
–浏览
评论 · Comments