论文观察到长上下文推理中 attention heads 存在 Rigid Heads 和 Dynamic Heads 两种 entropy 行为,而且具体分布随上下文变化,不能离线固定。EntropyInfer 在 prefill 时按 head/segment 动态分配稀疏预算,decode 时用已生成 token 帮助选择保留哪些 KV cache;在 Llama、Qwen、openPangu 系列上,超过 100k tokens 时最高得到 2.39 倍端到端加速。它属于训练免费路线,适合和现有长上下文推理栈对比落地成本。
–浏览
评论 · Comments