每日 Harness 开源 · Source
返回本期 · Back to 2026-06-10

论文 · Papers2026-06-10 · Wednesday, June 10, 2026

From Rigid to Dynamic

arxiv.org原文 ↗

上下文工程系统·基础设施
From Rigid to Dynamic
论文观察到长上下文推理中 attention heads 存在 Rigid Heads 和 Dynamic Heads 两种 entropy 行为,而且具体分布随上下文变化,不能离线固定。EntropyInfer 在 prefill 时按 head/segment 动态分配稀疏预算,decode 时用已生成 token 帮助选择保留哪些 KV cache;在 Llama、Qwen、openPangu 系列上,超过 100k tokens 时最高得到 2.39 倍端到端加速。它属于训练免费路线,适合和现有长上下文推理栈对比落地成本。
浏览

评论 · Comments