每日 Harness 开源 · Source
返回本期 · Back to 2026-09-18

论文 · Papers2026-09-18 · Friday, September 18, 2026

FlexEE: Self-Speculative and KV-Compatible Early Exiting for Offloading-Aware LLM Inference

arxiv.org原文 ↗

FlexEE: Self-Speculative and KV-Compatible Early Exiting for Offloading-Aware LLM Inference
FlexEE 给每层加入提前退出监督,以 top-K 自推测减少需要搬运的权重,同时保持 KV cache 的语义兼容;动态隐藏状态由验证过的草稿路径校正。Llama2-7B 在 0% 和 50% 卸载下分别获得 1.27 倍和 3.16 倍加速,Llama3-8B 对应 1.25 倍和 2.83 倍。加速随卸载比例升高而放大,说明它优化的是内存搬运与计算的耦合,而不是单一解码算子。
–浏览

评论 · Comments