GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving
arxiv.org原文 ↗
GrowPage 用近期与长期 query 摘要估计注意力工作集,在解码遇到容量边界时决定压缩当前 KV 或申请新的物理页。它保留 PagedAttention 的连续批处理和前缀缓存,针对不同请求动态分配容量;多模型实验报告的吞吐 - 质量折中优于固定预算策略。
–浏览
arxiv.org原文 ↗
评论 · Comments