每日 Harness 开源 · Source
返回本期 · Back to 2026-09-05

论文 · Papers2026-09-05 · Saturday, September 5, 2026

GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving

arxiv.org原文 ↗

GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving
GrowPage 用近期与长期 query 摘要估计注意力工作集,在解码遇到容量边界时决定压缩当前 KV 或申请新的物理页。它保留 PagedAttention 的连续批处理和前缀缓存,针对不同请求动态分配容量;多模型实验报告的吞吐 - 质量折中优于固定预算策略。
–浏览

评论 · Comments