From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving
arxiv.org原文 ↗
这篇综述将 KV cache 管理按 locality、lifetime、ownership 和 substrate 分类,从单卡 tensor buffer 扩展到分布式内存层级。它覆盖显存、主存、远端存储和跨请求共享等设计面,说明 KV cache 已经不是简单优化项,而是 LLM serving 系统结构的一部分。适合用来梳理近期 PagedAttention、prefix cache、offloading 和调度策略之间的关系。
–浏览
评论 · Comments