CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference
arxiv.org原文 ↗
CompressKV 先识别 GQA 模型中的 Semantic Retrieval Heads,再用这些头决定哪些 token 的 KV cache 值得保留,并按层分配压缩预算。LongBench QA 中只保留 3% KV 仍能保持 97% 以上全缓存性能,Needle-in-a-Haystack 中 0.7% KV 可达到 90% 准确率。它说明长上下文推理的内存压缩可以利用模型内部检索结构,而不是把所有 attention head 当成同质信号。
–浏览
评论 · Comments