每日 Harness 开源 · Source
返回本期 · Back to 2026-06-25

论文 · Papers2026-06-25 · Thursday, June 25, 2026

CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference

arxiv.org原文 ↗

CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference
CompressKV 先识别 GQA 模型中的 Semantic Retrieval Heads,再用这些头决定哪些 token 的 KV cache 值得保留,并按层分配压缩预算。LongBench QA 中只保留 3% KV 仍能保持 97% 以上全缓存性能,Needle-in-a-Haystack 中 0.7% KV 可达到 90% 准确率。它说明长上下文推理的内存压缩可以利用模型内部检索结构,而不是把所有 attention head 当成同质信号。
浏览

评论 · Comments