IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference
arxiv.org原文 ↗
IntentKV 的目标不是压缩 prompt 文本,而是在推理服务层按跨轮意图剪 KV cache。它保持 base LLM 冻结,用 QueryMemory 和 memory-attention 给历史 token 打分,并用 slot-map redirection 保持 prefix cache 可用;在 8k KV 预算下,Qwen2.5-14B 的平均 peak request tokens 降 30.7%,最长 BCP query 的最坏 KV reads 从 411M 降到 31M。
–浏览
评论 · Comments