每日 Harness 开源 · Source
返回本期 · Back to 2026-06-11

论文 · Papers2026-06-11 · Thursday, June 11, 2026

IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference

arxiv.org原文 ↗

IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference
IntentKV 的目标不是压缩 prompt 文本,而是在推理服务层按跨轮意图剪 KV cache。它保持 base LLM 冻结,用 QueryMemory 和 memory-attention 给历史 token 打分,并用 slot-map redirection 保持 prefix cache 可用;在 8k KV 预算下,Qwen2.5-14B 的平均 peak request tokens 降 30.7%,最长 BCP query 的最坏 KV reads 从 411M 降到 31M。
浏览

评论 · Comments