MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference
arxiv.org原文 ↗
上下文工程系统·基础设施
MemDecay 提出 region-aware KV cache eviction,按上下文区域管理长轨迹推理中的缓存保留。它区分系统指令、用户目标、工具输出、历史推理和检索材料等不同区域,避免把所有 token 当作同等可驱逐对象。这个设计贴近 agent 推理的真实结构:有些早期约束很短却关键,有些近期工具日志很长却可能只需短期保留。
–浏览
评论 · Comments