每日 Harness 开源 · Source
返回本期 · Back to 2026-07-08

论文 · Papers2026-07-08 · Wednesday, July 8, 2026

PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving

arxiv.org原文 ↗

PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving
PEEK 针对 LLM serving 中 KV cache 的调度和淘汰,利用排队请求之间的前缀共享来预测缓存价值。它的关键思想是 eviction 不只看当前 cache,还看队列里即将到来的请求是否能复用这些前缀。对高并发推理服务来说,这把 KV cache 从被动显存占用变成了可预测的队列资源。
浏览

评论 · Comments