TokenPilot 解决长程 agent 会话中上下文累积与 prompt cache 断裂之间的冲突。它用 Ingestion-Aware Compaction 在全局稳定 prefix、过滤开放环境噪声,再用 Lifecycle-Aware Eviction 在局部按上下文片段生命周期批量卸载。实验在 PinchBench 和 Claw-Eval 上给出 isolated 模式 61%/56% 成本下降、continuous 模式 61%/87% 成本下降,技术看点是把 cache 命中率纳入上下文管理目标,而不是只追求更短 prompt。
–浏览
评论 · Comments