Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents
arxiv.org原文 ↗
这篇把长期 agent 的“计划是否还留在模型状态里”拆成一个可测问题:replay pairing 对同一执行轨迹保留或移除早期 plan,再用隐藏状态距离追踪计划信号。Llama-3.1-70B 上计划信号一步后峰值为 0.453,但经过一个 action-observation 就衰减 4.1 倍;HotpotQA 场景衰减 12.4 倍,ALFWorld 压缩压力测试中朴素逐出计划让成功率下降 34.7 个百分点。它把上下文压缩从“工程上怎么省 token”推进到“哪些 agent 关键信息其实只是 context-resident”的诊断问题。
–浏览
评论 · Comments