DENSE: Distilling Agent Trajectories into Evidence-Grounded Shortcut Trees for Self-Refinement
arxiv.org原文 ↗
DENSE 不等结果标签,而是从轨迹中的局部进展、恢复证据和未完成事项构造嵌套捷径树,压掉重复尝试并把已完成分支连接到剩余义务。REFIT 通过共享初始轨迹、重置环境/上下文来做盲后验比较;Terminal-Bench 2.1 上严格通过率提升 7.12 - 15.64 个百分点,重跑 token 少 19.0% - 43.6%。这使“经验复用”成为一种可量化的自我改进信号,但质量仍取决于局部证据是否足够可靠。
–浏览
评论 · Comments