每日 Harness 开源 · Source
返回本期 · Back to 2026-09-02

论文 · Papers2026-09-02 · Wednesday, September 2, 2026

TRACER: Per-Tool Context Retention for LLM Agents via Consequence-Attributed Reinforcement Learning

arxiv.org原文 ↗

TRACER: Per-Tool Context Retention for LLM Agents via Consequence-Attributed Reinforcement Learning
TRACER 用轻量 REINFORCE 策略逐个工具决定上下文保留比例,奖励函数同时惩罚 token、任务失败和压缩后重调用,并用 outcome model 与“完整保留”的反事实比较来分配 credit。三种压缩后端的留出生产查询中,token 消耗较全量保留低 29 - 46%,成功率相当或更高;相比静态的工具类型策略又省 15 - 18%。这把压缩从一次性的长度预算变成会考虑后续调用成本的序贯控制问题。
–浏览

评论 · Comments