DRSR: Learning Set-Level Deletion Risk for Efficient Long-Horizon Agents
arxiv.org原文 ↗
DRSR 联合删除协议允许的一组 history blocks,用 teacher-forced likelihood 变化产生反事实监督;在线评分器同时看动作前状态、删除/保留关系和集合交互,在 recency、预算和风险约束下尽量多删,找不到安全集合就 abstain。WorkBuddyBench Full260 的平均 reward 从 0.699 升至 0.802,token 减少 20.820%;固定 Eval40 上节省 35.850%。这些数字支持集合级风险比独立块分数更适合长程代理。
–浏览
评论 · Comments