每日 Harness 开源 · Source
返回本期 · Back to 2026-07-17

论文 · Papers2026-07-17 · Friday, July 17, 2026

Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0

arxiv.org原文 ↗

Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0
论文质疑 agent optimizer 的常见报告方式:固定 benchmark 上一次优化后的提升,不等于部署中遇到新任务、新失败时收益会递归累积。它基于 Terminal-Bench 2.0 设计 continual-learning 评测,观察优化器在连续失败反馈下是否 compound。这个问题直接影响 agent 训练后维护策略,因为不能累积的优化更像一次性补丁。
浏览

评论 · Comments