SEAGym 不是只给自演化 Agent 一个最终 task score,而是记录 harness 更新过程本身:prompt、memory、tools、middleware、runtime state 和 model-tool loop 如何变化。它把 Harbor-compatible benchmark 变成带 train batches、frozen update-validation、held-out ID/OOD views、replay diagnostics、snapshot 与 cost records 的动态评估环境。在 Terminal-Bench 2.0 和 HLE 上,作者用同一 epoch/batch protocol 比较 ACE、TF-GRPO、AHE,观察到频繁更新可能不提升 held-out performance,某些中间 snapshot 有用但后续会 collapse;这类信号适合排查“自改进”到底是在泛化还是在漂移。
–浏览
评论 · Comments