Environment Evolution for Terminal Agents
arxiv.org原文 ↗
方法按代际、off-policy 地增加终端环境难度,从多轮学习目标推导三条演化方向,再用多代理 harness 生成任务。Hy4 preview、Claude Opus 5 和 GPT-5.6 Sol 的 rollout 都显示新环境更难;Qwen3.6-27B 与 35B-A3B 经过简单长程 RL 后,Terminal-Bench 2.1 分别增加 14.4 和 18.0 个百分点。
–浏览
评论 · Comments