每日 Harness 开源 · Source
返回本期 · Back to 2026-10-02

论文 · Papers2026-10-02 · Friday, October 2, 2026

AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks

arxiv.org原文 ↗

AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
AREX-2 在机器学习和算法编程任务上合成长时改进轨迹,训练 Qwen3.8-27B 反复审视并修正自己的答案,而不是只增加一次性推理长度。模型在 MLE-bench Lite 得分 81.8、Frontier-CS 70.7,并迁移到 BrowseComp 84.0、GAIA 92.2;预算轮数增加时分数仍上升。论文的实质贡献是把“反思”和“持续执行”作为可分离的域无关能力,代价是训练依赖可验证的合成轨迹,代码与模型尚待发布。
–浏览

评论 · Comments