返回本期 · Back to 2026-06-24 论文 · Papers2026-06-24 · Wednesday, June 24, 2026 Tmax: A simple recipe for terminal agents arxiv.org原文 ↗ Agent RL / 可验证奖励合成数据与训练环境基准计算机·Web Tmax 面向 terminal-using agents,给出开放 RL 训练 recipe,目标是补上终端 agent 领域缺少公开数据、稳定基线和学术评测的问题。摘要强调 terminal agents 已经成为语言模型最常见的下游应用之一,但 RL 训练研究仍受限于 benchmark、数据和简单 baseline recipe。它的贡献更像一套可复现实验底座,而不是又一个封闭终端助手结果。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments