主题大类 · Topic group
学习与自进化Learning & Self-Evolution
本主题共 72 条 · 最早 2026-05-29 · 最新 2026-07-25
2026 年 7 月25
-
Environment-free Synthetic Data Generation for API-Calling Agents
论文提出无需完整可执行 API 环境和预填充数据库即可生成工具调用训练轨迹,通过接口规范、约束与模拟状态构造调用—响应链。这样可以在真实后端昂贵、敏感或尚未部署时扩充训练数据,并覆盖罕见错误路径。方法降低数据生产门槛,但合成状态与真实服务行为之间的偏差仍决定了训练收益能否迁移。
原文 ↗– -
Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
这项工作把 masked diffusion language model 用作文本交互环境的世界模型,并引入面向轨迹属性的 steering 机制。实验覆盖 12 个任务,扩散模型在模拟真实性上优于自回归基线,且可生成更高奖励或特定行为分布的训练环境。其价值在于把“环境生成”和“环境控制”放进同一生成过程,适合缺少真实交互预算的 agentic RL。
原文 ↗– -
Ingot
Ingot 把 agent skill 的优化过程做成带证据的版本循环:运行评测、收集 trace、提出修改、对比指标,再保留可回滚版本。项目强调优化来自实际执行数据,而不是只让另一个模型重写提示词。它为 Skill 工程补上了实验管理层,真正效果取决于评测集是否代表生产任务。
原文 ↗– -
A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents
论文系统比较代码代理 LoRA 微调中的轨迹数量、成功与失败样本、步骤过滤和难度分层。实验发现,约 2,000 条经过筛选的高质量轨迹即可接近更大数据集的收益,而盲目加入失败轨迹可能拉低表现。结论把注意力从“多收集交互”转向“保留哪些决策过程”,对低成本定制代码代理具有直接工程意义。
原文 ↗– -
Autoretrieval
Autoretrieval 把检索调参做成可重复的闭环:代理只编辑 `experiment.py` 中的分块、嵌入和过滤逻辑,固定的 `run_eval.py` 用字符级重叠计算 F-beta,提升则保留,否则回滚继续搜索。项目还可从私有语料生成“问题—参考高亮”数据,使优化目标贴近实际文档,而非通用榜单。它的亮点是把代理自由度限制在可评分的实验面内;相应局限是字符重叠未必能覆盖语义正确性与下游答…
原文 ↗– -
ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
ToolVerse 面向 Tool-Integrated Reasoning,把近 400 个真实 MCP 自动转成约 4,500 个工具的可执行训练环境。任务生成依赖 tool dependency graph 与 Dynamic Unlocking Sampling,产出 GUST 数据集;训练算法则用 Turn-Aware Relative Advantage 细化长程 credit ass…
原文 ↗– -
DSWorld: A Data Science World Model for Efficient Autonomous Agents
DSWorld 预测数据科学 workflow 在候选操作后的状态转移,用结构化状态、cost-aware routing、轻量真实执行和 LLM simulator 避免昂贵 trial-and-error。论文构建 8K-scale transition trajectory dataset,并提出 Reflective World Model Optimization 做 error-awa…
原文 ↗– -
Agentic Synthesis against Counterexample-Supplemented Sketches
方法从 human-approved counterexample 出发,把修正后的行为和规则写回 code-shaped sketch,再让 coding agent 修订实现、prompt surface 和回归集。CatSynth 实验中,14 个 frozen candidate cases 有 8 个升级为 counterexamples;从 evolved sketch clean r…
原文 ↗– -
cactus-compute/needle
needle 是一个 26M 参数 function-call 模型,仓库提供权重和数据生成流程。它把小模型放在工具调用这一窄任务上,而不是追求通用聊天覆盖。开源数据生成流程让它更适合被改造成私有工具调用模型,也方便复现 function-call 数据如何合成。
原文 ↗– -
PrimeIntellect-ai/verifiers
verifiers 是 Prime Intellect 的 LLM RL environments 与 evals 库。项目提供环境、验证器和评测接口,帮助模型在任务反馈中学习或被系统化衡量。它反映出开放 LLM 训练正在从静态 SFT 数据集转向可执行环境和奖励信号工程。
原文 ↗– -
GPT-Red: Unlocking Self-Improvement for Robustness
OpenAI 介绍 GPT-Red,一个通过 self-play reinforcement learning 训练的自动红队模型。文章给出的关键数字是:GPT-Red 在间接 prompt injection arena 上达成 84% 攻击成功率,人类红队为 13%;GPT-5.6 Sol 在最难 direct prompt injection benchmark 上比四个月前最佳生产模型的失…
原文 ↗– -
Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
作者把 coding agent 的 action-observation-continuation 循环映射成函数调用形态,并用 function-aware FIM 作为中训练目标。关键机制是让模型在工具返回之后补全合理后续,而不是只学习静态代码空洞填充。它的技术含量在于训练目标贴近 agent 开发工作流,尤其是 shell、编辑器或测试反馈改变下一步操作的场景。
原文 ↗– -
Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories
论文把 DPO 扩展到多轮 agent trajectory,不再只让模型模仿专家下一步动作。Agentic-DPO 将行动选择、工具调用路径和最终结果纳入偏好优化,目标是学习哪条轨迹整体更优。它适合放在 agent training 脉络里看,因为行为克隆容易复制表面步骤,而轨迹级偏好更接近实际执行质量。
原文 ↗– -
The Illusion of Equivalency
论文分析 LLM 量化后的行为差异,指出总体准确率接近并不代表逐题行为等价。作者提出 decision-level correctness agreement,衡量原模型和量化模型在同一决策上是否同时答对或答错。它提醒部署侧不要只看压缩后平均分,因为用户遇到的是单个决策的稳定性。
原文 ↗– -
SWE-1.7 Reach Near GPT 5.5 and Opus Intelligence
Cognition 发布 SWE-1.7 模型/系统更新,标题强调其在软件工程任务上接近 GPT 5.5 和 Opus Intelligence 水平。HN 讨论页记录 205 points、112 comments,说明开发者社区对 coding-agent 竞赛线仍然高度敏感。可确认的信息焦点是软件工程 agent 系统迭代,而不是通用聊天模型发布。
原文 ↗– -
Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning
AgenticAI-Supervisor 把 API/UI 驱动的任务环境包装成类似 RL Gym 的执行环境,核心是用可验证执行结果替代静态题目打分。平台生成 high-fidelity traces,并用 multi-dimensional reward shaping 训练/优化 agent;为了抑制 reward hacking,它强调内部状态验证和测试。论文目前展示的是 Customer…
原文 ↗– -
You Only Need 1 Layer for RLVR?
The AI Timeline 这期覆盖 7 月 1 日至 7 日的 AI research/news,标题抓住 RLVR 只需一层的讨论。它把一周论文、发布和社区动向放在同一封邮件中,适合观察研究主题如何在几天内聚集。RLVR 话题本身指向推理训练、验证器和强化学习成本的再评估。
原文 ↗– -
Harness Engineering for Self-Improvement
Lilian Weng 讨论自改进 AI 系统中的 harness 设计,把 harness 看作生成任务、评价结果、提供反馈和限制搜索空间的系统组件。文章的关键点是自改进不只靠更强模型,还依赖评测、数据生成、反馈闭环和防 reward hacking 的工程设计。它把“让模型自己变好”拆成可以审视的实验系统。
原文 ↗– -
Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows
论文把 RLVR 用到 Atlassian 工作流里的工具调用 agent,奖励来自可验证的 API 调用顺序、参数完整性和任务状态,而不是只看自然语言回答。具体任务围绕 issue、workspace、project 等 SaaS 操作,强调 agent 必须按业务流程完成状态变化。它的看点是把工具调用训练从“像不像答案”推进到“外部系统是否真的被正确操作”。
原文 ↗– -
Self-Evolving Agents with Anytime-Valid Certificates
SEA 把 self-modification 限制在 frozen base model 外的小型 steering adapter 和 versioned harness 中,每次变更必须通过 anytime-valid gate,并在固定 error budget 下产生可审计 certificate。五类 verifier-in-the-loop 机制提供 grader-free sign…
原文 ↗– -
Think in English, Answer in Korean: Efficient Adaptation of Multilingual Tool-Using Agents
Cohere 与 LG CNS 的 LuckyStar 111B 是一篇很工程化的 multilingual tool agent 适配报告:从已 fully post-trained 的 Command A 继续训练,而不是重新预训练。它组合 multilingual SFT、multi-step tool-use verifiable rewards、韩文 user-facing respon…
原文 ↗– -
TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
TRIAGE 指出标准 GRPO 把最终 verifier outcome 均匀赋给所有 action token,会奖励成功轨迹里的冗余/倒退动作,也会惩罚失败轨迹里的有用探索。它让 structured judge 把 segment 标成 decisive progress、useful exploration、no-progress infrastructure 或 regression,…
原文 ↗– -
ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents
ReGRPO 关注工具调用型 VLM agent 在失败后的恢复能力,而不是只从成功轨迹做 SFT。方法先执行 near-miss actions 来收集 grounded failure observations,再构造 Reflection-of-Thought triplets,包括 ErrorType、Evidence 和 FixPlan,与纠正动作配对 warm-start;RL 阶段则…
原文 ↗– -
Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
这篇论文把失败轨迹从“丢弃的训练副产物”变成 inference-time agent 改进材料。流程让 LLM 诊断失败模式、提出推理时解决方案,并生成经轻量人工核验的代码补丁来升级 agent,而不走额外 fine-tuning。作者用 OpenCUA-72B 在 OSWorld 上验证,成功率从 42.3% 提升到 48.9%,增加 6.6 个百分点;这个结果适合与 success-only…
原文 ↗– -
ECHO: Prune to act, trace to learn with selective turn memory in agentic RL
ECHO 把上下文裁剪和 RL credit tracing 放在同一个设计里处理。每个完成的 environment turn 被压缩成带 source index 的 memory record,策略上下文按需从这些记录重建;成功终局的正向 credit 再沿 source index 回流到支持答案的证据和选择动作。BrowseComp-Plus 上 ECHO held-out accura…
原文 ↗–
2026 年 6 月44
-
OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
OPID 从 on-policy completed trajectories 中抽取 hindsight skills,episode-level skills 表示全局 workflow,step-level skills 覆盖关键局部决策。方法让旧策略在原始 context 与 skill-augmented context 下重算同一 response 的 log-probability…
原文 ↗– -
Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents
这篇论文从 RL post-training 里“免费”抽出 agent 过程奖励:RL policy 与 reference policy 的 log-probability ratio 被解释为 progress advantage,用来做 step-level scoring。作者在五个 benchmark、四个 model family 上把它用于 test-time scaling、不确…
原文 ↗– -
Diagnosing Task Insensitivity in Language Agents
论文分析 language agent 在相似但不同任务上套用训练模式的 task insensitivity。作者发现任务描述被语义破坏或替换时,模型仍可能输出原任务动作,并伴随训练期 attention 从 task tokens 漂向局部 observation。Task-Perturbed NLL Optimization 的价值在于用轻量 contrastive regularizer…
原文 ↗– -
Training Open Models for Agentic Phone Use
论文提出 PhoneBuddy,用真实手机设备和 mock 环境结合训练开放模型完成手机操作任务。真实设备运行真实应用,慢、带状态、有副作用且难重置;mock 环境更容易扩展,却只能近似真实行为。这个 recipe 的看点在于承认部署环境不可被完全模拟,并把真实交互成本纳入训练设计。
原文 ↗– -
Tmax: A simple recipe for terminal agents
Tmax 面向 terminal-using agents,给出开放 RL 训练 recipe,目标是补上终端 agent 领域缺少公开数据、稳定基线和学术评测的问题。摘要强调 terminal agents 已经成为语言模型最常见的下游应用之一,但 RL 训练研究仍受限于 benchmark、数据和简单 baseline recipe。它的贡献更像一套可复现实验底座,而不是又一个封闭终端助手结果…
原文 ↗– -
CLI-Universe
CLI-Universe 提出用于 terminal agents 的可验证任务合成引擎,目标是缓解高质量、可执行训练数据不足。论文批评旧式合成 pipeline 常把表层 artifact 改造成任务,产生模糊指令、浅执行路径和脆弱测试。它强调任务需要可执行、可测试,并产生足够强的学习信号,这对训练命令行 agent 比堆更多自然语言任务更关键。
原文 ↗– -
slime
slime 做的是大模型 RL 后训练的工程底座:Megatron 负责训练,SGLang 负责 rollout,Data Buffer 连接 prompt、生成、reward/verifier 和环境交互。README 把“生产验证”写得很具体,称 slime 支撑过 GLM-4.5 到 GLM-5.2 的后训练,并列出 Qwen、DeepSeek V3/R1、Llama 3 等模型路径。值得看…
原文 ↗– -
REVES: REvision and VErification--Augmented Training for Test-Time Scaling
REVES 用 revision 和 verification 增强训练,让模型更接近 test-time scaling 中的 sequential revision 推理流程。摘要指出标准 post-training 多优化 single-shot objectives,和多步 inference dynamics 存在错位;近期把它视作 multi-turn RL 的做法也有各自限制。这个设…
原文 ↗– -
Context-Aware RL for Agentic and Multimodal LLMs
这篇提出 ContextRL,用 context-aware reinforcement learning 改善长程推理和多模态表现。摘要里的失败例子很具体:答案可能取决于工具 trace 里的一行,或图像里一个细微细节;方法用 indirect auxiliary objective 训练模型识别这种决定性证据。对 agentic LLM 来说,这类训练目标直接对应工具使用、证据查找和多轮任务中…
原文 ↗– -
Skill-Guided Continuation Distillation for GUI Agents
SGCD 针对 GUI agent 在闭环执行中偏离专家轨迹后的状态没有监督这一问题。方法先让原策略运行几步到真实 off-trajectory states,再用技能引导策略完成任务,把 continuation plans、critical targets、failure traps 和 success criteria 生成的成功后续混入训练。它在 OSWorld-Verified 上把三个…
原文 ↗– -
STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability
STARE 分析 GRPO 的 token 级熵动态,指出 trajectory-level advantage 与 token surprisal 之间存在四象限结构和近临界现象。方法用 batch 内 surprisal quantile 选出熵关键 token,重加权其 advantage,并用 target-entropy gate 做闭环控制。实验跨 1.5B 到 32B、短 CoT、长…
原文 ↗– -
RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents
RODS 观察到 GRPO 的梯度信号集中在 rollout reward 方差最高的任务上,也就是模型刚好会一半、错一半的能力边界。方法从 400 个人类种子出发,维护约 800 个活跃样本,通过 skill-aligned resampling 持续合成多轮工具任务。它用约少 20 倍轨迹达到接近 17K 离线样本管线的表现,适合关注 RL 数据效率的人读。
原文 ↗– -
EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts
论文指出 RL rollout 的瓶颈不是普通 serving 场景的固定模型推理,而是策略持续变化、高温长生成和 batch size 逐渐缩小。EfficientRollout 从目标模型诱导量化 drafter,并用系统感知开关只在 memory-bound 阶段启用 self-speculative decoding。它最高减少 19.6% rollout latency 和 12.7%…
原文 ↗– -
Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents
S2L 把 SKILL.md 从运行时长文本变成 skill-specific LoRA adapter。离线阶段用完整 skill 文档合成 demonstrations,在线阶段省去文档注入,动态加载 adapter 来激活对应行为。Qwen3.6-27B 在 21 个 SWE-Skills-Bench skill 子集上,相对 no-skill 和 Full Skill Text pass…
原文 ↗– -
Prompt-Level Distillation: A Non-Parametric Alternative to Model Fine-Tuning for Efficient Reasoning
PLD 把 teacher 的推理模式抽取成结构化 system prompt 指令,让小模型不经参数更新就获得更强决策逻辑。作者用 Gemma-3 4B 在 StereoSet 和 Contract-NLI 上测试,Macro F1 分别从 57% 到 90.0%、从 67% 到 83%。这不是“让 prompt 更长”的简单技巧,而是把 fine-tuning 的一部分功能移到可审阅、可修改的…
原文 ↗– -
Open-SWE-Traces: Advancing Dual-Mode Multilingual Distillation for Software Engineering Agents
Open-SWE-Traces 发布 207,489 条软件工程 agent 轨迹,覆盖九种语言和 20,000 个真实 PR。数据通过 OpenHands 与 SWE-agent harness 生成,结合 Minimax-M2.5 的 thinking traces 与 Qwen3.5-122B 的 non-thinking traces,并过滤到 MIT、Apache、BSD 等宽松许可证来…
原文 ↗– -
Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
Nemotron 3 Ultra 是 550B total、55B active 的 MoE hybrid Mamba-Attention 模型。NVIDIA 报告其用 20T text tokens 预训练,随后扩展到 1M context,并经过 SFT、RL 与 MOPD post-training。LatentMoE、MTP、NVFP4 pre-training、multi-environ…
原文 ↗– -
Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale
Ling/Ring 2.6 报告描述一组从 Ling-2.0 升级而来的 trillion-parameter-scale agentic 模型。Ling-2.6 强调即时响应和每输出 token 能力,Ring-2.6 面向更深 reasoning 与复杂 workflow;架构上使用 Lightning Attention + MLA 的 hybrid linear attention。pos…
原文 ↗– -
Frontier post-training recipe review with Finbarr Timbers
Interconnects 这篇文章讨论 frontier model post-training recipe,包括 SFT、RL 和评测实践。它关注的是训练后阶段如何把 base model 变成可用助手、reasoner 或 agent,而不是重新讲预训练 scaling law。此类 recipe review 的信息密度在于把公开论文、实验经验和 eval 反馈放到同一工程框架中,便于观…
原文 ↗– -
ExpRL: Exploratory RL for LLM Mid-Training
ExpRL 用 RL-based mid-training 替代部分人工 curated reasoning traces。它把人类参考解隐藏起来,只用于生成 problem-specific grading rubrics;policy 从原 prompt 采样推理轨迹,再由 LLM judge 给 outcome-level 或 process-level dense rewards。论文报告…
原文 ↗– -
huggingface/OpenEnv
OpenEnv 是 Hugging Face 的 RL post-training environment interface library,digest 提到它采用 Gymnasium 风格 API 构建 agentic RL 执行环境。它的核心是把 agent 执行任务的环境抽象成统一接口,便于训练、评测和复现实验。它值得关注是因为 post-training 正在从静态偏好数据扩展到可交互…
原文 ↗– -
TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning
TRACE 面向 RLVR 中 rollout 成本高但 reward contrast 不足的问题,特别是多轮 ReAct rollout 里同一个 terminal reward 会被所有中间决策共享。方法把每个 thought-action-observation turn 视为树中的语义节点,在 prompt roots 和 intermediate prefixes 上自适应分配 con…
原文 ↗– -
Open Reproduction of DeepSeek-R1
Hugging Face open-r1 是 DeepSeek-R1 的开放复现实验仓库,包含 SFT、GRPO 和 synthetic data generation 脚本,并用 Makefile 串起训练、生成、评测流程。项目计划按三步推进:复现 R1-Distill、复现 R1-Zero 的纯 RL 管线、展示 base model 到 RL-tuned 的多阶段训练。README 记录 S…
原文 ↗– -
DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch
DeNovoSWE 把软件工程 agent 的目标从修 bug 扩展到从文档生成完整仓库。数据集包含 4,818 个 whole-repository generation 实例,通过沙箱化 agentic workflow 自动构建,流程采用 divide-and-conquer、critic-repair,并用 difficulty-aware trajectory filtering 平衡质…
原文 ↗– -
Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application
这篇 survey 把 agentic environments 当成一条工程生命周期来综述,覆盖 modeling、synthesis、evaluation 和 application。它从 8 个属性和 8 个领域整理代表性环境,再把自动环境合成分成 symbolic synthesis 与 neural synthesis,并讨论各自评估方式。在 agent-environment co-e…
原文 ↗– -
AsyncWebRL
AsyncWebRL 处理视觉 web agent 多步 RL 的系统低效和轨迹低效:异步重叠 rollout、梯度更新和 policy refresh,并用 everlasting rollout pool 与轻量截图处理减少等待。系统侧最高比 WebGym 端到端训练吞吐快 2.9 倍;算法侧把 GRPO 中按轨迹长度归一的问题替换为常数 1/k,减少失败长轨迹对学习信号的扭曲。它在 WebG…
原文 ↗– -
NousResearch/hermes-agent
Hermes Agent 是 Nous Research 的自改进 agent,README 把内建 learning loop 放在第一位。它能从经验创建 skills、使用中改进 skills、搜索过去会话、维护长期记忆,并支持 Telegram、Discord、Slack、WhatsApp、Signal 和 CLI。它还提供 cron、parallel subagents、RPC 工具调用以…
原文 ↗– -
Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces
OPT 构造的是“多个可行答案里找高价值方案”的优化式推理任务族。每个任务提供 feasibility checker 和 evaluator,用复杂度参数扩展搜索空间而无需新增人工标签;训练侧研究 solver-guided online policy optimization 和无 solver 时的 search-based offline RL。它的技术兴趣在于把可验证奖励从数学/代码扩展…
原文 ↗– -
When AI Builds Itself: Our progress toward recursive self-improvement
Anthropic Institute 的报告讨论 AI 辅助自身开发的进展,也就是 recursive self-improvement 从抽象风险议题进入工程测量阶段。结合当天多篇 meta-agent 和 AutoLab 论文,这类报告的焦点已经从“模型能否写代码”转向“能否持续改进 agent 系统、评测和研发流程”。
原文 ↗– -
NVIDIA-NeMo/Gym
NeMo Gym 用“environment”统一评估和训练 agent:一个环境包含 dataset、agent harness、verifier 和 per-task state。README 强调可扩展到数千并发环境,并能在评估、agent optimization 和训练之间切换;它对应的是 agent benchmark 从静态问答向可执行环境迁移。
原文 ↗– -
What Makes Interaction Trajectories Effective for Training Terminal Agents?
研究 terminal-agent post-training 中,强教师是否必然给出更好的训练轨迹。作者用 Terminal-Lego 把真实 multi-domain issue 转成可环境验证任务,发现 Claude Opus 4.6 虽在 Terminal-Bench 2.0 分数更高,但 DeepSeek-V3.2 轨迹微调出的学生泛化更强。关键解释是 Environment-Groun…
原文 ↗– -
Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories
提出受人类睡眠启发的持续学习范式,让模型把短期 in-context 记忆蒸馏进更稳定的长期参数。论文描述了 Sleep、replay consolidation 和 Dreaming 递归改进过程,用于弥合即时预测能力与长期知识转移之间的差距。它不是单纯外部 memory 检索,而是讨论 self-modification 与参数层 consolidation。这个方向的风险和评估都还会很难,但…
原文 ↗– -
InfoMem: Training Long-Context Memory Agents with Answer-Conditioned Information Gain
提出 InfoMem,用 answer-conditioned information gain 训练 chunk-wise long-context memory agents。核心奖励衡量最终 memory 对 ground-truth answer 每 token log-likelihood 的提升,而不是只看稀疏最终答案或词面重合。论文在相同 GRPO 框架和训练预算下优于可比 RL m…
原文 ↗– -
Adaptive Auto-Harness: Sustained Self-Improvement for Agentic System Deployment on Open-Ended Task Streams
提出 Adaptive Auto-Harness,用于开放任务流里的 agent harness 持续演化。它把与 oracle harness 的差距拆成 evolution loss 和 adaptation loss,并用 stateful multi-agent evolver、harness tree 的解题时路由,以及人类 steering hooks 来降低两类损失。实验覆盖 pre…
原文 ↗– -
Policy and World Modeling Co-Training for Language Agents
论文把 agent policy 与文本 world model 联合训练,让 RL rollout 同时学习动作选择和环境动态。
原文 ↗– -
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
OpenWebRL 研究视觉 Web agent 的在线多轮强化学习,重点是让 agent 在动态网页环境中交互试错,而不是只模仿静态监督轨迹。论文讨论浏览器环境、视觉观察、动作空间、奖励与长程 credit assignment 等系统问题。值得看的是,Web agent 训练正在从“看截图做 imitation”转向“在网页里持续探索并修正策略”。
原文 ↗– -
Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses
Harness-1 把搜索 agent 的证据、约束、候选答案和检查状态外置到 harness,而不是要求模型在越来越长的 transcript 中自行维护所有状态。贡献是把 RL 训练对象从纯对话策略改成模型加外部状态机,使检索、引用和验证步骤能被显式记录、检查和奖励。值得看的是,搜索 agent 的瓶颈常在跨多轮证据管理和自检,而这篇把状态管理变成了可训练接口。
原文 ↗– -
SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search
SAAS 聚焦 agentic search 的过度检索:模型在已有内部知识足够时仍继续调用搜索,增加成本和噪声。论文用 self-aware reinforcement learning 让 agent 学会判断何时检索、何时用内部知识、何时停止。它值得看在于把检索策略从“多查更好”改成可训练的成本-可靠性决策。
原文 ↗– -
LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards
LongTraceRL 用 search agent 轨迹构造更难的长上下文训练样本:读取未引用文档作为高混淆 distractors,搜索结果未打开文档作为低混淆 distractors。奖励设计使用 reasoning chain 中 gold entities 的 entity-level rubric reward,并只作用于最终答案正确的响应以降低 reward hacking。4B-3…
原文 ↗– -
Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents
论文把 agent 的 harness-updating 与 harness-benefit 拆开评估:前者是能否从执行证据写出有用的 prompt、skill、memory、tool 更新,后者是任务代理能否真正用上这些更新。核心发现是更新质量对模型基础能力并不单调,Qwen3.5-9B 生成的更新可接近 Claude Opus 4.6;收益则呈非单调形态,中档模型最受益。局限也很清楚:弱模型常…
原文 ↗– -
GrepSeek: Training Search Agents for Direct Corpus Interaction
GrepSeek 让 search agent 直接把语料库当环境,用 shell 命令查找、过滤和组合证据,而不是只调预建检索索引。训练采用两阶段:answer-aware Tutor 与 answer-blind Planner 生成冷启动轨迹,再用 GRPO 优化;并用 sharded-parallel 执行把 shell retrieval 加速最高 7.6 倍且保持字节等价。七个开放域…
原文 ↗– -
DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization
DRIFT 面向多轮交互优化,试图避开在线 RL 昂贵 rollout 与离线 SFT 分布偏移之间的两难。方法把 KL-regularized RL 等价为 importance-weighted supervised learning:从固定 reference policy 采样离线轨迹,按 return 生成权重,再做 weighted SFT。实验称可匹配或超过多轮 RL baselin…
原文 ↗– -
SCOPE: Self-Play via Co-Evolving Policies for Open-Ended Tasks
SCOPE 针对开放式任务没有标准答案、依赖 curated prompts 或 frontier judge 的问题,设计 Challenger 生成 document-grounded tasks,Solver 多轮检索作答,冻结初始模型生成 rubric 并评分。作者在 Qwen2.5、Qwen3、OLMo-3 三个 7-8B instruction-tuned models 上报告,八个开…
原文 ↗– -
It's Not Just X. It's Y
文章讨论 AI 训练栈里 post-training 的作用,反对把能力进步简单归因于“数据”。它的核心判断是 post-training 已经成为把数据转化为可用行为的工程层,包括偏好优化、RL、合成任务、评测循环和产品约束。值得看的是它把“数据叙事”和“训练后行为塑形”拆开,避免把模型能力来源讲成单变量故事。
原文 ↗–
2026 年 5 月3
-
I built an Android OS in the browser
MobileGym 在浏览器中重建移动 OS 与日常 app,用于移动 GUI agent 的可验证、可并行训练和评测。项目页给出关键数字:28 个 app、416 个参数化任务模板,programmatic state judge 在发布检查中 0 false accept/reject,而 VLM judge 在同一类轨迹上有 10.2% 误判。它值得看是因为它把 GUI agent 的难点从…
原文 ↗– -
PhoneWorld: Scaling Phone-Use Agent Environments
这篇工作的重点不是再做一个移动端 benchmark,而是把“环境供给”工程化:从真实轨迹恢复关键屏幕、状态变化和可验证目标,再生成可运行任务。它的局限也在这里:mock 应用和规则验证器能放大规模,但真实系统中的异步状态、账号权限和后端副作用仍可能被简化。
原文 ↗– -
SynthTools: A Framework for Scaling Synthetic Tools for Agent Development
SynthTools 把“工具环境”从稀缺外部资源变成可控合成对象,适合训练和回归评测;但合成 API 是否覆盖真实接口的权限、速率、异常和业务语义,是它从 benchmark 走向生产前必须继续证明的点。
原文 ↗–