APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question Answering
arxiv.org原文 ↗
APEx 把历史分成实例级 trajectory memory 与类别级 procedural skill,由 Executor、Distiller、Planner 构成闭环,并用三阶段交替 GRPO 让技能蒸馏受奖励驱动。测试阶段技能作为 Planner 的程序先验,配合无真值 test-time RL 和 skill-alignment 正则,试图同时获得适应性与稳定性。七个基准的报告结果比 GPT-5.4 高 14.7 个百分点,比最强 memory-augmented baseline 高 3.0 个百分点。
–浏览
评论 · Comments