Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement
arxiv.org原文 ↗
GAI 将 agent 表示成可修改组件的配置,把学习写成“评估→改进”的循环,并用两个坐标区分传统 GPI 与 RSI:改进机制是否在 agent 内、评价标准是否来自外部。沿这两个轴,论文把 anchored、goal-drift 和 fully self-referential 系统放进同一图景。贡献主要是可比较的形式语言,尚未给出一个能替代具体训练算法的统一实现。
–浏览
评论 · Comments