综述 | The Path to Recursive Self-Improving Agents: Foundation, Framework, and Future Directions
作者|Shuaiqi Liu*, Zhengkai Lin*, Yuxiang Zhang*, Yuanyi Ren*, Yue Wu, Yongbin Li, Zheng Wang, Zhihang Fu*, Jieping Ye — Alibaba Group
论文下载: https://www.preprints.org/frontend/manuscript/3c41418aa2e782b90ee5da995565ecac/download_pub
论文 GitHub 项目:https://github.com/D2I-ai/awesome-recursive-self-improving-agents/blob/main/README.zh-CN.md
项目主页:递归自改进智能体之路
目前基于大模型的智能体系统已经能完成越来越复杂的任务,但有个关键瓶颈:这些智能体系统的改进仍依赖人类专家。
诊断问题、重新设计、实现修改、验证效果,每一轮对智能体系统的迭代改进都需要投入大量人力和时间。这限制了对智能体系统改进的效率和覆盖范围。
这就引出了一个自然的问题:能不能让智能体系统自己改进自己?
更进一步 —— 能不能让智能体系统连「改进自己的方法」也一起改进?
这篇综述 《The Path to Recursive Self-Improving Agents: Foundation, Framework, and Future Directions》, 围绕以上两个问题展开,主要研究自改进智能体系统,以及其更强形式:递归自改进智能体系统。
这篇综述主要有四方面的贡献:
1)给出自改进 Agent 系统和递归自改进 Agent 系统的形式化定义,并提出衡量自改进能力的分级标准(五级 L1–L5);
2)提出了一个研究框架,对智能体系统的自改进进行统一建模,包含改进的对象和改进的过程;
3)系统性地总结了现有相关工作,并归纳出了一套分类体系;
4)归纳总结了关键的开放问题,可作为未来的研究方向。
统一研究框架
论文提出了一个研究框架,统一地建模智能体系统的自改进
自改进 Agent 系统的统一研究框架:

这个框架回答两个核心问题:
- 改进的对象(改进什么?) —— 模型 Mt、Agent Harness Ht、Agent 数据系统 Dt、Trainer Tt ,乃至改进机制本身 Impt,都可以是改进的目标, xt = {Mt, Ht, Dt, Tt, Impt}
- 改进的过程(怎么改进?)—— 改进过程可以抽象总结为: 诊断瓶颈(Diagnose)→ 提出修改(Propose)→ 评估修改(Evaluate)→ 整合修改(Integrate)四个阶段。自改进过程表示为: xt+1 = Impt (xt)
这个框架的价值在于:
1)它把原本分散在不同子方向(Prompt 优化、记忆系统、Skills、数据合成……)的研究纳入统一的研究框架下。相关的其他范式可作为该研究框架中的特殊形式。
2)对整个系统进行统一建模,而不只是改进固定的组件,有利于识别系统中动态变化的瓶颈,实现可持续的改进,并更加全面地审视改进带来的效果。
3)对整个系统进行统一建模时,不仅建模各个组件本身,还建模各组件间的依赖关系;这有利于评估改进一个组件对其他组件的影响,也有利于研究各组件间的协同改进。
自改进能力分级
论文提出了衡量自改进能力的分级标准(五级 L1–L5)
文中按以下标准对相关的工作进行了分级:
- L1: 人工改进 Manual Improvement
- L2: 辅助改进 Assisted Improvement
- L3: 固定机制的自改进 Programmatic Self-Improvement
- L4: 受限领域的递归自改进 Bounded Recursive Self-Improvement
- L5: 通用递归自改进 General Recursive Self-Improvement

文献分类体系
基于这个框架,论文对相关工作进行了系统的梳理,按改进的对象来划分现有工作:
- Agent Harness自改进(第 3 节)
- Agent数据系统自改进(第 4 节)
- Agent Trainer自改进(第 5 节)
- 跨组件协同改进(第 6 节)
相关工作的分类体系(Taxonomy)总结如下图所示:

Agent Trainer 自改进

开放研究问题
1)在贴近真实生产的任务上对改进效果进行长周期的评测
2)对Agent友好的可观测、可扩展、可修改的训练和推理基础设施
3)从受限递归自改进到通用递归自改进
4)递归自我修改下的安全与可控
5)人类专家与智能体协同改进
(第 7 节)
如果本文对您有所帮助,欢迎引用:
@article{202608.0051,doi = {10.20944/preprints202608.0051.v1},url = {https://doi.org/10.20944/preprints202608.0051.v1},year = 2026,month = {August},publisher = {Preprints},author = {Shuaiqi Liu and Zhengkai Lin and Yuxiang Zhang and Yuanyi Ren and Yue Wu and Yongbin Li and Zheng Wang and Zhihang Fu and Jieping Ye},title = {The Path to Recursive Self-Improving Agents: Foundation, Framework, and Future Directions},journal = {Preprints}
}
欢迎交流探讨
论文下载: https://www.preprints.org/frontend/manuscript/3c41418aa2e782b90ee5da995565ecac/download_pub
论文 GitHub 项目:https://github.com/D2I-ai/awesome-recursive-self-improving-agents/blob/main/README.zh-CN.md
项目主页:递归自改进智能体之路
