自演化智体概览:在通往超级人工智能的道路上,应该演化什么、何时演化、如何演化以及在哪里演
25年7月-26年1月来自普林斯顿、清华、CMU、悉尼、上海交大、宾州州立、密歇根、俄勒冈州立、港中文大学、复旦、港科技大学(广州)、港大、UCSB、UCSD、爱丁堡大学和UIUC的论文“A Survey of Self-Evolving Agents:What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence”。
大语言模型(LLM)在各种任务中展现了卓越的能力,但其本质上仍然是静态的,无法根据新的任务、不断发展的知识领域或动态的交互环境调整其内部参数。随着LLM越来越多地部署在开放式的交互式环境中,这种静态特性已成为一个关键的瓶颈,因此需要能够实时自适应地推理、行动和演化的智能体。这种范式转变——从扩展静态模型到开发自演化智体——激发了人们对能够从数据、交互和经验中持续学习和适应的架构和方法的浓厚兴趣。
本综述首次系统全面地回顾了自演化智体,并围绕三个基本维度——演化什么、何时演化以及如何演化——对该领域进行了梳理。考察了智体各组件(例如模型、内存、工具、架构)的演化机制,按阶段(例如测试内、测试间)对适应方法进行分类,并分析了指导演化适应的算法和架构设计(例如标量奖励、文本反馈、单智能体和多智体系统)。此外,我们还分析了专为自演化智体量身定制的评估指标和基准,重点介绍了其在编码、教育和医疗保健等领域的应用,并指出了安全性、可扩展性和协同演化动力学方面的关键挑战和研究方向。通过提供一个用于理解和设计自演化智体的结构化框架,本综述为在研究和实际部署中推进更具适应性、更强大、更稳健和更通用的智体系统制定了路线图,并最终阐明了实现人工超级智能(ASI)的愿景,即智体能够自主演化并在广泛的任务中超越人类智能水平。
如图1 所示:沿着这个发展轨迹,智能和适应性不断提升,标志着人工智能系统向更加自主和智能化的转变。自演化智体之后的未来发展方向仍然开放,并将持续探索。
如图3 所示:自演化智体在关键维度上的变化。“演化内容”分解了智体的各个组成部分:模型、上下文、工具和架构,并展示了演化发生的环节。“演化时机”区分了测试内自演化和测试间自演化,分别对应于ICL、SFT和RL范式。“演化方式”总结了方法论家族——基于奖励的方法、模仿与示范的方法以及基于种群的方法——以及一些贯穿各章节的维度,例如在线/离线、策略开启/关闭和奖励粒度。“演化应用领域”对比了通用部署和特定领域部署(例如,编码、图形用户界面、金融、医疗、教育)。“评估”概述了目标和指标——适应性、泛化能力、效率和安全性——以及相应的评估范式(静态、短期和长期)。总体而言,该分类体系描绘综述的推理流程:明确演化的内容、时间和方式,为评估和推进自演化智体奠定基础。
如图4 所示2022 年至 2025 年几个具有代表性的自演化智体框架的演化图。该图按时间顺序组织具有自主规划、工具使用和持续自我改进等能力的自演化智体发展中的主要研究里程碑。
为了提供概念边界,引入了自我进化智体的操作定义。自进化智体是根据其自身轨迹或反馈信号修改其内部参数、上下文状态、工具集或架构拓扑的智体,其明确目标是提高未来性能。
该定义包含三个包含标准:(i)更新必须依赖于经验,由轨迹、自生成数据或环境反馈驱动,专门针对智体的策略限制或能力边界,而不是通用数据合成; (ii) 更新必须产生持久的、改变策略的效果,而不是短暂的指令遵循行为; (iii)系统必须拥有自主探索或自主学习的机制,即使它也利用预先收集的数据。为了清楚起见,我们使用“被动”来表示仅由外部提供的数据或时间表触发的学习,使用“主动”来表示自我发起的探索、反思或结构修改(即使用自我反思来收集数据),明确排除静态管道(例如标准蒸馏),其中数据生成与智体的交互历史无关。
随着这个领域的迅速形成,无需人工干预的完全自主的自我进化代表了一个理想的目标,而不是当前的规范。在本次综述中,没有设定严格的排除门槛,从而忽视早期发展。相反,分析促进自我进化范式的机制,从原始进化(例如,迭代引导或反馈驱动的提示)到强大的自我进化(完全自主的诊断和重新配置),能够全面了解不同的方法如何促进范式向完全自主发展的“什么、何时和如何”。
如图5 所示演化时机概述。上部分展示测试内自演化,其中适应(例如,变体生成、验证和策略更新)发生在任务执行过程中。下部分展示了测试间自演化,其中学习通过部署、轨迹分析和策略更新进行回顾性演化。
随着时间的推移,对自演化智体的研究经历了三大范式——基于奖励的演化、基于模仿的演化和基于种群(population)的演化——每一种范式的出现都是为了弥补前一种范式的不足。基于奖励的方法首先通过显式信号闭合反馈回路,但其脆弱性和高成本是其缺点。基于模仿的学习通过利用高质量的示范来稳定演化,但有时会以牺牲探索为代价。基于种群的演化随后将适应性扩展到集体尺度,强调多样性和涌现的协调性。总而言之,这些范式勾勒出一条从个体自我改进到集体智能的连贯发展轨迹。
如图6所示概述基于奖励的自我进化策略,将其分为文本奖励、隐性奖励、内部奖励和外部奖励,每种奖励都与不同的反馈来源和机制相关联。
智体自进化是一个多方面的过程,其特征在于许多交叉维度,这些维度塑造了智体如何随时间学习、适应和改进。这些维度超越任何单一的学习算法或监督信号,定义了自主智体设计和分析的核心原则。
如图7所示智体自我进化背后的交叉进化维度。学习范式:离线学习中,数据预先收集并用于过滤和微调;而在线学习中,智体持续与其环境交互以实现实时适应。策略一致性:策略内进化基于智体自身的轨迹更新策略;策略外进化则依赖于回放缓冲区、人类示范或其他智体的经验。奖励粒度:反馈可以是基于过程的(步骤级奖励)、基于结果的(最终结果奖励),或两者的混合。这三个正交轴共同定义了智体如何在基于奖励、基于模仿和基于种群的进化范式中生成数据、调整策略并接收反馈。
本文沿着几个关键轴系统地比较主要的自进化方法——基于奖励的方法、基于模仿/示范的方法和基于种群的方法——例如学习范式(在线与离线)、策略一致性(策略内与策略外)以及奖励粒度(基于过程、基于结果或混合)。进一步强调了其他维度,包括反馈类型、数据来源、样本效率、稳定性和可扩展性,如表 4 所示。这种全面的比较为理解不同智体演化方法中固有的优势、局限性和设计权衡提供了一个统一的视角。
如图8所示 将进化方向分为两大类:通用域进化,侧重于在各种任务中提升广泛的能力(例如,记忆机制、协同进化、课程努力);以及特定域进化,侧重于在编码、图形用户界面、金融、医疗、教育等领域的特定领域专业知识。
如图9所示自演化智体的评估目标和范式概述。左图:评估目标和指标。总结指导智体评估的五个核心目标:适应性、保持性、泛化性、效率和安全性,这些目标反映了智体应如何随时间演化和表现。右图:评估范式。评估方法按照时间尺度递增的顺序组织:从对固定能力的静态评估(例如,外部任务解决和组件级评估),到捕捉任务内适应性的短期自适应评估(例如,增强型或动态基准),最终到考察在不断演化或终身基准下持续改进的长期终身学习评估。这些维度共同将自演化的目标与用于衡量这些目标的评估设置联系起来,形成了一个用于评估智体适应性和可持续性的统一框架。
以下略。
