ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

自演化智体概览:在通往超级人工智能的道路上,应该演化什么、何时演化、如何演化以及在哪里演

自演化智体概览:在通往超级人工智能的道路上,应该演化什么、何时演化、如何演化以及在哪里演 25年7月-26年1月来自普林斯顿、清华、CMU、悉尼、上海交大、宾州州立、密歇根、俄勒冈州立、港中文大学、复旦、港科技大学广州、港大、UCSB、UCSD、爱丁堡大学和UIUC的论文“A Survey of Self-Evolving AgentsWhat, When, How, and Where to Evolve on the Path to Artificial Super Intelligence”。大语言模型LLM在各种任务中展现了卓越的能力但其本质上仍然是静态的无法根据新的任务、不断发展的知识领域或动态的交互环境调整其内部参数。随着LLM越来越多地部署在开放式的交互式环境中这种静态特性已成为一个关键的瓶颈因此需要能够实时自适应地推理、行动和演化的智能体。这种范式转变——从扩展静态模型到开发自演化智体——激发了人们对能够从数据、交互和经验中持续学习和适应的架构和方法的浓厚兴趣。本综述首次系统全面地回顾了自演化智体并围绕三个基本维度——演化什么、何时演化以及如何演化——对该领域进行了梳理。考察了智体各组件例如模型、内存、工具、架构的演化机制按阶段例如测试内、测试间对适应方法进行分类并分析了指导演化适应的算法和架构设计例如标量奖励、文本反馈、单智能体和多智体系统。此外我们还分析了专为自演化智体量身定制的评估指标和基准重点介绍了其在编码、教育和医疗保健等领域的应用并指出了安全性、可扩展性和协同演化动力学方面的关键挑战和研究方向。通过提供一个用于理解和设计自演化智体的结构化框架本综述为在研究和实际部署中推进更具适应性、更强大、更稳健和更通用的智体系统制定了路线图并最终阐明了实现人工超级智能ASI的愿景即智体能够自主演化并在广泛的任务中超越人类智能水平。如图1 所示沿着这个发展轨迹智能和适应性不断提升标志着人工智能系统向更加自主和智能化的转变。自演化智体之后的未来发展方向仍然开放并将持续探索。如图3 所示自演化智体在关键维度上的变化。“演化内容”分解了智体的各个组成部分模型、上下文、工具和架构并展示了演化发生的环节。“演化时机”区分了测试内自演化和测试间自演化分别对应于ICL、SFT和RL范式。“演化方式”总结了方法论家族——基于奖励的方法、模仿与示范的方法以及基于种群的方法——以及一些贯穿各章节的维度例如在线/离线、策略开启/关闭和奖励粒度。“演化应用领域”对比了通用部署和特定领域部署例如编码、图形用户界面、金融、医疗、教育。“评估”概述了目标和指标——适应性、泛化能力、效率和安全性——以及相应的评估范式静态、短期和长期。总体而言该分类体系描绘综述的推理流程明确演化的内容、时间和方式为评估和推进自演化智体奠定基础。如图4 所示2022 年至 2025 年几个具有代表性的自演化智体框架的演化图。该图按时间顺序组织具有自主规划、工具使用和持续自我改进等能力的自演化智体发展中的主要研究里程碑。为了提供概念边界引入了自我进化智体的操作定义。自进化智体是根据其自身轨迹或反馈信号修改其内部参数、上下文状态、工具集或架构拓扑的智体其明确目标是提高未来性能。该定义包含三个包含标准i更新必须依赖于经验由轨迹、自生成数据或环境反馈驱动专门针对智体的策略限制或能力边界而不是通用数据合成 (ii) 更新必须产生持久的、改变策略的效果而不是短暂的指令遵循行为 iii系统必须拥有自主探索或自主学习的机制即使它也利用预先收集的数据。为了清楚起见我们使用“被动”来表示仅由外部提供的数据或时间表触发的学习使用“主动”来表示自我发起的探索、反思或结构修改即使用自我反思来收集数据明确排除静态管道例如标准蒸馏其中数据生成与智体的交互历史无关。随着这个领域的迅速形成无需人工干预的完全自主的自我进化代表了一个理想的目标而不是当前的规范。在本次综述中没有设定严格的排除门槛从而忽视早期发展。相反分析促进自我进化范式的机制从原始进化例如迭代引导或反馈驱动的提示到强大的自我进化完全自主的诊断和重新配置能够全面了解不同的方法如何促进范式向完全自主发展的“什么、何时和如何”。如图5 所示演化时机概述。上部分展示测试内自演化其中适应例如变体生成、验证和策略更新发生在任务执行过程中。下部分展示了测试间自演化其中学习通过部署、轨迹分析和策略更新进行回顾性演化。随着时间的推移对自演化智体的研究经历了三大范式——基于奖励的演化、基于模仿的演化和基于种群population的演化——每一种范式的出现都是为了弥补前一种范式的不足。基于奖励的方法首先通过显式信号闭合反馈回路但其脆弱性和高成本是其缺点。基于模仿的学习通过利用高质量的示范来稳定演化但有时会以牺牲探索为代价。基于种群的演化随后将适应性扩展到集体尺度强调多样性和涌现的协调性。总而言之这些范式勾勒出一条从个体自我改进到集体智能的连贯发展轨迹。如图6所示概述基于奖励的自我进化策略将其分为文本奖励、隐性奖励、内部奖励和外部奖励每种奖励都与不同的反馈来源和机制相关联。智体自进化是一个多方面的过程其特征在于许多交叉维度这些维度塑造了智体如何随时间学习、适应和改进。这些维度超越任何单一的学习算法或监督信号定义了自主智体设计和分析的核心原则。如图7所示智体自我进化背后的交叉进化维度。学习范式离线学习中数据预先收集并用于过滤和微调而在线学习中智体持续与其环境交互以实现实时适应。策略一致性策略内进化基于智体自身的轨迹更新策略策略外进化则依赖于回放缓冲区、人类示范或其他智体的经验。奖励粒度反馈可以是基于过程的步骤级奖励、基于结果的最终结果奖励或两者的混合。这三个正交轴共同定义了智体如何在基于奖励、基于模仿和基于种群的进化范式中生成数据、调整策略并接收反馈。本文沿着几个关键轴系统地比较主要的自进化方法——基于奖励的方法、基于模仿/示范的方法和基于种群的方法——例如学习范式在线与离线、策略一致性策略内与策略外以及奖励粒度基于过程、基于结果或混合。进一步强调了其他维度包括反馈类型、数据来源、样本效率、稳定性和可扩展性如表 4 所示。这种全面的比较为理解不同智体演化方法中固有的优势、局限性和设计权衡提供了一个统一的视角。如图8所示 将进化方向分为两大类通用域进化侧重于在各种任务中提升广泛的能力例如记忆机制、协同进化、课程努力以及特定域进化侧重于在编码、图形用户界面、金融、医疗、教育等领域的特定领域专业知识。如图9所示自演化智体的评估目标和范式概述。左图评估目标和指标。总结指导智体评估的五个核心目标适应性、保持性、泛化性、效率和安全性这些目标反映了智体应如何随时间演化和表现。右图评估范式。评估方法按照时间尺度递增的顺序组织从对固定能力的静态评估例如外部任务解决和组件级评估到捕捉任务内适应性的短期自适应评估例如增强型或动态基准最终到考察在不断演化或终身基准下持续改进的长期终身学习评估。这些维度共同将自演化的目标与用于衡量这些目标的评估设置联系起来形成了一个用于评估智体适应性和可持续性的统一框架。以下略。
返回列表