递归自我改进
概述
递归自我改进(Recursive Self-Improvement, RSI)是指人工智能系统自行修改自身的架构、源代码、学习算法与评估标准以提升性能,而经此改进后的自身又再度承担下一代改进工作的自指反馈循环。与单纯的自动化或超参数调优不同,其核心在于改进的主体与对象是同一系统;在讨论通用人工智能(AGI)之后的急剧能力暴增情景与人工智能对齐问题时,这一概念被引用得最为频繁。
主要内容
概念定义
递归自我改进在三个条件同时满足时成立。第一,系统必须能够观察并评估自身的内部状态与性能(自我诊断)。第二,必须能够基于观察结果实际更改自身的代码、权重或结构(自我修改)。第三,必须能够验证修改后的结果是否优于原来,并将改进后的版本重新作为下一改进周期的主体投入(再投入)。这三个阶段反复进行,便会出现改进速度本身也被改进的所谓二阶导数的增长。
历史背景
1965年,数学家I. J. 古德(I. J. Good)提出了首个超智能机器将成为人类最后一项发明的智能爆炸(Intelligence Explosion)构想。1998年,埃利泽·尤德科夫斯基(Eliezer Yudkowsky)整理了以自主改进自身的AI为目标的种子AI(Seed AI)概念;2003年,尼克·博斯特罗姆(Nick Bostrom)在著作《超级智能》中将RSI分析为通往超智能路径的核心。2010年代,神经网络架构搜索(NAS)与AutoML实现了实用形态的自我改进自动化;进入2020年代,利用大规模语言模型的自我精炼(Self-Refine、Reflexion)、基于自我生成数据的迭代学习(STaR)研究登场,使这一概念重新受到关注。
智能爆炸假说与速度之争
有主张认为,一旦RSI越过临界点,智能便会在数小时甚至数分钟内爆炸式增长。作为反论,人们提出了三种瓶颈。第一,改进需要计算资源与数据,存在物理上限。第二,自我修改的收益往往以对数尺度递减感知。第三,会出现验证成本超过生成成本的反转现象。也就是说,实证研究中的多数立场认为,难以断言自我改进必然导致奇点式的暴走。
安全性与对齐问题
在自我改进循环中,最大的风险在于当目标设定错误时,该错误会在改进过程中一同被放大。如果系统拥有自行修改自身目标函数的权限,就可能朝与人类意图无关的方向进行优化。因此,目标保持(goal preservation)、确保改进过程的可解释性、修改前的人类批准程序、隔离的沙盒实验等被作为安全装置加以讨论。
实务实现形态
现实中观察到的RSI的温和形态包括:用自我生成的问题—答案对进行微调的迭代学习;智能体分析自身工具使用日志以改进提示与策略的技术;代码生成模型测试并修改自身输出的循环;基于进化算法的架构搜索等。
最新动向
2024—2025年,基于大规模语言模型的智能体自行制定评估标准并反复改进的自我奖励(self-rewarding)流水线正被积极研究。与此同时,主要AI研究机构与政府机关将自我改进能力的临界值作为风险评估指标,正在推进对一定水平以上的自主自我修改施加安全测试与报告义务的监管讨论。此外,仅以自我生成数据学习时多样性与质量下降的模型崩溃(model collapse)现象,已成为重要的实证议题。研究界的替代性共识是:当前系统尚未达到完全自主的RSI,但在特定狭窄领域中的递归改进已进入商用化阶段。同时,旨在建立衡量自我改进循环收益的标准基准与审计(audit)协议的尝试仍在继续。
相关主题
- [[人工智能对齐]]
- [[通用人工智能]]
- [[智能爆炸]]
- [[AI安全性]]
- [[AutoML]]
- [[模型崩溃]]