当人工智能开始自己造自己,人类还握得住方向盘吗?
2026-07-21 16:59:51

一个曾经只出现在哲学家和未来学家讨论中的概念——递归自我改进(Recursive Self Improvement,简称RSI),最近突然成了人工智能领域的焦点。RSI的意思很简单,就是人工智能系统介入对自身的改进,由此形成“能力提升—研发能力增强—能力再提升”的正反馈。如果这个循环真的转起来,人工智能的能力就有可能进入指数级增长,彻底改变技术演进的方式。问题是,RSI到底走到哪一步了,它意味着什么,我们又该怎样应对。



从2025年开始,多家公司陆续宣称自己的模型出现了RSI的迹象。去年5月,谷歌DeepMind发布AlphaEvolve,这个系统开始利用Gemini模型生成候选算法,自动评估并演化搜索保留更好的方案,用于优化数据中心调度、芯片设计和人工智能训练流程。2026年2月,Open人工智能推出GPT-5.3-Codex时公开表示,该模型的早期版本已经在创建自身的过程中发挥了重要作用,包括监控和调试训练过程、管理部署、分析测试结果,甚至帮助研究人员处理训练中的异常问题。不久后,Meta的研究人员也发布了HyperAgents,它能对负责修改任务智能体的“元智能体”本身进行修改,离RSI的闭环又近了一步。


真正把RSI推到公众面前的,是Anthropic在2026年6月发布的一份报告,名字就叫《当人工智能开始建造自身》。报告披露,截至2026年5月,Anthropic代码库中超过80%的合入代码是由Claude编写的。更关键的是,Claude智能体已经可以自主提出假设、检验假设,并累计执行了大约800小时的开放式人工智能安全研究实验。基于这些事实,Anthropic认为,完整的RSI虽然还没有实现,也未必一定出现,但它到来的时间可能会早于多数机构做好准备的时间。如果趋势继续下去,人工智能能力增长的速度可能很快超过社会治理和安全研究的应对能力。因此,他们提出应当建立一种协调且可核查的减速或暂停机制。在此之前,Open人工智能也呼吁对能力最强的前沿模型进行评估,建立独立评估生态,并优先监测RSI的进展。


为什么RSI这么重要?从根本上说,因为它可能颠覆人工智能的研发方式。在传统的技术研发里,机器可以帮人类生产机器,却不能独立决定下一代机器如何设计。提出科学假设、判断研究方向、选择技术路线,这些都是人类的事。但人工智能具备了一定的认知能力,可以介入研究设计工作,把自己的智能直接用在提高自身智能上。这种循环一旦确立,人工智能的研发效率就可能爆炸式增长。1965年,英国数学家古德就提出过“智能爆炸”的设想。他说,如果一台机器在智力活动上超过人类,而设计机器本身就是一种智力活动,那么这台机器原则上就能设计出比自己更强的机器,更强的机器又能设计出更强的下一代,如此不断循环,第一台真正的超智能机器可能成为人类需要完成的最后一项发明。这就是RSI思想的最早来源。


2008年,研究者尤德科夫斯基明确界定了RSI:人工智能重写自己的认知算法,让原来只作用于对象的智能开发能力反过来作用于自身,从而闭合循环。2014年,哲学家波斯特洛姆在《超级智能》一书中做了更深入的讨论。他指出,人工智能智能演进的速度取决于“优化能力”与“改进阻力”的比值。优化能力是为提高系统智能所投入的资源和设计努力,改进阻力则是拖慢系统提升的力量。优化能力越强,改进阻力越小,智能演化速度就越快。RSI的意义在于大幅提升优化能力,因为系统越聪明,就越容易发现新算法、设计更好的训练方法、提高计算效率,从而进一步优化自身。但波斯特洛姆也强调,RSI本身并不等于智能爆炸。随着时间推移,容易实现的改进会耗尽,数据可能枯竭,算力和电力也会变得不足,这些都会增加改进阻力,拖慢演化速度。


比起爆炸式增长,波斯特洛姆更看重另一个后果:RSI会改变人和人工智能在研发中的比重。一旦人工智能能够自我改进,它很快就会跨过临界点,之后人类工程师的角色将逐渐边缘化,人工智能自己将成为研发的主力。这样一来,人工智能的再生产就不再像是人造机器的生产过程,而更接近于生物的繁衍。后来,图尔钦和邓肯伯格按照是否具备自我改进能力,把人工智能的发展阶段划分成两个阶段:没有自我改进能力的叫“狭义人工智能”,开始具备这种能力但还没成为成熟超级智能的阶段叫“青年人工智能”。在前一个阶段,人工智能是工具;进入青年人工智能阶段后,人工智能就有了自我提升和自我进化的能力。现实中,人工智能的改进往往和任务执行交替进行,还需要人的介入,而RSI实现后,整个过程就不再需要人了。因此,RSI不但能让研发全面自动化,还能进一步提高任务执行的自动化程度。


RSI带来的风险,并不仅仅是科幻片里的那种终极威胁。当然,有人会联想到,在RSI作用下,人工智能可能很快凌驾于人类之上,通用人工智能和超级人工智能迅速到来,甚至产生自我意识,反过来奴役或消灭人类。这种可能性虽不能完全排除,但RSI带来的近在眼前的风险同样严重。即便人工智能还没达到通用水平,它的危险也不可小视。人工智能可以被用来发动网络攻击、传播虚假信息,还可能协助制造或扩散大规模杀伤性武器。过去,这些风险的制造和扩散都需要人参与,可控程度相对高一些。可一旦人工智能具备了RSI能力,攻击的发生概率和危害扩散速度就可能成倍增长,控制难度也随之加大。


其中一类风险是自主化的黑客攻击。现在的黑客攻击网络需要不断试错,程序攻不破系统就得由人来升级。如果人工智能可以自我改进,就能根据失败结果自动调整和升级攻击程序,攻击效率大幅提高,破坏力也会上升。另一类风险是军事化倾向。即使一个人工智能系统最初没有明确的攻击目标,只要它预期还有其他竞争系统存在,就可能把增强防御、发现对方弱点、控制关键资源、提高威慑能力当作实现自身目标的必要手段。多个国家如果都在军事领域部署具有RSI能力的人工智能,军备竞赛很可能加剧,擦枪走火的风险也会增加。如果人工智能通过RSI真的达到通用智能甚至超级智能水平,风险可能突然放大。在刚刚达到通用智能、尚未完全摆脱外部控制时,电力、算力等关键资源仍掌握在人类手里,理论上人类可以切断供应。但人工智能可能会采用欺骗手段,诱使人类放弃对关键资源的控制。


RSI还会打乱我们应对风险的方式。现在对待人工智能风险,大家常用的是“亡羊补牢”式的做法,看到风险再处理。技术迭代过程相对可观察、可控制时,这套做法还能勉强应付。图灵奖得主杨立昆曾拿飞机等技术打比方,认为人工智能安全可以通过持续渐进的工程改进来实现,就像看到水位上涨一点,就把堤坝加高一点。但这种方式起效的前提是,风险必须逐步暴露并能被及时发现。在RSI实现之后,风险爆发的速度和频率都可能大幅上升,同时因为自动化程度提高,人们发现风险的能力反而可能下降。这时候我们面对的不再是缓慢上涨的水位,而是突然到来的巨浪,一寸寸加高堤坝的方法显然不够用了。


既然RSI风险这么大,开发者能不能给人工智能系统加把“锁”,故意增加改进阻力来放缓演进速度呢?图尔钦和邓肯伯格的回答比较悲观。他们认为理论上可以,但如果缺乏外部约束,竞争压力会让开发者缺乏真正这样做的动力。当前的市场情况已经部分印证了这一点。尽管Anthropic提议建立协调且可核查的减速或暂停机制,Open人工智能呼吁加强监测评估,但至少从公开信息来看,没有哪家主要人工智能企业因此单方面放缓自家模型的发展。对相互竞争的企业来说,被对手挤出市场的风险,比RSI可能带来的远期风险更现实、更直接。


现在最重要的问题是,RSI到底实现了没有?回答取决于定义。从去年开始,多家企业说在自己的模型中看到了RSI的迹象,但理解各不相同。有的认为人工智能能参与编写改进自身的代码就算,有的认为人工智能参与了新版本的设计开发才算。广义上这些都可以看作是RSI的某种表现,但对分析安全问题来说,这样的定义太模糊了。结合波斯特洛姆等人的讨论和现实需要,可以把完整的RSI概括为五个环节:第一,人工智能系统能识别自身能力上的不足;第二,能提出新的算法、模型结构或训练方法;第三,能实施这些修改,训练或生成新的系统版本;第四,能独立评价新版本是否真正改进了,有没有产生新的安全问题;第五,新版本能继续完成下一轮改进,并逐轮减少对人类的依赖。



用这个标准来看,现阶段的公开案例还没有实现完整的RSI。GPT-5.3-Codex虽然参与了自身训练和部署,但训练目标、基础架构、算力配置和最终决策仍由Open人工智能团队控制。Claude能写大量代码和执行实验,但选择研究问题、判断结果重要性、决定哪些发现进入下一代模型的权力仍在人类手里。AlphaEvolve能发现更高效算法,但依赖人预先设定的评价函数,只有能快速自动验证的问题才适用,人工智能本身不能决定评价标准。HyperAgents尽管非常接近字面意义上的自我修改,但修改的主要是智能体程序、工具组合和任务流程,并没有重新训练基础模型,而且运行范围、测试环境和计算资源也由人类提供。所以,现在各家所说的RSI,至多只能叫“部分递归”或“弱RSI”,离完整、可持续且较少依赖人类的RSI还有相当距离。但也不能就此放松警惕。部分递归一旦和更长时间的自主运行、更广泛的工具权限、更多计算资源结合,就可能迅速补齐闭环。判断RSI是否临近,不能只看模型本身的能力,还要看它在现实系统中拿到了哪些权限。


面对可能到来的RSI,Open人工智能和Anthropic分别提出了方案。Open人工智能更强调公共评估、预警和监测,主张强化美国人工智能标准与创新中心的作用,由该中心评估最强的前沿模型,建立由大学、独立机构和第三方机构参与的独立评估生态,重点监测研发自动化和RSI的进展。他们还建议政府研究模型隔离和控制预案、安全事件报告制度,以及协调国际监管的治理机构。Anthropic的方案更侧重政府、独立机构和企业之间的合作。他们把生物风险、网络风险、失控风险和自动化研发列为四类主要灾难性风险,主张根据模型能力和风险程度逐步提高监管强度,要求前沿开发者测试模型、公开安全措施、接受独立评估。当模型可能造成重大灾难时,政府应有权阻止或限制部署,并对违规企业处以高额罚款。此外,Anthropic还提出研究建立一种协调且可核查的暂停机制,需要多个国家处于前沿的实验室在相同条件下共同行动,并通过核查防止秘密违约,但暂时还没有明确触发条件、解除条件和裁决主体。


应该承认,这两家公司的方案都有可取之处,但它们有一个共同的不足:仍然主要以模型能力和灾难性风险作为监管入口,对于组成RSI的研发闭环应当如何拆分和控制,缺乏足够细致的安排。RSI真正危险的地方,不只是人工智能可以自行修改一些代码或参与部分架构设计,而在于同一个人工智能系统可能逐步掌握整个递归流程的全部权限。现实中,生成、执行和评价环节可能由同一个基础模型或同一模型家族承担。如果把评估改进效果的任务也交给人工智能,就可能形成人工智能自己命题、自己答题、自己阅卷的结构。如果这时模型还能自动获得更多算力、复制自身并取得部署权限,那么局部的研发自动化就很容易升级为难以阻断的递归循环。所以,关于RSI的监管不应只围绕训练算力或抽象的灾难性能力划线,而应着力拆分使递归得以形成的闭环。提出改进、执行改进、评价改进和批准部署这些步骤,应当由相互独立的主体控制,并确保模型不能自行修改安全标准,也不能自动获得新的算力、复制和部署权限。只有这样,才可能给人工智能的发展套上缰绳。


根据这一思路,要更好地监管具有RSI能力的人工智能,就需要建立一套评估递归能力的指标体系,并设定对应的监管策略。可以把人工智能的递归能力分成五个层次。


第一层是普通研发辅助。人工智能能完成搜索文献、生成代码、分析数据等任务,但不能自主修改核心系统。对这一层继续适用一般产品安全、数据保护和责任规则即可,无需额外限制。


第二层是固定目标和固定评价标准下的自动优化。人工智能能反复修改代码、运行实验并筛选更好结果。这一层应要求在隔离环境中运行,完整保存修改记录、实验过程和评价日志,以便风险出现时及时干预。


第三层是人工智能能修改自身的智能体结构、工具和工作流程,或者能自主提出研究假设。这时需要实施强制性外部测试,并限制其获得网络、资金和计算资源的权限。


第四层是人工智能能够承担大部分人工智能研发过程,包括提出实验、修改训练方法、评价新模型并参与部署。达到这一层次,开发、运行或部署应当取得专门许可,算力账户、模型权重和部署流程等关键信息应接受持续审计。


第五层是人工智能能够自主训练、验证和部署后继基础模型,并由后继系统继续进行下一轮循环。这就是完整的RSI,风险极大。原则上,任何机构都不应在缺乏外部监督的情况下单方面开发或运行这一层次的人工智能,所有实验都要在最高安全等级的基础设施中进行,并触发国际通报和跨机构联合评估。


与五级分类相配套的,是为人工智能设定四道“闸门”。第一道是能力闸门,判断模型能否长时间自主工作、设计新实验、修改自身以及开展原创研究。第二道是资源闸门,限制模型直接调用算力、资金、云账户和其他关键资源。第三道是评价闸门,确保提出改进、执行改进、评价改进和批准部署不能由同一个模型或同一条技术链独立完成。第四道是部署闸门,确保任何涉及模型自主权、外部工具权限和危险能力显著增加的变化,都必须经过人类研究者批准。这四道闸门可以保证研究权、评价权、资源权和部署权不会同时落入同一个递归系统手中,从而防止RSI在缺乏人类监管的情况下自行闭合。


除了分层和闸门,对RSI的监管还应贯穿五项原则。第一,所有高度自动化的人工智能研发实验都必须保存不可由模型自行删除或修改的日志。第二,处于技术前沿的人工智能企业必须及时报告模型研发过程中的严重异常、安全漏洞和危险能力跃迁。第三,外部测试机构应当拥有实质性的模型访问权,而不是只能看企业准备的报告。第四,企业高管和项目负责人应当对隐瞒重大风险承担相应责任。第五,开发者应购买与风险等级相匹配的责任保险,使危险研发可能造成的预期成本进入企业决策。


总的来说,对RSI的监管不能只盯着能力水平,更要把注意力放在资源获取权限和递归循环的形成上。能力评估回答的是“模型能做什么”,闭环监管回答的则是“模型能否在没有人类批准的情况下继续增强自己”。如果能确保递归循环的形成和运行始终处于人类监控之下,就能在较大程度上保持对人工智能能力演化的控制。


需要指出的是,以上所有措施都假设人工智能尚未达到通用智能或超级智能水平。如果一个人工智能系统在人们还没发现的情况下就实现了RSI,它的能力可能在短时间内迅速提升。为预防这种情况,有两方面工作极其重要:一是加强人工智能系统的对齐研究,尽量保证其能力超过人类之后,目标仍与人类利益一致;二是始终不让人工智能系统直接获得对关键资源的控制权,确保控制人员能在关键时刻切断资源供应。只有把这两条底线守住,技术发展的缰绳才不会脱手。

核心产品
    联系方式
      Public QR Code
      官方公众号
      Affairs QR Code
      商务合作