过去十年,AI行业有一条近乎共识的增长铁律:更多训练数据 × 更大模型参数 × 更强算力 = 更智能的模型。所有人都沿着这条路走,堆参数、扩数据集、拼算力,每一步都能拿到明确的能力收益。这条Scaling法则稳得像物理定律,支撑了整个行业的快速扩张。

直到最近一两年,这条曲线的斜率开始放缓。不是Scaling本身失效了,而是单纯靠堆互联网文本做预训练的路子,逐渐摸到了边际收益递减的坎。Ilya Sutskever说行业要从「Scaling时代」回到「研究时代」,本质上就是在说:过去那条清晰、稳定、可复制的增长路径已经不够用了,行业需要找到新的增长配方。
现在全球前沿实验室同时在押注六个方向。它们不在同一个层级,也不是非此即彼的选择:前五个方向分别从计算分配、行动能力、学习范式、世界认知、落地场景突破现有模型的边界,而可解释性与安全是所有路线共同依赖的底层控制层。
一、Scaling 2.0:把计算花在“思考”上
第一条路线最稳妥,也最贴近当下的产品落地,就是在Transformer大模型的底座上,重新分配计算资源,也就是常说的Scaling 2.0。
过去的AI模型,几乎所有计算都砸在预训练阶段。训练完成后,模型参数就固定了,用户提问时,模型只是按概率输出答案,思考过程不消耗额外算力。能力强弱,从训练结束那一刻就定死了。
现在的逻辑变了。计算被分散到了四个环节:预训练打基础,后训练的强化学习对齐人类偏好,推理时加入搜索、验证和回溯,再到Agent执行任务时的多轮行动计算。简单说,不是只在训练的时候“学”,回答问题的时候也可以“想”。
推理模型就是这套逻辑的产物。遇到问题,它不是直接输出答案,而是先生成多条候选路径,逐一搜索、比较、验证,中间可以调用工具、运行代码,发现错误就回溯修订,最后给出最优解。最直观的变化是,同参数规模的模型,开启深度思考模式后,数学、编程、逻辑题的准确率能提升一大截,代价只是多花几秒到几十秒的推理时间。
这相当于把智能变成了一种可以动态调度的资源:简单问题快速回答,省算力;复杂问题就多分配计算量,多试几条路,多做几层验证。用户可以在“快”和“准”之间自己选。
当然这条路也有自己的待解问题。比如“多想一会儿”并不总是对的——如果一开始的前提就错了,越长的思维链反而会在错误的方向上越走越远,最后得出更离谱的结论。再比如,推理是不是必须发生在语言空间?现在的思维链都是用自然语言一步步推导,但未来很可能在模型内部的潜在表示空间完成推理,只有需要和人交流的时候才转换成语言,效率会高得多。
二、Agent:从回答问题到交付结果
如果说推理模型拓展了AI思考的深度,那Agent就在拓展AI行动的长度。
单轮问答早就不足以衡量AI的真实生产力了。模型真正进入工作流,核心变化是人和AI的关系从“提问-回答”变成了“目标-交付”。以前你问AI一个问题,它给你答案,对话就结束了;现在你给AI一个目标,比如“帮我调研这个行业的竞争格局”,它要自己拆解步骤、调用工具、收集信息、修正方案,最后把完整的结果交给你。这就是从Chat到Delegation的转变——人类不再是指挥每一步,而是把整个任务委托出去。
这件事看起来美好,真正落地的瓶颈却不在“会不会用工具”,而在“能不能一直走对路”。长程任务有个很残酷的概率问题:假设每一个关键步骤的成功率是95%,听起来已经很高了,但连续完成20个独立步骤之后,整体成功率就只剩下约35.8%。步骤越多,出错的概率越高,而且很可能在某一步跑偏之后,后面全错,自己还发现不了。
所以现在Agent研究的核心,早就不是演示“能不能调用搜索、写代码”这种基础能力了,而是解决两个更务实的问题:一是能不能在长任务里始终保持正确方向,不跑偏;二是出错之后能不能自己发现、自己修正、回到正轨。毕竟真实工作里,永远不出错是不可能的,能从错误里恢复,才是真正能用的Agent。
三、体验学习:让AI自己生产训练数据
第三条路线更底层,它试图解决的是“训练数据从哪来”的根本问题。
David Silver和Richard Sutton提出过一个判断:AI正在从人类数据时代进入体验时代。过去的模型,训练数据都是人类生产的——文本、图片、代码,人类先做出示范,模型再去模仿,再靠人类反馈优化。本质上,模型的上限超不出人类数据的总和。
体验时代的逻辑完全不一样:智能体自己在环境里行动,行动产生后果,环境给出奖励反馈,智能体根据反馈更新策略,然后继续行动、继续学习。训练数据的生产者不再是人,而是智能体自己。
DeepMind的SIMA 2和Genie就是这套思路的原型。系统先生成一个虚拟世界,然后让Agent在里面完成各种任务,环境根据任务完成情况给出奖励,这些行动经验沉淀下来,用来训练下一代更强的Agent。循环往复,不需要人类一步步做示范。
这件事的意义远不止“AI会玩更多游戏”。它第一次展示了一个不依赖人类数据持续增长的可能性——只要有足够的模拟环境,智能体就能自己生产训练数据,自己迭代升级。如果这条路走通,人类数据不足的瓶颈就会被打破,AI的增长曲线会进入一个全新的阶段。
四、世界模型:补上物理直觉的短板
和体验学习紧密相关的第四条路线,是世界模型。它要补的,是纯语言模型天生的短板:对真实世界的物理直觉。
大语言模型读了海量文本,能描述几乎所有事物,但它对世界的理解是停留在语言层面的。它知道“杯子掉在地上会碎”,但这是从文本里学来的结论,不是真的理解重力、材质、碰撞这些物理规律。遇到没见过的场景,就很容易出错。

世界模型要学的,就是这种对世界运行规律的预判能力。输入当前的世界状态和一个候选行动,模型能预测出接下来会发生什么,行动会带来什么后果。比如机器人伸手去推杯子,世界模型能预判杯子会往哪个方向滑、会不会掉下去、掉下去之后是什么状态。
这件事说起来简单,实现起来有很多分歧。现在行业里有三场核心争论:第一,世界模型到底是预测抽象的状态就够了,还是要生成完整的视觉画面?第二,是单独做一个显式的世界模型模块,还是让模型在端到端训练里自己长出世界认知?第三,在模拟环境里训练出来的模型,到底能多大程度迁移到真实世界里——也就是Sim-to-Real的鸿沟,这也是具身机器人领域至今没彻底解决的核心难题。
但方向是明确的:AI要真正走进物理世界,光靠书本知识不够,必须有对世界运行规律的直觉判断。
五、AI for Science:生成很便宜,验证才稀缺
第五条路线,是把AI的能力落地到科学研究里,这也是最容易产生实打实价值的方向。
AI for Science不是让模型读更多论文、写更多综述,而是让它真正参与到科研的闭环里:先生成大量候选假设,然后通过代码模拟、形式化推导或者真实实验去验证,再对结果进行批判、排序,淘汰错误的,保留可行的,再组合、修订,继续往下探索。
这条路线的瓶颈,从来不在“生成想法”的速度上。AI一小时能生成十万个假设,但实验室可能几个月都验证不了其中几个。生成能力越来越便宜之后,真正稀缺的资源就变成了另一端:实验设备、高质量的标注数据、可靠的形式化验证工具、领域专家的审核时间、可复现的实验结果。
所以AI for Science领域有个很实在的判断:比生成能力更重要的,是验证器。谁拥有可信、可扩展的验证手段,谁才能真正把AI的生成力转化成科研成果。不然再多的想法,也只是空中楼阁。
六、可解释性与安全:跟上系统的复杂度
前面五条路线都是在让AI变得更强,而第六条路线,是保证变强的AI还在人类的掌控里。
这件事的紧迫性,恰恰是前面几条路线带来的。推理模型的思考过程越长,内部的决策节点就越多;Agent越自主,能执行的动作就越复杂;持续学习的能力越强,模型的行为就越难复现。如果还是像以前一样,只检查最终输出的答案对不对,根本没法有效监督这些系统。很多时候答案是错的,你都不知道它在哪一步想偏了。
现在行业里有两条互补的技术路线。一条是行为与轨迹监督:看AI做了什么,比如监控它调用了什么工具、执行了什么操作、留下了什么行动轨迹,通过审计轨迹、设置沙箱、做权限隔离来控风险。另一条是机制可解释性:往模型内部看,定位它的决策对应哪些内部特征,构建计算归因图,搞清楚它到底是“怎么想的”。
前者落地快,后者更根本,两者结合,才能跟上AI系统越来越高的复杂度。
三条正在形成的合流方向
单独看六条路线各有侧重,但前沿研究里,真正有爆发力的突破,往往出现在不同路线的交叉点上。现在已经有三条清晰的合流方向,正在形成新的增长闭环。
第一条是体验学习和世界模型的结合。用世界模型生成可交互的虚拟环境,让Agent在里面自由探索、积累经验,再用这些经验训练更强的Agent和更准的世界模型。循环往复,理论上可以无限生成训练数据,不用受限于现实世界的数据量。很多人认为,这很可能就是下一代Scaling的核心配方——不再是堆人类标注的数据,而是堆模拟环境里的自生成经验。
第二条是推理能力和科学研究的结合。也就是生成器加验证器的闭环:AI生成候选方案,自动验证器快速判断对错,错的淘汰,对的继续优化迭代。在数学、代码、算法这些领域,验证成本很低,这套闭环跑起来特别顺畅,已经产出了不少实打实的成果。未来随着验证工具越来越完善,这套模式会往更多科研领域渗透。
第三条是Agent和可解释性的结合。以前的AI安全是事后审计结果,现在Agent有了完整的行动链路,安全监督就可以下沉到过程里。系统会记录Agent看到了什么、制定了什么计划、调用了哪些工具、为什么选择继续或者停止。Agent Trace、思维链监控、机制可解释性,正在慢慢整合成同一套过程审计的基础设施。以后判断一个AI系统安不安全,不只要看它输出了什么,还要看它是一步步怎么做出来的。
回到最开始的问题:AI的下一次突破会来自哪里?
答案大概率不是某一个参数大到惊人的新模型,也不是某一个彻底颠覆Transformer的新架构。而是在这些不同的路线上,大家分别跑通了一个个可持续的学习闭环——推理的搜索闭环、Agent的行动闭环、体验学习的经验闭环、世界模型的模拟闭环、科学研究的生成-验证闭环。
Scaling没有死,只是Scaling的对象变了。以前是堆预训练的参数和数据,现在是堆推理计算量、堆模拟环境里的经验、堆生成-验证的循环次数。增长不再是单一维度的直线上升,而是多个方向同时推进,慢慢汇聚。
对行业来说,这意味着单一靠堆算力堆参数的粗放增长阶段结束了。接下来比拼的,是对具体问题的理解,是对闭环设计的能力,是对真实场景的落地深度。AI的下一个时代,不是更大,而是更会思考、更会行动、更会学习。