2026年世界人工智能大会上,新晋图灵奖得主理查德·萨顿做了一个主旨演讲。他没有过多渲染当下人工智能的热闹,而是提出一个冷静的判断:当前AI还不够智能,真正的突破需要一次范式转变,从依赖人类数据,转向让机器通过自身与世界的交互来积累经验。他把这个新阶段称为“经验时代”。

这个判断不是凭空而来的。萨顿是强化学习的奠基人之一,几十年来一直研究如何让机器在与环境互动中学习。他的观点也许不会立刻成为新闻头条,但值得认真对待。我们需要仔细看一看,为什么他认为现在的AI还不行,什么叫经验时代,以及这个转变意味着什么。
今天的人工智能强在哪里,弱在哪里
这些年AI确实做了很多以前做不到的事。语言模型可以写文章、翻译、编程,图像模型能生成照片级的图片和连贯的视频。这些技术催生了新行业,也带来了巨大的经济价值。普通人拿起手机就能使用,这在十年前是很难想象的。
但在萨顿看来,这些突破主要还是大规模模式识别的成功。机器在海量数据中找到统计规律,然后根据提示生成新的内容。这种能力很容易被误认为是智能,但实际上它更接近计算能力的提升。算力更强,数据更多,模型更大,结果就更好。这个过程没有产生真正的新知识,只是对人类已有知识的一种重组和再表达。
换句话说,现在的AI像是非常高级的复述工具。它读过几乎所有公开的文本,能模仿人的表达方式,但它并不理解自己在说什么。它没有自己的目的,也没有通过行动去检验过这些内容的真假。因此,它容易产生事实性错误,推理也不稳定。萨顿用了一个直接的评价:它仍然比较脆弱,也比较弱小。这不是贬低,而是一种定位。有用,但不够智能。
人类数据时代正在靠近天花板
当前AI的运作逻辑,可以概括为“人类数据的转移”。我们用人类写出的海量文本来训练模型,让模型预测下一个词;用人类标注的图片来教它识别物体;请人类专家对模型输出进行打分和微调,让回答更符合我们的偏好。整个过程本质上都是在把人类已经拥有的知识、判断和表达习惯复制给机器。
这种做法在过去几年取得了惊人的效果,但它的局限也越来越明显。第一是数据问题。高质量的人类文本正在被用尽。互联网上的优质内容有限,很多领域的数据难以获取。第二是天花板问题。无论模型读了多少书,它始终是在人类已知的范围内打转。它无法自己发现一个人类还没发现的事实,因为它没有途径去验证任何超出训练数据的东西。
萨顿认为,这条路虽然还有改进空间,但作为一种范式,它已经接近极限。继续堆数据和算力,可能还能让模型表现得更流畅,但不会让它变得更聪明。真正的智能,不是知道更多既有答案,而是能在未知情况下找到答案。要做到这一点,机器就不能只读书,它必须自己去做事,去碰壁,去纠正自己。
经验是什么
这里所说的经验,不是指存储在数据库里的记录,而是智能体在与世界持续交互过程中产生的第一视角数据。它的基本结构是一个循环:观察环境,采取行动,获得结果,根据结果调整行为。这个循环每转一次,就形成一条经验。经验里包含了行动的背景、做出的尝试、得到的外部反馈。
反馈最重要。萨顿强调,只有通过奖励或惩罚,我们才能知道哪种行为更好。只有通过世界给出的真实回应,我们才能验证自己的预测是否正确。一个婴儿学会抓东西,不是靠看完一本物理教材,而是无数次伸手、失败、调整、再伸手。伸手带来触觉,触觉带来确认或落空,这个循环不断积累,最终成为抓握能力。这就是经验学习。
机器的经验学习遵循同样的逻辑。一个下棋程序不知道棋谱里没有的局面该怎么走,但它可以自己和自己下几十亿盘棋。每一步走完后,输赢的最终信号会通过算法回传,告诉它哪些走法更可能通向胜利。AlphaGo就是这样学会下棋的。它没有记人类的棋谱,而是用自我对弈产生了属于它自己的海量对局经验。最终它走出了人类棋手没见过的新着法。另一个例子是AlphaProof,它用类似的机制在国际数学奥林匹克竞赛中取得了好成绩。这些系统依赖的不是人类解题步骤的数据库,而是不断尝试证明、获得对错反馈、从经验中提炼策略。

缺少经验反馈,让大模型存在天然缺陷
当前的大语言模型基本不处在这种经验循环里。它的训练是一次性的,用固定的数据集。上线之后,它使用时的每一次交互,并不会让它自己变得更好。它今天犯的错,明天会继续犯,除非人类工程师收集数据后重新训练一个新版本。它没有能力根据使用反馈实时修正自己。
这导致一个根本问题:它不知道自己不知道什么。它生成答案的依据是统计相关性,而不是来自外部世界的验证。当它说出一个听起来合理但实际错误的事实时,它内部没有机制可以检测到这一点,也没有机制可以触发修正。人类写作者如果写错了,可能会被事实打脸,这个痛苦的反馈会促使他下次更谨慎。机器没有这种“被打脸”的体验,所以它很难建立真正可靠的认知。
萨顿指出,智能的核心是持续交互。智能体不断观察、行动、根据结果调整行为。这个动态过程中,感知、行动和反馈是一体的。没有这个持续的反馈,智能就是静止的,是脆弱的。大语言模型拥有海量知识,但它缺乏把知识放进现实中去验证的那个环节,所以它的智能是不完整的。
从经验中学习,是一个恰逢其时的思想
1947年,图灵在一次演讲中说,我们真正需要的是一台能从经验中自主学习的机器。这个想法很简单,但在当时的计算条件下很难实现。现在情况完全不同了。计算资源丰富,传感器普及,机器人技术不断进步,制造一个能大量积累经验并在经验中自主进化的智能体,在工程上已经越来越可行。
在机器人领域,这个趋势尤其明显。让一个机器手学会抓取不同形状的物体,如果完全用人类数据来训练,几乎不可能覆盖所有情况。更有效的办法是让机器手自己去尝试,每次尝试收到抓稳或掉落的信号,经过成千上万次练习,它就能找到规律。在工业、自动驾驶、药物设计、科学模拟等许多领域,基于经验的强化学习方法正在变得越来越重要。
萨顿把这看作一种不可阻挡的趋势。他说,恰逢其时的思想,势不可挡。这个思想就是:智能体必须拥有属于自己的经验,并用这些经验不断改善自己的行为。这种智能不是被灌输的,是长出来的。
心智科学的统一视角
萨顿还提出一个更宏大的设想,建立一门真正的心智科学。这门科学研究的不只是人类,也包括动物和机器。他认为,无论是人、动物还是AI,只要是一个心智系统,都有共同特征:为实现某个目标,在时间中持续行动,持续适应。强化学习为理解这种共同特征提供了起点和框架。
在这个框架下,智能的定义被重新梳理。它不是有多少知识,不是能通过多少考试,而是“通过不断适应行为来实现目标的能力”。适应意味着根据反馈改变。这个定义不关心智能体内部是人脑还是芯片,只看它是否能在环境里朝着目标越做越好。这样一来,研究机器如何从经验中学习,也就等于在研究智能本身。
这给当前AI发展提供了一个方向标。与其不断追求更大的模型和更多的数据,不如把重点放在如何让机器进入一个可以持续产生经验、使用经验、从经验中自我改进的循环。这个循环一旦真正建立起来,机器的能力增长就可能不再是线性的,而是滚雪球式的。
未来的变革仍将由人类推动
萨顿并不认为超级智能明天就会到来。他说,真正的自主智能、超级智能时代尚未到来。现在的AI在很多方面仍然不够可靠,但他也承认,它已经非常有用,创造了新产业,也让更多人可以使用。这是一个有价值的起步阶段。
进入经验时代,不是要抛弃现在的技术,而是要增加一个新的维度。让机器不只是向人类学,也向自己的行动结果学。这条路会比单纯扩大模型更难,因为它要求我们设计出能在真实世界里安全地尝试、失败、再尝试的系统。但它也更有希望带来真正的突破。
最终,这些变革仍然由人类推动,并需要服务于人类。萨顿的整场演讲,其实是在提醒大家,不要被表面的热闹迷惑。计算力的进步不等于智能的进步。想要走得更远,我们需要回到智能最基本的问题上:一个系统怎么通过自己的经验变得越来越能达成目标?这个问题的答案,正在成为下一阶段人工智能的核心议题。