大模型发展到今天,能力边界已经越来越清晰:在数字世界里,它能写文案、敲代码、做分析,几乎无所不能;可一旦要走进真实的物理世界,连“拿起桌上的红杯子”这种人类三岁小孩就能做到的事,都能难住最先进的模型。

这两年行业里频繁出现的两个概念——具身智能与物理AI,本质上都是在解决同一个核心问题:怎么让AI突破数字世界的边界,真正在物理世界里行动起来。但很多讨论常常把两者混为一谈,实际上它们的出发点、研究范畴和落地逻辑完全不在一个层面。
两个概念,一个终点
先拆解具身智能。它的英文是Embodied Intelligence,核心从来不是某一种具体的算法或者硬件,而是一套认知范式:智能不是凭空灌输给AI的,而是依托“身体”、在和环境的持续互动中慢慢生长出来的。这里的“身体”不一定是实体机器人,游戏、仿真环境里的虚拟角色也算。只要是通过和环境交互、反复试错来学习成长的智能模式,都属于具身智能的范畴。
它回答的是一个偏本源的问题:人类的智能为什么是现在这个样子?很大程度上是因为我们有身体,能触摸、能行走、能感知重力和摩擦力,能在一次次摔倒、碰壁、失手的过程中总结出对世界的认知。具身智能的研究,就是沿着这个思路,让AI也拥有“身体”,在和环境的互动里练出真正的智能,而不是只靠海量标注数据死记硬背。
物理AI的概念则更偏向工程和产业,也是英伟达近几年一直在力推的方向。如果说具身智能回答的是“智能怎么来”,物理AI回答的就是“智能怎么落地”。它关注的是:在数字世界里训练好的AI模型,要怎么部署到机器人、机械臂、自动驾驶汽车这些真实硬件上,让它们能应对真实世界里的所有物理规则——牛顿力学、材料特性、摩擦力、空气阻力、光照变化,所有在数字世界里可以忽略、在现实里却决定成败的细节。它的关键词很明确:可部署,能在真实世界里稳定跑起来。
打个不那么严谨的比方:具身智能像是在研究“人是怎么学会走路的”,属于认知科学的命题;物理AI则是在研究“怎么造一双合脚的鞋、怎么修一条平整的路,让人能稳稳当当地走起来”,属于工程系统的问题。两者方向一致,一个偏底层认知,一个偏落地实现,最终共同指向同一个目标:让AI拥有实体,理解物理规则,在真实世界里自主行动。
如果把整套实体智能的技术体系拆开看,大致能分成三层:最底层是世界模型,负责认知世界、预判动作的后果,相当于AI的“物理直觉”;中间层是具身交互能力,负责和环境做物理互动、执行具体动作,相当于AI的“身体控制”;最外层则是物理AI的系统集成工作,把感知、仿真、模型、硬件全部打通,形成完整的闭环,最终落地到真实场景里。
大模型推开了融合的大门
具身智能的概念其实已经提了很多年,物理AI相关的研究也一直有,但两者真正开始快速融合、成为行业共识,恰恰是在大模型爆发之后。
ChatGPT出现之前,机器人的“智能”大多是预设好的程序:设定好轨迹,机械臂就按轨迹走;设定好指令,机器人就做对应动作。它听不懂自然语言,也不会应对突发情况,换个场景就彻底失效。大模型带来的理解、推理、规划能力,让整个行业看到了新的可能:如果把多模态大模型当成机器人的“大脑”,是不是就能让它听懂人的指令、自主规划动作、应对复杂场景?
几乎所有头部科技公司都在做这件事:给机器人接一个大模型大脑,用自然语言就能下发任务。但很快大家就发现了问题:能在数字世界写诗、写代码的大模型,真接到机械臂上,连拿杯子这个简单动作都做不好。
它能从语义上拆解“拿杯子”的步骤:伸手、抓握、收回。但它不知道手臂的六个关节要怎么配合转动才不会撞到桌沿,不知道杯子是陶瓷的要用多大劲才不会捏碎,不知道桌面有点滑要调整抓取的角度,也不知道逆光的时候杯子的颜色变深了,它还是那个杯子。这些细碎的、人类靠本能就能处理的物理常识,恰恰是大模型的盲区——它的所有知识都来自文本和图片,从来没有真的“碰过”一个杯子,自然不会有对应的物理直觉。
这时候具身智能的思路就派上了用场:别只给AI喂现成的数据,让它自己去和环境交互,在试错里学。就像婴儿学抓东西,摔无数次,慢慢就掌握了力度和角度。机器人也一样:推一下杯子,知道它会滑动;抓轻了,知道杯子会掉;撞到桌沿,知道有障碍物。一次次试错下来,它才会慢慢建立起对物理世界的体感,而不是只记住文字描述的规则。
但真实世界的训练效率太低,成本也太高。一台工业级机械臂造价几十万,让它每天摔几百个杯子练抓取,不仅硬件损耗大,时间成本也扛不住。所以行业普遍选择了“仿真到现实”的路径:在数字世界里搭建和真实物理规则一致的仿真环境,做数字孪生,让成千上万个AI智能体在里面同时训练,速度是现实的几百上千倍。等它们在仿真环境里练熟了,再把训练好的策略迁移到真实机器人身上,能省下大量成本和时间。

到这一步,物理AI的工程视角和具身智能的研究视角就彻底咬合了。物理AI提供算力支撑、仿真平台、部署框架和硬件适配方案,解决“高效训练、稳定落地”的问题;具身智能提供交互学习的认知范式和数据生成逻辑,解决“AI怎么真正学会物理常识”的问题。两者结合,一套完整的实体智能技术栈逐渐成型:底层是物理仿真平台,中间层是数据生成与训练体系,上层是多模态大模型作为决策大脑,最终输出到真实世界的各类机器人硬件上。
融合的三个阶段
按照行业的普遍共识,具身智能和物理AI的融合落地,不会一步到位,而是会分成三个阶段逐步推进。
第一个阶段是基础融合期,也是当前绝大多数产业落地所处的阶段。这个阶段的特点是场景封闭、设备专用、任务标准化。比如工厂里的工业机械臂、仓储中心的搬运机器人、干线物流的自动驾驶卡车、家用扫地机器人,都是单一形态的实体设备,搭载轻量化的视觉-语言-动作模型和基础物理仿真模块,只做固定的标准化任务。技术目标很务实:不需要通用能力,只要在单一场景里能稳定商用、能实实在在替代人工就行。这个阶段的模型不具备迁移能力,换一个场景、换一款硬件,就要重新训练调试。
第二个阶段是通用迁移期,也是现在整个行业正在攻坚的方向。核心目标是做出统一的通用具身基础模型和通用物理世界模型。一套模型可以适配多种不同的硬件——人形机器人、四足机器人、工业机械臂、自动驾驶车辆都能用,不用每套硬件单独训一套模型。更关键的是零样本迁移能力:碰到从来没见过的新任务,不用重新训练,模型靠已有的物理常识和推理能力,就能直接上手完成。到这个阶段,柔性制造、养老护理、抢险救灾这类更复杂的半开放场景,就能实现小规模商用。
第三个阶段是通用实体智能的成熟期,距离现在还有相当长的距离。到这个阶段,具身交互闭环和物理世界模型会深度融为一体,智能体不再需要人类预设任务和规则,能自主探索环境、自主归纳物理规律、自主优化硬件控制策略,拥有元认知能力。哪怕放到完全陌生的开放世界里,也能自主完成长时序的复杂复合任务,拥有接近人类水平的通用物理常识和行动能力。到这一步,工业生产、民生服务、特种作业的生产力模式才会被彻底重塑。
绕不开的三道现实难题
方向虽然清晰,但融合的路并不好走。和纯软件AI相比,实体智能要面对的约束要多得多,有三道坎至今没有完美的解决方案。
第一道坎,是物理常识怎么真正注入大模型。语言大模型靠海量文本训练,图像大模型靠海量图片训练,但物理常识很多是体感的、经验的,没有对应的标注数据。“玻璃杯用力握会碎”“水倒满了会溢出来”“走冰面要放慢脚步”,这些知识不是靠看文字就能学会的,要靠真实的触觉、力觉、运动反馈才能建立直觉。学界尝试过用仿真数据、多模态对齐等很多方法补这块短板,但截至目前,还没有哪种方案能彻底解决这个问题。人类花了十几年时间才建立起成熟的物理直觉,AI要补上这一课,远不是堆参数就能实现的。
第二道坎,是高质量训练数据的稀缺。互联网时代的AI从不缺数据,爬取网页就能拿到几十亿条文本。但机器人的交互数据完全是另一个量级。要让机械臂在不同场景、不同光照、不同干扰下抓取一万种不同的物体,可能需要几个月甚至几年的真实采集,成本极高。真实数据不够,就只能靠仿真合成数据、人类示教数据来补充,但仿真环境和现实世界永远存在差距,也就是行业常说的“仿真到现实的鸿沟”,这个鸿沟会直接影响模型落地的效果。数据的稀缺,是限制具身智能发展速度的核心瓶颈之一。
第三道坎,是物理世界极低的容错率。纯软件的AI出错成本很低:聊天机器人说错话,最多引发争议,调整模型就好;推荐算法推错内容,用户划走就完事了。但物理世界的AI不一样,机械臂动作偏差几厘米就可能砸坏设备、伤到人员,自动驾驶判断失误就可能引发交通事故,哪怕是家用机器人,拿错物品也可能造成安全事故。物理世界的容错空间,比数字世界小得多。这也是为什么落地最快的都是封闭场景:工厂机械臂有安全围栏,仓储机器人在无人区运行,自动驾驶先跑路线封闭的高速。要进入家庭这种完全开放、变量极多的环境,技术和安全层面的难度都要再上一个量级。
AI的能力发展到今天,向物理世界渗透是必然的趋势。具身智能从认知层面探索智能的本质,物理AI从工程层面推进落地的路径,两者从不同方向出发,最终会走向同一个终点:通用的实体智能。只是这条路比很多人预想的更漫长,也更扎实。它不需要概念炒作,需要的是在仿真环境里一次次试错,在真实场景里一点点打磨,慢慢把物理常识、数据、安全这几个核心问题啃下来。
现在我们还站在这场变革的起点。等什么时候机器人能像人类小孩一样,在真实世界里摸爬滚打一番,就能自己学会新的技能,那属于物理世界的智能化革命,才算是真正拉开序幕。