实时交互、全身表达与空间化:数字人3.0的核心支撑
2026-07-21 17:08:16

数字人生成领域正在发生一次不太喧哗却很重要的转向。过去几年,几乎所有做数字人的团队都在反复回答同一个问题:脸像不像?嘴型准不准?画面真不真?这些当然重要,但它们更像是基础题,而不是加分项。最近一段时间,行业讨论的重心明显移开了。大家不再只盯着怎么生成一个像人的视频,而是开始想办法生成一个像在现场的人。这个变化直接定义了下一阶段数字人竞争的关键。



不只像人,更要在场


以前看数字人演示,多数时候是这样的体验:打开一段视频,觉得脸挺像,光影也处理得不错,嘴型基本都对得上。但盯着看上十几秒,就会有一种说不清的距离感。你承认它像个人,却完全不想跟它说话。那种感觉就像隔着玻璃看一个精致的模型,它有形状,有纹理,甚至还会动,可就是少了点和你发生关联的东西。


问题出在哪里?不是脸不像,也不是嘴不对,而是它不像一个正在和你共处同一空间、同一时刻、能够随时接住你话的对象。换句话说,它看起来像视频里的一个人,但不像一个在现场的人。


这就是近一年来数字人生成研究最大的转向。行业不再满足于“生成像人的视觉内容”,而是开始追求“生成有在场感的人”。这个追求比单纯把脸做像要难得多,因为它涉及的不再只是画质、清晰度、面部相似度,而是时间、反应、情绪、身体语言、空间关系、任务理解等一系列更复杂的维度。过去判断一个数字人好不好,问的是“像不像”,现在还要追问一句:“像不像就在那儿?”


从离线口播,走向实时互动


最早一波数字人的落地场景,几乎都是内容生产。输入文字、音频和一张照片,等上几分钟,产出一条口播视频。做课程、做企业宣传、做短视频矩阵,这套流程跑得通,也确实省下了真人拍摄的成本。但这类数字人的本质仍然是视频生成工具,天生就和“对话”隔着一层。


它只能播,不能聊。用户看完想问一句,它没办法回应;直播间弹幕涌进来,它依然在按既定台词往下念;客户打断了它,它的回答不会发生任何改变,因为它的全部行为都在生成的那一刻冻结了。


最近很多研究工作都在解决同一个问题:实时生成。不是先做好一整条视频再播放,而是边听边生成,边说边动。数字人需要随时接收外界输入,随时调整自己的输出。用户的话要能接住,对话要能被打断,被打断之后的上下文还不能丢。这对系统的挑战完全不一样。离线生成可以等,可以反复渲染,哪里不好再修一修。实时生成没有这个奢侈,它从听到说之间的每一个环节都必须极度紧凑:语音识别、语义理解、文本生成、语音合成,再到驱动面部、嘴部、头部和身体,这一整套链路必须压缩到人类能够接受的自然对话间隔之内,通常也就是几百毫秒。


为什么这条路非走不可?因为使用场景变了。数字人原来主要是内容生产工具,省的是拍摄费用。现在大家试着把它放进客服、直播、教育、陪练、游戏NPC这些场景里。这些场景的共同特点是:需要对话。而在对话场景里,慢一秒,人的体验就会垮掉。口播视频可以容忍渲染时间,真实对话不能。一个人问你问题,你晚了两秒钟才张嘴,眼睛还发呆,对方的耐心几乎瞬间归零。所以,从离线口播走向实时互动,不是锦上添花,是被场景倒逼出来的必需能力。


从“嘴型同步”,走向“全身表达”


很多人看数字人觉得别扭,不是因为嘴没对上,而是因为只有嘴在演。真人在说话的时候,从来不只是嘴巴在工作。眉毛动,眼神变,头轻轻偏一下,肩膀松一点或者紧一点,手势随语气起伏,这些都是表达的一部分。同样一句“真的吗”,配上不同的身体状态,可以表达惊讶、怀疑、讽刺或者敷衍。嘴型很可能差不多,但整体呈现的意思完全不同。


过去数字人领域做了大量努力集中在嘴型同步上,也就是lip sync。这当然重要,但现在看来远远不够。前沿研究已经开始从lip sync往performance sync的方向走。performance sync要求的不再只是嘴和声音对齐,而是让整个面部表情、视线方向、头部运动、手势、身体姿态都和语音内容、语调、情绪节奏协调一致。


例如,当数字人说一个不确定的信息时,眼神可能会轻轻上移,头微微偏侧,语调放慢,同时肩膀上提一点点。这些细微动作如果缺失,整个表达就不成立。相反,如果脸部精致到毛孔可见,但眼神空洞,肩膀僵硬,手臂一动不动,观众几乎会立刻感知到某种不对劲。数字人的可信度,不是靠一张高精度的脸堆出来的,而是靠这些细节一点点拼凑起来的。用户对假的容忍度已经很低,而暴露“假”的往往不是脸,是身体。



另一个和全身表达同样棘手的问题是长时间稳定。很多数字人Demo前五秒惊艳,可一旦连续运行三十秒、一分钟,问题就陆续出现。脸部边缘开始轻微抖动,嘴角变形,发丝边缘飘忽不定,五官的身份感慢慢流失,好像正在悄悄变成另一个人。这种不稳定在短视频里可以被剪掉,在实时服务里就是现场事故。如果一个数字人要做客服、老师、主播,就必须能够稳定保持角色身份,不能聊半分钟就变样。这背后是对生成模型连续性和一致性的极高要求,也是工程落地上很难跳过的一道关。


从2D视频,走向3D和空间化


过去的数字人大多活在一张平面屏幕上,面对镜头说话,角度固定,与场景无关。这种2D视频形态在口播、短视频等单向输出的场景里够用。可一旦数字人被放进游戏、VR、AR、虚拟直播间、远程会议、智能硬件这些空间相关的应用里,2D就立刻显出局限。


在这些场景里,数字人不只要正对镜头说话,它需要转头去看旁边的东西,需要侧过身和空间里的物体发生关系,甚至要随着用户的视角变化而自然旋转。有些时候,用户围着它转一圈,它必须始终保持三维的物理合理性。这就决定了3D数字人、NeRF、3D Gaussian Splatting、可控头部与身体建模等方向会持续升温。


本质上的区别是:2D数字人适合被“看”,3D数字人更适合被“用”。如果数字人的角色只是口播,一段平面视频确实够了。但如果它要成为导购,在虚拟货架前面向用户介绍商品,要能转身拿东西;如果要成为陪练,在模拟场景里做动作示范;如果要成为虚拟同事,在远程会议中和真实的人共处一个虚拟空间,那么它就必须进入三维世界,既能被多角度观察,又能被空间调度。这种需求正在拉动整个3D数字人管线的成熟,从建模、驱动到实时渲染,都在从展示级向可用级前进。


从生成视频,走向“数字人Agent”


如果前面的变化都是“身体”层面的升级,那么这一点就是“脑”和“身份”的重塑。未来的数字人不会只是一个会动的头像。它背后会接上大语言模型、语音识别、知识库、记忆系统、工具调用接口和各种业务系统。它要能理解用户说了什么,知道自己能做什么、不能做什么,还要能够在连续的对话中记住关键信息,调取合适的能力去完成任务。


也就是说,数字人正在从视频生成的结果,变成AI Agent的外壳。单纯生成一段视频,价值有限。真正值钱的是交互。如果数字人只能念稿,它就是视频制作工具;如果它能回答问题、查询订单、教口语、陪练销售话术、引导用户完成一项操作,它就变成了产品和服务的入口。脸和声音只是前台,理解和执行才是后台。


正因为如此,数字人行业越来越多的投入不是投在怎么让画面更漂亮,而是投在怎么把感知、认知、决策和执行串联起来,让画面、声音和智能成为一个有机整体。这层转变会重新定义数字人的定位:它不再是一种内容形态,而是一种交互形态。不再属于媒体创作工具的范畴,而是属于服务基础设施的范畴。


回顾这些方向——实时互动、全身表达、长时稳定、3D空间化、Agent化——看起来涉及很多技术分支,但它们都指向同一件事:数字人正在从“像人的视频”变成“像人在场的服务”。


以前大家关心它像不像。像,已经不再是终点。现在更被追问的是:它能及时回应吗?它能长时间稳定吗?它能理解情绪和意图吗?它能动手完成任务吗?它能在该停的时候停下来吗?这些才是决定数字人能不能真正走进客服、教育、销售、陪伴、医疗等日常场景的核心问题。


这也就是为什么数字人行业不会冷下去。不是因为大家还想多看几个能张嘴的虚拟形象,而是因为人机交互正在换一种形态。文字聊天框已经证明了大模型的能力,下一步,大家想知道的是,当AI有了脸、声音、动作和实时反应,它会不会成为新的入口?答案大概率是会。但这一切的前提是,它不能只像一个人,它得真的像是“在场”。

核心产品
    联系方式
      Public QR Code
      官方公众号
      Affairs QR Code
      商务合作