数字人的“出生”与“动起来”,一篇讲完背后的硬核技术
2026-07-24 15:15:21

从电影《阿凡达》中蓝皮肤的纳美人,到央视新闻里落落大方的虚拟主播“小C”,数字人正从科幻银幕快速走进我们的日常生活。一个虚拟角色能像真人一样说话、做表情,背后靠的不是魔法,而是一套严谨的“造人术”。这套技术主要回答两个问题:数字人怎么“出生”,也就是建模;出生后怎么“动起来”,也就是驱动。围绕这两点,研究人员将计算机图形学、深度学习和语音处理等学科的方法糅合在一起,形成了一条清晰的技术链条。下面就从建模、驱动、数据与评估、实际应用以及未来挑战几个方面,用尽量直白的语言把这条链条拆解清楚。



一、数字人的外貌从哪来:建模技术的两条路


想让数字人出现在屏幕上,首先得有一个三维模型。获得这个模型有两条主要路径:传统几何建模和深度学习驱动的建模。


传统几何建模是手工活。美术师在Maya、Blender这类专业软件里,像捏泥人一样一点点把角色雕出来。直接建模的方法虽然可以做到非常精细,毛孔、皱纹都能刻上去,但效率很低,做一个高精度角色往往需要几天甚至几周。后来出现了参数化建模,思路是用一组数字来控制人体形状。比如被广泛使用的SMPL模型,只要给定身高、体态、胖瘦等参数,就能自动生成对应的人体网格。这种方法快了很多,但缺点也比较明显——它主要管身体轮廓,对于人脸那些细腻的特征,比如眼角的弧度、嘴唇的厚薄,捕捉能力还不够。一旦要求很高的面部精度,参数化模型就显得粗糙了。


随着深度学习的发展,建模的重心逐渐转向自动化。用深度学习建模,本质上是让算法“看”大量的人脸图像或三维扫描数据,自己学会人脸的规律,然后凭空“想”出一个合理的人脸。


在二维层面,生成对抗网络(GAN)和变分自编码器(VAE)这类模型很早就显示出了能力。它们不依赖具体输入指令,纯粹通过学习人脸图像的概率分布来生成新面孔。基于噪声的生成模型能把一个随机码映射成逼真的二维人脸照片,StyleGAN等架构甚至可以分别控制头发、肤色、脸型等属性。但二维图像终究不是三维模型,没法直接用于需要转视角、打灯光的虚拟场景。


于是,三维重建与渲染技术成了建模的关键一环。以神经辐射场(NeRF)为代表的隐式建模方法,改变了传统几何建模的思路。它不显式地存储顶点和面片,而是用一个神经网络去表达整个三维场景。输入是不同角度拍摄的二维照片,网络学会输出空间中每一点的密度和颜色。这样,无论从哪个角度看,都能通过体渲染得到逼真的图像。对于数字人建模,这种方法可以还原出几何结构很精细、光影效果很自然的三维头部模型,而且省去了大量人工调节的步骤。它的代价是计算量大,渲染一张图可能比较慢,但通过后续的各种加速方案,已经能做到在一定条件下实时输出。


可以说,建模技术的演进就是从“费人”到“费算力”的过程。传统方法靠美术师的手艺,精度可控但周期长;深度学习方法靠数据和显卡,能自动生成带微表情细节的三维人脸,但需要解决计算效率问题。


二、数字人怎么动起来:视频驱动与音频驱动


有了静态模型,下一步是让它有表情、能说话。这就是驱动技术要干的事。目前主流的驱动方式有两种:视频驱动和音频驱动,它们常常被组合起来使用。


视频驱动,就是用一段真人说话或做表情的视频,把里面的面部运动提取出来,再“移植”到数字人脸上。早期的做法比较直接,通过图像处理手段追踪面部关键点,然后根据几何变换来拉扯模型。比如跟踪嘴角、眼角、眉梢的位置变化,再驱动目标角色的相应顶点移动。这种方法规则明确,容易理解,但面对歪头、大幅度的表情变化时,很容易出现不自然的情况。


深度学习方法进入后,驱动变得更自动化、也更逼真。视频驱动深度模型分显式建模和隐式建模两大范式。显式建模还是会去估计三维人脸网格或关键点的位移,但由网络直接预测这些量,可解释性好,而且比较容易编辑和修正。隐式建模则直接从源视频像素映射到目标动画帧,中间不再有一个明确的三维参数表示。这种方式灵活性很高,能处理很复杂的非线性表情交互,嘴巴张合时脸颊肌肉的自然联动、眼神的微变化,都可以被学到。不足是控制起来更难,想要微调某个局部表情,往往无从下手。


音频驱动解决的是另一类需求:根据语音内容自动让数字人张嘴说话,而且嘴型要和发音对得上。这在虚拟主播、虚拟客服场景里很关键,因为不可能为每一句话都录一段真人视频来驱动。


音频驱动的传统方法是统计参数模型。先提取音频中的特征,比如梅尔频率倒谱系数,再通过隐马尔可夫模型或动态贝叶斯网络来预测对应的口型参数。这套方法在一些限定场景下可用,但生成的口型往往比较机械,缺乏细腻的过渡,表情也显得呆板。


现在的深度生成模型,特别是基于GAN和扩散模型的方法,把口型同步和表情生动性都推了一大步。以GAN为例,生成器接收语音特征,直接合成对应的说话人脸帧,判别器则判断这一帧的真假,同时通常还会加一个唇音同步判别器来约束口型准确度。扩散模型则是先把真实图像逐步加噪破坏,再学习从噪声中结合语音条件重建图像,生成的动画细节更丰富、神态更自然。像Wav2Lip这类专门优化的网络,已经可以达到很高的唇形精度,让数字人说话时几乎看不出破绽。


实际应用时,往往是视频驱动和音频驱动配合使用。比如用音频驱动保证口型与声音同步,再叠加来自视频或预定规则的头部姿态、眨眼、眉毛运动等,组合出完整的表情动画。这种混合驱动方式,让数字人既能准确复刻真人表演,又能对任意语音实时生成对应表情,为直播、交互等场景提供了基础。



三、数据和评价:训练燃料与质量标尺


无论是建模还是驱动,深度学习模型都离不开大规模的数据集。根据驱动类型,这些数据集可以大致分成视频驱动类、音频驱动类和多模态类。


视频驱动类数据集,比如VoxCeleb、CelebV-HQ,收集了大量说话人视频片段,涵盖不同角度、光照和表情变化,主要用来训练面部运动迁移模型。这类数据获取成本较高,需要多相机系统或精细的人工标注。音频驱动类数据集,像LRS3、GRID,侧重视觉与语音的对齐,句子清晰,便于学习音素到口型的映射,但往往情感维度单一,说话人的情绪表达不够丰富。多模态数据集则尝试把视频、音频、文本,有时还有深度信息、红外信息都整合在一起,提供全方位的数据支持。它的优点是信息全面,可以训练更鲁棒的模型,缺点是异构数据融合的难度大,制作成本高。


为了衡量一个数字人到底做得怎么样,不能光靠眼睛看,还需要一套客观的评估指标。常见的有:结构相似性指数(SSIM)和峰值信噪比(PSNR),它们主要从信号保真度的角度看生成图像与真实图像的接近程度;FID则比较生成图像和真实图像在特征空间的整体分布距离,分数越低代表整体质量越好;LPIPS更贴近人的感知,能反映两幅图像在视觉上的差异;LMD和AKD一类指标计算生成人脸与真实人脸关键点位置的平均距离,直接评估驱动精度。


这些指标各有侧重,但还没有哪一种能单独完美衡量表情是否自然、动作是否流畅。评估体系本身也还在完善之中。


四、从银幕到课堂:数字人已经走进哪些领域


技术的成熟首先体现在影视行业。《阿凡达》的制作中,面部动作编码系统(FACS)被系统化地用来捕捉演员的微小表情,并将这些动作映射到纳美人角色上。这套做法大幅度缩减了动画师逐帧调节的工作量,让大规模制作高保真虚拟角色成为可能。


新闻媒体是数字人另一个活跃的舞台。央视网的虚拟数字人“小C”在两会报道、冬奥会节目等多次重大活动中露面,能播报新闻,也能和真人嘉宾互动。这背后整合了高精度建模、视频驱动与音频驱动等一系列技术,验证了虚拟主播在专业制播流程中的可行性。


教育领域,虚拟教师开始承担起一部分答疑和辅导工作。它们可以实时根据学生的提问做出反应,并配合相应的表情和肢体动作,为学生提供接近面对面的交流感。虽然目前还远不能完全取代真人老师,但在解决师资分布不均、提供标准化教学内容等方面已经表现出潜力。此外,虚拟客服、虚拟导购、直播带货的数字人分身也在逐步铺开,一个“人人都有数字分身”的苗头已经出现。


五、眼前的坎和下一步的方向


尽管进展很快,数字人技术离真正无缝融入日常还有好几道坎要迈。


第一是真实感与实时性的矛盾。要照片级真实,模型的面数就得上去,光影计算也得复杂,这导致渲染一帧可能需要几秒甚至更久。而虚拟直播或交互应用要求毫秒级响应,这就必须在画质和速度之间做妥协。如何在手机、网页等轻型设备上跑出一个高精度的实时数字人,依然是工程上的难点。


第二是情绪表达的广度和细腻度。目前的驱动技术应付基本的对口型、点头眨眼没有问题,但一旦涉及复杂情感,比如略带讽刺的微笑、压抑的悲伤,虚拟人的表情就容易显得假。理解语音中的情绪线索,并转化成与之匹配的面部微表情,仍然处于研究阶段。


第三是跨场景的泛化能力。在特定数据集上练出来的模型,换一个光照环境、换一种相机角度,或者换一张完全不同的脸,效果就可能大打折扣。想让一套模型在各种真实环境中稳定输出,需要更丰富、更标准的多模态基准数据集,也需要更强的模型泛化设计。


未来的方向,基本都围绕高精度建模、自然化驱动、高效化落地这三根主线。具体来说,会重点推进细粒度动态建模,去捕捉皮肤褶皱、肌肉颤动等细微变化;加强情感认知增强,让数字人能感知并表达更丰富的情绪;探索轻量化建模与实时交互优化,通过模型剪枝、知识蒸馏和神经渲染加速等手段,让高质量数字人在普通设备上也能跑得流畅;最后,还要突破跨场景泛化和行业适配的瓶颈,让数字人在医疗、金融、养老等垂直领域真正落地。


从美术师一帧帧雕刻,到算法自动生成三维人脸,从僵硬的口型对齐,到音视频融合的自然表情,数字人背后的这套“造人术”正在一步步把想象中的情景变成可用的工具。尽管还有真实感、实时性、情感表达等难题摆在前头,但技术的演进逻辑已经非常清晰。可以预见,在未来,教师、客服、医生等角色拥有自己的数字分身将不再只是设想,而是像今天使用视频会议一样平常。

核心产品
    联系方式
      Public QR Code
      官方公众号
      Affairs QR Code
      商务合作