从实时驱动到实时生成:数字人直播的技术迭代
2026-07-31 15:06:26

数字人正在进入越来越多人的生活。打开手机,经常能看到数字人主播在带货、聊天或者表演才艺。这些数字人形象逼真,动作流畅,很多时候已经能够以假乱真。但很少有人知道,我们目前看到的大多数数字人直播,并不是数字人自己在“临场发挥”,而是一段段提前做好的视频被巧妙地拼接在一起。



当前业界主流的做法可以叫作“实时驱动”或者“离线生成”。团队会提前制作大量5到15秒的视频片段,把数字人可能要说的话、要做的动作预先渲染出来。直播时,根据脚本或用户触发,系统从素材库里调取对应的片段,像拼图一样把它们接起来。要生成高质量的视频,耗时不短,所以只能提前准备,没办法现场制作。


这种方式有明显的天花板。互动是有限的,因为素材库再大也装不下所有可能性。真正意义上的随机应变,比如回答一个从未预料到的问题,实时调整表情和手势,在这种模式下很难实现。更重要的是,拼接容易产生微妙的断裂感,音画之间、动作之间偶尔会显得不那么连贯。


现在,技术正在跨越这个阶段。以讯飞推出的“实时可交互营销超拟人数字人”为代表,一种新的方式出现了:不再播放预制视频,而是让数字人在持续的交互过程中,一边理解用户的意思,一边现场生成表情、动作和语音,一边就把生成的视频画面推流出去。整个过程是实时的、持续的。这不是简单的视频拼接,而是真正意义上的“实时生成”。这意味着数字人直播从“用提前做好的素材来驱动”,正式迈入“用人工智能现场创造每一个画面”的新阶段。


7×24小时在线上岗,如何保持同一个人不变


实时生成带来了一个巨大的好处,就是数字人可以像真人一样持续在线,真正实现7×24小时轮班。但这背后有一个绕不开的技术难题:怎么让数字人在连续工作好几个小时后,看起来还是同一个人?


这里的问题是误差累积。生成视频时,每一帧都是基于前面的帧算出来的。画面一长,微小的偏差就会像滚雪球一样越滚越大。可能播着播着,主播的五官悄悄变了,发型出现了奇怪的抖动,或者背景里的某个物品突然变了颜色。这种“身份漂移”是长时视频生成的头号挑战。


不仅如此,实时交互要求整个流程不能卡。从听懂观众说话,到规划要表达的内容,再到生成画面、压缩视频、推送直播流,任何一个环节慢了,屏幕那头的观众就会感到延迟、卡顿,甚至音画不同步。


解决这个问题的办法,是把整个流程变成一条不会断的流水线。这套系统不是等整段视频全做完再播,而是先快速生成一个开头,马上就播。开头播着的同时,电脑继续算后面的内容。观众感觉不到中间的生成过程,就像拧开水龙头,水一直流。为了让数字人不变样,系统会同时维护两种“记忆”:一种短期记忆,盯着前后帧的表情、动作是否连贯;一种长期记忆,牢牢锁定这个数字人的基本长相、发式、服装和场景风格。每隔一段时间,就会用长期记忆去校准新生成的画面,把快要跑偏的样貌拉回来。这样,数字人才能在长时间的直播中,始终保持相同的脸、相同的声音和稳定的动作衔接,成为观众眼熟的那个“同一个人”。


不光要对口型,还要会“演”


数字人直播早期,大家最在意的是嘴型对不对得上声音。现在这一点基本都能做到了,但观众的要求已经不止于此。一个数字人如果只是嘴巴在动,眼神发直,身体僵硬,那么哪怕口型完美,看起来也像个精致的木偶,谈不上什么感染力。


要让数字人活起来,关键是把所有表现手段统一成整体。我们人说话时,大脑从来不是单独指挥嘴巴。要强调某个词,眉毛可能会扬起,手会不自觉地比画,身体可能会前倾。所有这些同步发生的细微变化,构成了“表达”这件事本身。


新一代的实时生成系统不再把文本转语音、语音对口型、表情生成、动作规划分开处理。它把这些放进一个统一的框架里,将文本要表达的意思、语音的韵律与情绪、面部的细微表情和身体的姿态动作,作为一体来考虑。当数字人要说一句欢迎词,系统不只是让它张嘴,还会根据“欢迎”的语义和语气,自动配上恰当的微笑、目光注视、微微张开的手臂。如果说到关键信息,语速放慢,重音加强,眉毛会配合着轻轻一抬,手指可能会指向屏幕上的商品。


从回答问题,到讲解功能,再到唱一段旋律甚至表演舞蹈,数字人都可以捕捉到停顿、轻重、快慢和节拍。它知道什么时候该认真地注视观众,什么时候该放松地笑一下,就像真人在镜头前自然地“开小差”或“专注”。这样生成的画面不再是单纯的对口型,而是让“说什么、怎么说、如何表现”这三个层面协同一致,最终呈现出浑然一体的表达效果。



拿商品不穿模,换场景不跳戏


在卖货的直播间里,数字人主播有一项实在的工作:拿东西,展示商品,放下,再换下一个。这看上去简单,做起来却是一个视觉挑战。


要生成一个伸手拿东西的动作本身不难,难的是让这个动作遵守现实的物理规则。数字人的手不能直接穿过商品,身体挡住了商品时要有正确的遮挡关系,眼神和手势必须同时指向同一个物品,而且介绍完一个商品换下一个的时候,画面不能突兀地跳一下。


过去的虚拟主播,商品往往只是摆在面前的一个静态画面,跟主播没什么真正的互动。现在则是把数字人、商品和背景放在同一个三维空间里来理解。当主播要介绍一款产品,系统会根据指令,实时生成一段画面:主播眼神移向商品,手自然地抬起,指向商品的同时身体微微转向,商品本身也跟着被拿起或转动。所有视线方向、手势轨迹、身体朝向和语言讲解,都围绕同一个目标物体同步变化。当切换到另一个商品时,旧的物品被平稳地放下或者移开,新的物品被自然引入,整个过程像一条平滑的曲线,不会出现物品乱飘、手穿模或者画面突然切到另一个镜头的生硬感。


场景切换也一样。从温馨的居家背景换到明亮的演播厅,过渡是连贯的,主播不会在这个过程中消失一瞬或出现重影。这种稳定的人物—物品—场景关系,让看直播的人感觉更真实,更可信,也强化了商品展示的说服力。


背后的技术推力


做到上面这些,不是靠单一技术突破,而是一套技术的组合。


第一项是双时域记忆驱动的长时视频生成。前面说过防止漂移,这里的方法是把连续视频当成一串有状态的时空序列。系统同时运行两条线索:短期线关注眼前几秒内,眨眼、微笑、点头这些动作的连续;长期线则一直锚定人物的身份特征和整体风格。通过动态压缩不重要的旧信息、定期回溯关键特征点,以及在不同片段之间施加一致性约束,把误差积累控制住。这样,即使连续运行数小时,不断切换话题和动作,数字人的核心特征也不会丢失,而且画面衔接自然。


第二项是数据引导的低步数流式蒸馏。高质量的视频生成模型通常需要很多计算步骤,去噪过程一步步来,耗时很长,如果不优化,根本没法实时推流。技术团队采用了一种蒸馏方法,把多步去噪压缩到很少的几步。为了让精简后的模型不降低质量,他们用教师模型直接在真实视频样本上估计一个得分,再引导学生模型的生成分布向真实数据的分布靠拢。相比传统的蒸馏,这样做能在减少步数的同时,保持画面的丰富和自然,不会出现色彩过饱和或者动作模式单一的问题。在运行时,系统还会复用前一个视频单元留下的历史时序信息,进一步降低每一个新生成单元的计算延迟。最后,把生成、解码、编码和推流这几个步骤组织成一条异步流水线,第一个画面一就绪就立刻往外送,后续画面趁着当前画面还在播放的间隙加紧计算,从而把少步生成的低延迟转化为稳定持续的实时视频流服务。


第三项是基于多模态感知评价体系的强化学习。技术上能生成画面,但怎么保证生成得“对”呢?比如数字人要根据指令展示商品,表情得自然,动作要跟得上语言。这里就构建了一个评价体系,它不只是看画面清不清晰,而是综合判断多个维度:说的话和动作对齐没有,看起来听进去自然不自然,有没有准确跟随用户的指令,身份有没有跑偏,前后画面连贯不,拿取东西时交互合不合理。这些评价指标都可以量化,并转化成强化学习的奖励信号。训练过程分成两步:先通过监督微调,让模型从优秀范例里学会基本的理解和表达能力;再以这个模型为基础,让它去尝试,评价体系不断打分,模型逐步学会从多个可能的生成结果里,选择那个更自然、更连贯、更符合要求的。这样一来,模型的优化目标就不再只是“画出好看的图”,而是“给出让真人观众觉得舒服的整体呈现”。整个流程形成了一个“数据—学习—评价—优化—再回流数据”的循环,持续提升。


下一步走向哪里


实时生成的路径才刚刚打开。目前,它已经能支撑一个数字人主播独自完成长时间的营销直播。接下来,技术的边界会继续扩展。


数字人数量会从单人走向多人同场。未来,两个或者更多数字人可以像真人主播和助播那样,一起互动、调侃、配合演示产品。表达形式也会更多样,唱歌、跳舞、带货讲解会成为基础功能,主持访谈、景点导览、操作演示等更加复杂的场景也将出现。


交互方式会变得更加直接。用户不光可以用文字和语音下指令,未来或许一个手势、一张图片或者一个表情,就能让数字人实时理解并给出相应反应。用户还可以根据喜好,不只是定制数字人的外貌,还能设定它的声音特质、性格倾向、说话风格和习惯性的小动作,让每一个数字人都能成为独一无二的内容生产角色。


当数字人能够实时地理解、思考、表达和行动,它们就不再是屏幕上循环播放的宣传片,而变成了灵活的数字劳动力。这种能力将在营销之外,逐步进入教育、客服、娱乐、信息服务等各个需要人与机面对面持续交流的领域,带来新的可能。

核心产品
    联系方式
      Public QR Code
      官方公众号
      Affairs QR Code
      商务合作