很多人第一次关注数字人,是因为屏幕上的形象逼真。但真正上线后,最先出问题的往往不是脸,而是对话。用户问一句“这个月销量多少”,它还在念预设话术;让它“打开方案书,翻到第5页”,它只能微笑。市面上能播报的数字人不少,能办事的很少。差距不在渲染,在背后那套系统。

我们把高拟真数字人和通用智能体两套能力放在一起,不是为了做一个更逼真的动画,而是要做一种能自然交流、也能动手做事的数字员工。它分成两层:看得见的部分负责形象和表达,看不见的部分负责理解、检索、调用工具、多轮协作。前者决定用户愿不愿意看,后者决定它能不能把事办成。
这种分工听上去简单,落地时每一层都有大量细节。
一、看得见的部分:先让人愿意停下来
数字人的第一项工作,是让人不觉得别扭。这需要面部渲染和唇形同步做到足够细。系统采用高精度面部渲染,语音和口型逐帧对齐。开口、闭口、停顿,都跟着语音走,不是简单张合。这样即便用户说不清哪里不对,至少不会一眼出戏。
但“像真人”不是只有一档。不同场景对画质、延迟、成本的要求差别很大。商业直播需要高画质,能接受一定成本;客服场景更在意稳定和低延迟,画质可以稍让一步。所以渲染方案也分多档:高精度、实时、轻量。客户按场景选,不必为一个展厅大屏支付直播级渲染成本,也不用在客服终端上牺牲响应速度。
延迟是另一个容易忽略的点。很多数字人看起来卡,不是渲染慢,而是整条链路在等完整回答生成。我们采用流式处理,用户说完最后一个字,语音流已经进入识别,识别结果边生成边送到理解模块,理解模块判断意图后立刻触发回应。数字人不是等一段完整音频结束、一句完整回答生成才开始动嘴。体感上更接近真人对话,而不是“说完卡一下再答”。
输出形态也没有限制在单一终端。直播推流、低延迟实时互动、虚拟摄像头接入都支持。它可以进直播间,也可以进视频会议、展厅大屏、线下终端。形象层解决的是“出现在哪里、以什么样子出现”。
二、看不见的部分:听懂、想清、办成
通用智能体是数字人的执行层。它不负责美观,只负责把事情推进下去。
第一件事是语音交互。用户可以通过唤醒词唤起,不需要动手;系统流式识别,边说边听,说完即答,不用等整句录完。更关键的是,数字人说话时用户可以直接插话,系统会立即响应新指令。这比“等它念完再说话”更接近真实交流。多轮对话也保持连贯,不会突然重启话题。
第二件事是判断。系统会在毫秒级区分用户是在闲聊,还是真要办事。问候、感谢这类高频表达直接回应,不触发检索。真正要查资料、执行操作时,再路由到对应能力。这样做不是为了省事,而是为了快。最常见的交互如果都要走完整检索流程,延迟和资源都会被无效消耗。
这件事的难点在于,闲聊和办事之间没有明显边界。用户可能先问“你好”,紧接着说“帮我查一下上个月销量”。系统必须在几百毫秒内完成两件事:识别第二句不是闲聊,并把任务交给数据查询模块。延迟就是这么累积起来的。所以判断逻辑不能太重,又要足够准。
第三件事是检索。知识库查询只在确有需要时触发。检索结果还会经过相关性把关,不相关的内容不会进入回答。检索模块返回候选片段后,还会经过一次相关性判断,只有与当前问题真正相关的内容才会被采纳。否则宁可说“我没有找到”,也不硬塞一段看似相关、其实离题的文本。很多数字人翻车就翻在这里:用户问A,它从知识库捞出B,然后一本正经念出来。

第四件事是记忆。系统自动维护对话上下文,连续提问不会丢线;用户画像和偏好也会被记住。第二次见面,它至少知道你是谁、上次聊过什么。这比第一次冷启动要自然得多。
多轮记忆也不是简单记住上一句。比如用户说“打开方案书”,数字人问“翻到第几页”,用户说“第5页”。如果丢掉上下文,第二句就成了孤立指令,系统可能不知道要翻哪份文件。这类连续指代在真实对话里大量出现。
第五件事,也是通用智能体最独特的能力,是动作执行。它不只是聊天,还能真正动手办事。用户用自然语言就能控制本地操作,不需要切换界面、找按钮:
“打开方案书,翻到第5页。”
“显示这张产品宣传图。”
“播放产品演示视频。”
“打开官网。”
“这个月销量多少?”
从“说”到“做”,一句话就能落地。这是通用智能体和传统问答机器人最大的区别。
最后是扩展性。技能接入采用模块化、可插拔方式。新增一种能力,不用改动核心架构,可以快速上线。今天它会查资料,明天可以对接业务系统。技能库随业务需求生长,而不是每次都要重做一遍。
三、几个设计上的取舍
这几项原则贯穿整条链路。
实时优先。端到端延迟是首要指标。任何环节只要会拖慢响应,就会被重新设计。数字员工如果三秒后才说话,形象再真也没用。
准确优先。宁可多一步判断,也不答非所问。准确性比速度更重要,但准确不是靠堆检索,而是靠判断该不该检索、检索回来能不能用。
按需计算。只做必要的计算和检索。把算力花在刀刃上,不给所有问题都走重流程。
自然交互。随时打断、持续聆听、上下文衔接。允许用户在数字人说话时插话,也允许对话跨轮继续。真人对话就是这样,不完美,但自然。
四、在这些场景里,它的价值更具体
智能客服。7×24小时在线,秒级响应,能查知识库也能执行简单操作。人工压力会明显下降,尤其是在重复性问题上。
在线教育。可以自动展示课件,实时答疑。不是念PPT,而是学生问哪里,它调出哪一页。
电商直播。数字人主播讲解商品、回应弹幕。弹幕问题通常是碎片化的,多轮记忆和实时判断在这里有用。
企业培训。自动展示材料,交互式问答与流程演示。员工可以直接说“翻到下一节”,不用自己找文件。
展厅导览。精准讲解知识库内容,随时提问、随时打断。参观者不会按脚本走,系统要能接住临场问题。
数字人解决形象与表达,通用智能体解决理解与行动。分开看,两者都不算新鲜;合在一起,数字人才会从一件会说话的展示品,变成一个能想会做的数字员工。
外貌决定第一眼,大脑决定它能走多远。