现在打开直播平台,数字人主播越来越常见了。但早期的数字人一眼就能看出来是假的——脸僵、动作就那几套、嘴在说话手却不动,看两分钟就出戏。

最近美团技术团队发了一篇长文,把自家数字人直播方案从形象生成到推理部署的整条链路都讲了一遍,里面有几个技术点挺有嚼头。我挑了四个最关键的拆开聊聊,顺便用大白话解释一下它们到底解决了什么问题。

打开网易新闻 查看精彩图片

先说背景。数字人直播这事,难点不在"能播",而在"像人"。商家请数字人,要的是能 7×24 小时开播、成本还比真人低,但观众的眼睛是雪亮的,脸僵、动作机械、手势跟话对不上,停留时长立马掉。所以美团这套方案围绕四个词做文章:长得真、动得准、演得活、卖得好。

长得真:把"脸"和"姿势"拆开管

数字人最容易翻车的地方是换装。商家今天想给主播换件应季外套,明天想换个背景,结果衣服一换,脸也跟着变了,观众直接懵:这谁?

传统做法把身份、姿态、背景全搅在一起生成,一改就崩。美团的思路是"解耦"——用结构残差注入把身份特征单独融进模型,再用空间解耦正则化把身份特征"按"在脸部区域,最后用区域动态掩码隔离开不同区域的特征流动。说白了,就是让模型搞清楚:脸是脸,姿势是姿势,背景是背景,各管各的,别串味。

配套的 SREdit 编辑方案更有意思,它让同一个模型既当编辑器又当评判器。以前编辑器和评判器是分开的,模型容易学坏——为了骗过评判器搞出一些看着分数高、实际很怪的结果(术语叫 reward hacking)。现在两者共享同一套视觉理解,想骗也骗不了,实验里在三个公开基准上整体提升了 2.5% 到 3.8%。

打开网易新闻 查看精彩图片

动得准:把动作生成当成"写文章"

让数字人根据文案做动作,本质上和让大模型写文章是同一件事——都是预测"下一个该出什么"。美团提出的 MoTiGA 就是把大模型那套自回归生成范式搬到了人体动作上。

这里有个细节很戳我。传统的 RVQ-VAE 用的是双向卷积,训练时模型能"看到未来",但推理时只能一步步往后生成,训练和推理行为不一致,动作质量就崩。MoTiGA 把所有卷积换成因果卷积,从根上消除这个差异,重建质量直接提升了 72%。

另外它还引入了人类偏好优化:人工标注十万多组"哪个动作更自然"的对比,让模型照着人的审美生成,动作自然度已经相当接近真人。

演得活:手势要跟着语义走

真人主播说"这款披萨用料非常足"会张开双手比划,说"请看右边链接"会伸手去指。这种语音和手势的语义配合,是观众判断"像不像真人"的关键线索,但老方案基本做不了——它们要么只会点头摆手这种自发动作,要么得等整段语音说完才能一次性生成全部动作,直播根本等不起。

StreamingTalk 的思路是流式生成:把整段生成拆成一个个小片段,边说边生成,延迟恒定,时长无限也能扛。每个片段还能绑定独立动作标签——介绍产品时双手展示,讲优惠时兴奋挥手,回答问题时托腮思考,全程一条连续流平滑过渡,不会突然卡壳。

卖得好:把视觉 Token 压缩 75%

技术再牛,成本扛不住也白搭。数万商家同时开播,每路直播都要做视觉理解和画面渲染,按传统多模态大模型的做法,单路 GPU 占用高得吓人。

美团的 Glance2Gaze 借鉴了人眼的"扫视-注视"机制:先快速扫一眼拿全局信息,再盯着关键区域看细节。技术上分两步:Glance Fusion 把 ViT 各层的特征融合起来,信息更全;Gaze Compression 把压缩模块直接嵌进大模型的 decoder 层,视觉 token 从 576 个渐进压到 288 个再到 144 个。这一下压掉 75% 的 token,推理提速 2.5 倍,并发成本降了 60% 以上,而且完全兼容 FlashAttention-2,不用额外改推理基建。

单项技术突破只是第一步,真正落地还得靠系统架构。美团智播整了个"双引擎"中台:实时交互引擎负责观众提问后的秒级响应,全双工流式调度,前一阶段刚出结果就触发下一阶段;内容量产引擎则用"创意-检索-思考-生成-评测"五个智能体协作,把单条讲解视频的生成时间从人工的数小时压到分钟级。

打开网易新闻 查看精彩图片

整套架构还有个原则我觉得挺妙——"形象-动作-场景"三维解耦。形象、动作、场景完全独立管理、自由组合:同一张脸能配不同动作风格,同一套动作能用在不同形象上,内容生产的边际成本被压得很低。

从身份解耦到流式生成,再到 Token 压缩和双引擎架构,这套技术组合拳的核心其实就一句话:把复杂问题拆开,让每个模块只干一件事。这种思路放到其他生成式系统里,一样成立。

你平时看直播会留意数字人主播吗?还是说你们团队已经在做类似的多智能体方案了?评论区聊聊。