今年夏天,视频生成初创公司Synthesia的企业事务主管亚历山德鲁·沃伊卡(Alexandru Voica)给我发了一个链接,是他们公关团队新添加的成员——这让我十分惊讶。链接内容是他本人的互动虚拟数字分身,经过训练可以回答有关Synthesia公司业务和运作方式的常见媒体提问。就在前一天,我参加了一场小组讨论,公关人员问我是否介意使用AI生成文本的媒体推介稿。但亚历山德鲁的数字分身远不止于此——在我看来,这就是AI应用于公关领域的终极形态。
今年9月,Synthesia邀请我参观他们在纽约的新办公空间。这家公司最初总部设在英国,是与D-ID、HeyGen、Colossyan等公司并驾齐驱的热门数字分身初创企业。今年早些时候,其估值已达到40亿美元,去年公司透露年度经常性收入已突破1亿美元。
Synthesia让企业能够利用AI数字人打造互动培训视频,最近还推出了一款名为"角色扮演会话"(Roleplay Sessions)的产品,让员工可以与互动式AI数字人练习,比如销售话术,数字人会做出回应并对员工的表现打分。
当我参加新办公室开幕活动时,他们问我是否想要一个专属的AI数字分身,我毫不犹豫地答应了。我当然想要属于自己的数字分身。那天我穿的衣服很可爱,头发也很整齐。
在遇见我的数字分身之前,我对数字人一直持无所谓的态度,但我觉得它们终将成为日常网络生活的一部分。我听说有人在Instagram上创建自己的数字分身来制作社交内容。我觉得这一切都很有趣,也许正因如此,我现在才能毫无顾虑地向大家展示我的数字分身。这是Synthesia第一次为记者制作数字分身(此前也只为沃伊卡本人制作过)。它经过训练,专门用来回答关于我写的一篇文章的问题——那篇文章讲述了为何有风险投资背景的初创公司比没有风险投资背景的初创公司犯下更多欺诈行为。它只会回答与那篇文章相关的问题。
下方只需点击"在新窗口中开始"即可开始体验。
你可以问它这样的问题:
我为什么决定写这篇报道?
这篇研究论文讲的是什么?
研究人员发现了什么?
为了制作这个数字分身,我走进了Synthesia办公室里的一个小型摄影棚,他们为我拍摄了大量照片,还录制了两分钟的语音样本。我需要同意制作这些数字分身,就这样,"数字多姆"诞生了。他们为我制作了一个个人版数字分身(只会朗读我提供的任何脚本),有戴眼镜和不戴眼镜两个版本;还为我制作了两个互动版数字分身(能够与我对话并倾听我说话),同样也有戴眼镜和不戴眼镜两个版本。
我们选定了一篇文章用来训练这个互动数字分身,然后其中一个团队搭建了我的互动数字分身,它由语音转文字、视频、语言和文字转语音等多种模型组合驱动。我的数字分身技术栈包括Synthesia自研的视频和语音模型,不过该公司也允许客户从其他实验室选择替代方案,比如Cartesia、ElevenLabs、谷歌或OpenAI。企业还可以选择将数字分身托管在自己选定的任何云平台上,或者付费让Synthesia代为托管。
语音转文字模型将人们说的话转换成文本,智能体语言模型理解文本内容并据此采取行动,文字转语音模型将回复内容转换成音频,最后由Synthesia自主研发的视频模型为数字分身的说话过程配上动画效果。
总体而言,Synthesia打造了三类产品——一个视频创作与分发平台,配备传统数字人,用户输入脚本,数字人便会照本宣科;一个名为"会话"(Sessions)的智能体平台,人们可以在调查问卷或角色扮演中与数字人互动;还有一个API平台,人们可以将Synthesia的视频和语音模型与其他技术服务结合,打造互动数字人或其他类型的产品。
Synthesia团队花了几天时间制作我的数字分身。我先试玩了个人版数字分身,输入了一段比较普通的台词,想听听我的AI语音效果如何。我让它谈论纽约的秋天已经来临,这是我最喜欢的季节。语音效果相当准确,我很高兴它没有沾染上我录制语音样本时嗓音的沙哑感。
我把它展示给一些不懂技术的朋友看,他们觉得这既有趣又有点瘆人。
接着我给他们看了互动版数字分身,它是确定性的,意味着它只会针对训练内容做出回应。在这个案例中,训练内容就是我那篇关于风险投资欺诈的文章。我问了它一些问题,比如我在TechCrunch之前在哪里工作,我住在纽约的哪个区域,但每次它都把我引导回那篇文章的内容上。
我的朋友们觉得这个语音听起来不太像我本人,认为其相似度不如个人版数字分身,但即便如此,相似程度也足以让人感到些许瘆人。我妈妈称它"了不起",这对她来说算是相当高的评价了。她和我爸爸不停地想问一些"只有他们才知道"的关于我的问题——但这个模型没有回答,每次都把他们引导回那篇风险投资欺诈的文章。
"我不记得自己生了你们两个。"她测试完这个模型后开玩笑说。
这次经历让我思考新闻业的未来会是什么样子。人们能接受打开电视新闻,播报者却是一个数字人吗?一位投资人立刻告诉我不行。确实,如今社交媒体和其他新闻分享平台上充斥着AI垃圾内容,人们对此反感情绪强烈。但我问过的其他人却没这么确定。数字人能否增强甚至取代记者?企业高管是否愿意与一位记者的AI数字分身对话,而不是与真人记者交流?
我喜欢我的职业,因为它让我能与人建立联系、撰写报道、研究新话题。但新闻业最重要的部分是信任。这一点似乎永远无法外包给AI。
抛开新闻业不谈,我相信克隆自己这个想法本身就颇具吸引力。休假或度假归来后再也不用忙着处理积压的工作,因为总有一个"你"的版本一直在线,随时回答问题。
我们还需要观察数字分身在美国企业界的使用方式将如何演变。但现在我拥有了自己的数字分身,心情却很复杂。最初的新鲜感过去之后,我仔细端详着停止说话后的数字分身,等待着——我也不确定自己在等什么。也许我在等它眨眼。或者说点新内容,或者微笑一下,又或者只是让我知道它是"有意识"的。
由于我的数字分身是确定性的,它们永远不会那样做。但我能理解,如果换成非确定性的数字分身——由可以自由发挥、随意评论的聊天机器人驱动——人们很容易陷入某种AI精神错乱的状态。
我曾告诉一位投资人,无论数字分身的未来如何发展,我预测我们这一代人,也就是Z世代,很可能不会习惯它们。这种感觉太科幻了:我们在电影里见过的一切场景,如今都已成为现实。但我要说,比起人形机器人,我觉得数字分身让人没那么不安。至少面对数字分身,如果情况变得诡异,我随时可以下线退出。
不过在那之前,先来看看我的个人版数字分身,为大家播报一下本周我们网站上的所有热门新闻吧!
Q&A
Q1:Synthesia是一家什么样的公司?
A:Synthesia是一家视频生成初创公司,最初总部设在英国,是数字分身领域的热门创业公司,与D-ID、HeyGen、Colossyan等公司同属这一赛道。今年早些时候估值达40亿美元,去年年度经常性收入已超过1亿美元。
Q2:Synthesia的数字分身是如何制作出来的?
A:制作过程需要在摄影棚拍摄大量照片,并录制两分钟语音样本。数字分身由语音转文字、视频、语言和文字转语音等多种模型组合驱动,最终由Synthesia自研的视频模型为其配上说话动画。
Q3:确定性数字分身和非确定性数字分身有什么区别?
A:确定性数字分身只会针对训练内容做出固定回应,超出范围就会被引导回原主题;非确定性数字分身则由聊天机器人驱动,可以自由发挥回答,但也更容易让人产生不真实的错觉。
热门跟贴