WAIC 2026现场,模型能力在具身智能、AI硬件等领域应用是最热门的方向,“AI与人如何更好地交互”成为众多参展者关注的话题。
过去两年,AI语音助手、数字人、陪伴产品层出不穷,但大多数交互仍停留在你问我答的机械逻辑里。当通用大模型能把知识问答做得越来越好的时候,一个更本质的问题浮出水面——AI能不能真正理解人,而不只是回答问题?
笔者在WAIC 2026现场体验SoulX实时数字人及全新AI硬件B Soul后,一个清晰的信号正在浮现:AI交互正在从功能型应答逐渐向情绪感知、实时多模态过渡,而Soul的野心不止于做一款更好的AI社交APP,而是成为一家模型与应用一体化的AI生态公司。
一场有“活人感”的对话
在Soul的展台上,笔者面对Soul的数字人,在没有预设问题、没有引导话术,就是随便聊聊的场景下,进行了一场简单的对话。
令人意外的是,Soul的数字人不是那种逐句等待你说完再接话的节奏,它会在你话说到一半时自然地插入回应,会在你语气变化时调整自己的语调,甚至在你停顿犹豫的间隙里,补上一句“你是不是在想什么?”。而当笔者在它回答问题的时候,打断它,进而转移到其它话题的时候,它也总是能接住后续话题,并继续展开反馈。
这种对话的感觉,不像在跟机器说话,更像跟一个朋友聊天。甚至,它给笔者的反馈要超过某些边看手机边与人聊天的体验。
如果把体验量化,可以通过一个数据来体现:0.87秒。这是Soul实时数字人模型之一——SoulX-FlashTalk的首帧视频输出延时,也是业内首个实现亚秒级超低延时的14B数字人模型达到的数字。听起来只是不到一秒钟的差距,但在实时视频交互中,延迟是决定用户体验的核心变量。
人类在面对面交谈时,对方的反应时间通常在200到500毫秒之间;一旦延迟超过1.5秒,人们开始觉得对方在想,而不是在听。传统大模型驱动的数字人,延时普遍在2到5秒之间,这正是为什么大多数AI对话都像你发一条、它等一会儿再回一条的原因。
这种体验在当前的AI产品中并不普遍。当前市面上的AI互动产品,往往各自聚焦于某一种能力:有的擅长根据角色设定持续输出符合人设的回应,有的通过长期文字交流建立陪伴感,也有的能够识别语音中的情绪变化。但角色回应、情绪识别和真实互动之间,往往还存在一定距离。
Soul的不同之处,在于尝试把情绪感知、实时语音、数字表达和虚拟形象放进同一个互动过程里。AI不只是识别情绪或生成一句符合预期的话,而是结合对话语境、语气变化和互动历史作出回应,让声音、表情和语言等多模态共同参与交流,使互动更接近人与人之间自然发生的对话。
除了数字人,Soul还在WAIC 2026现场首次亮相了公司第一款AI硬件B Soul。这款定位AI硬件的便携式设备,将自研大模型SoulX的语音交互、情感表达和数字生命能力融入其中。用户可以通过配套的软件自定义角色的名称、性别、关系、声音等,角色接入记忆体后能记住与用户的交互内容。这标志着Soul的能力正从手机屏幕走向现实的物理空间。
当模型长在场景里
在B Soul之中,核心的能力来自Soul自研大模型SoulX,而SoulX的定位很明确:基于情绪感知、语音为先、面向多模态的交互大模型。区别于通用大模型什么都能答的路线,Soul选择了一条更聚焦但也更深的路径:专注情绪感知与交互。
这个选择是基于多年深耕行业的经验而做出的。成立于2016年的Soul,没有采用当时主流社交产品围绕真实照片和地理位置做匹配的模式,而选择了一条不同的路:用户以虚拟形象出现,由算法根据兴趣、性格和社交偏好完成连接。当时,AI虽然尚未成为产品主角,却已经承担起撮合者的角色。
2020年前后,Soul启动了AIGC技术研发,围绕情绪感知和交互方向探索自研模型SoulX。如今,Soul已构建了包括语音生成、歌声生成、语音转换、多说话人转录、双工实时交互、实时数字人生成在内的核心能力体系,覆盖语音理解、语音生成、情感表达、交互控制和多模态呈现等关键环节。
更重要的是,Soul的优势不仅在于单项模型能力,还在于已经形成了“模型—产品—用户—数据”的完整闭环:模型在产品中被使用,用户在使用中产生数据,有效反馈推动模型迭代,优化后的模型再进入产品。每一轮循环,模型对情绪的理解就更精确一层。这不是一个可以从外部复制的优势,因为它的起点是一个已经运转了多年的社交平台,而非一张白纸。
2024年全球人工智能市场规模近2800亿美元,2025年达7575.8亿美元,预计2026年将突破9000亿美元。AI落地具体的产业链,形成更大的市场空间已经成为大趋势,但在融入具体的场景中,大多数产品的留存率和商业模式仍不稳固。一个闭环运转的系统能做到的,恰恰是那些单点产品做不到的事:持续迭代、持续积累、持续加深对用户的理解。
Soul App联合中国青年报发布的《2025年大学生AI使用行为与心态洞察报告》给出了另一个维度的佐证:超九成受访大学生已接入AI服务,年轻一代对AI交互的心理门槛正在快速降低,他们需要的不是一个更聪明的问答机器,而是一个能“接住”他们情绪的对象。而能接住情绪的前提,是先理解情绪,理解情绪的前提,是有足够多的场景去观察情绪。这就是闭环的价值。
数据可以说明Soul闭环的运转效率:Soul目前已有460万用户日常使用AI功能,约占整体日活的40%。这意味着,每天有近一半的活跃用户在跟AI交互,在具体的场景中,指导模型有效迭代,创造实际的用户价值。
不止于社交
从一款应用到整体生态的建设,Soul正在将实时语音、数字人、内容演绎和情绪交互能力,从Soul App延伸至AI硬件及To B产业场景。Soul的定位已从社交平台升级为模型与应用一体化的AI生态公司。
SoulX自研模型体系已形成差异化互补的模型矩阵。例如,实时数字人方向,SoulX-FlashHead主打轻量化、低成本,适配消费级硬件,单卡RTX 4090即可实现96FPS流式推理,仅需6.4G显存;SoulX-FlashTalk主打高帧率、低延时,适配实时直播场景;SoulX-LiveAct主打全身动作、小时级稳定,适配长期在线复杂场景。三款模型覆盖不同硬件条件和性能要求,满足开发者的差异化生成需求。
例如,SoulX系列可应用于电商AI直播、短视频制作、AI教育、NPC交互、AI客服等领域,现阶段,也正面向具身智能、内容演绎等行业输出情绪感知与交互决策方案。这意味着,SoulX不再只在Soul App里服务社交用户,它开始进入更广阔的商业世界。
据了解,2026年下半年,Soul计划在国内市场为企业与开发者提供更丰富的一站式多模态交互能力服务,包括面向内容演绎领域输出解决方案,涵盖有声小说、AI漫剧、AI播客等方向。同时基于IP音色和交互技术,面向智能硬件终端提供服务。
这意味着Soul的商业模式正在从单一的C端社交服务,向B端产业解决方案延伸。它不再只是一家社交软件公司,而是正成为一家模型与应用一体化的AI生态公司。
在这样的市场背景下,一家拥有社交场景、数据闭环和模型能力的公司,输出能力、扩展场景、建设生态,是从“做好一个产品”到“定义一个行业”的必经之路。
不仅于此,据悉Soul预计于2027年启动海外市场拓展,优先围绕语音生成、实时交互及内容演绎等能力推出面向海外市场的产品和服务。这一步意味着,闭环的边界将从中国市场扩展到全球,SoulX的赛道也将从国内社交延伸到国际AI语音与人机交互市场。
此前,Soul AI团队已开源了语音合成模型SoulX-Podcast,该模型发布后快速登顶HuggingFace TTS趋势榜,目前在GitHub上拥有超3500星标。此外,团队还开源了歌声合成模型SoulX-Singer、全双工语音对话控制模块SoulX-Duplug、端到端多人对话转录模型SoulX-Transcriber,以及实时数字人方向的SoulX-LiveAct、SoulX-FlashTalk、SoulX-FlashHead等模型。开源是生态建设的杠杆:让更多开发者用你的模型,就有更多人依赖你的基础设施,就有更多场景推动模型优化迭代。
Soul 团队在交互方向的技术基建已经形成了完整的链路:语音理解、语音生成、情感表达、交互控制、多模态呈现,每一个环节都有对应的模型或模块。这不是碎片化的技术展示,而是系统化的能力底座。一个“模型与应用一体化”的定位,需要的就是这种从底层到场景的贯通,而不是只有几个亮眼的单点。
AI交互的终局不是让机器变得更聪明,而是让机器能感知、接住、回应情绪,从而让AI具备“活人感”。Soul正在用一套“模型-应用-场景-数据”的完整闭环,试图回答一个更大的问题:当AI真正学会理解人的时候,人与AI的交互范式会变成什么样子?
热门跟贴