来源:市场资讯
(来源:第一财经资讯)
记者:李昂、吴洋洋
编辑:吴洋洋
第一财经「新皮层」获悉,腾讯多模态团队正在进行一系列调整。
接近腾讯的人士告诉「新皮层」,继7月初麻省理工学院博士、曾在OpenAI与姚顺雨共事过的田永龙加入混元多模态团队,负责多模态理解模型(VLM)的研发并直接向腾讯首席AI科学家姚顺雨汇报,以及混元文生视频和文生图片算法负责人钟钊离职后,混元多模态业务原负责人薄列峰也可能变动,而不久前从可灵离职的高级研究员则于近期回到腾讯,不过他入职的不是混元(TEG,技术工程事业群)的多模态部门,而是腾讯游戏业务(IEG,互动娱乐事业群)的多模态团队。
腾讯在7月24日调整了混元的组织架构,将原本由姚顺雨和薄列峰分别管理的大语言模型和多模态模型部门合并,成立基础模型部,统一由姚顺雨负责。接近腾讯的人士称,田永龙之后可能接手更多工作,成为姚顺雨统领的混元下多模态板块的实际负责人。
这一系列人事和架构调整与混元在多模态方向的成果有限有关。
公开资料显示,,主要负责多模态方向,向腾讯副总裁、时任混元整体项目负责人蒋杰汇报。加入腾讯前,薄列峰是阿里通义实验室视觉负责人。
去年9月和11月,混元先后发布图像生成模型HunyuanImage 3.0和视频生成模型HunyuanVideo 1.5,后者有83亿参数,不具备音画同步的端到端生成能力,即做不到输入提示词后直接一步生成音画一体的视频,也没有解决人物说话口型同步问题。
去年11月至今,混元没有再发布过新的多模态模型。而在此期间,阿里巴巴、字节跳动和可灵先后突破了视频生成的音画一体化能力,并在多模态生成的推理能力上取得进展,其中字节在此期间更新了Seedance 2.0和Seedance 2.5两代模型。
公开资料显示,今年3月钟钊领导的团队与浙江大学联合发布过一个叫OmniWeaving的开源视频生成模型,探索方向也是「理解-生成一体化」,尝试让模型从被动的像素渲染器变成主动的智能生成器,即当用户输入的需求含糊时,模型能主动推理用户意图,从而生成更符合用户需要的视频内容,而不再像过去那样只是将用户输入的语言直接碎片化地翻译成像素。
钟钊与浙大的联合团队在OmniWeaving论文中称,「Seedance2.0(字节)、Kling-3.0(快手)、SORA(OpenAI)、Veo3(Google)已在很大程度上实现了下一代Omni(理解与生成一体化)能力智能视频生成,但底层技术未披露,留下了显著的研究空白。」
OmniWeaving可以被视作混元多模态团队在与Seedance 2.0类似方向上的一次尝试,不过效果与后者存在差距。这个模型也从未正式——以HunyuanVideo的名义——发布。
知乎博主「微卷的大白」测试Seedance、Kling(可灵)和OmniWeaving发现,Seedance和Kling都能在少数抽卡次数下生成自然、大体符合物理规律的视频,而OmniWeaving在抽卡20次后生成的视频仍然极为违反物理规律,视频中的橙子在被刀切开之前就已经分开了。
另一位接近腾讯的人士告诉「新皮层」,今年上半年,腾讯内部测试一款名为WorkRally的漫剧视频创作产品时,产品可调用的多模态模型包括Seedance、可灵、Veo(Google)和HappyHorse(阿里),不包括混元的多模态生成模型。
钟钊不久前在朋友圈发文称「也许即将发布的版本将是我在心爱的HunyuanVideo和HunyuanImage中的最终版本」,言下之意,HunyuanVideo和HunyuanImage可能将有新版本推出。不过7月24日宣布的架构调整为这项发布增加了不确定性。
在腾讯内部,有多个事业部都在尝试从多模态领域中寻求突破,混元只是其中之一。
上述接近腾讯的人士称,IEG已经在内部推出过自己的多模态模型,仍在开发中的一款办公助手中调用的音频生成模型也来自IEG,而非混元。
微信事业群自研的WeLM模型目前还不是个多模态模型,不过其公开招聘信息已在招募多模态预训练、视觉‑语言对齐算法岗位。
热门跟贴