7月23日,腾讯一则内部组织架构调整,让AI圈彻底不淡定了。
混元多模态模型部门和大语言模型部门正式合并,成立"基础模型部",统一由腾讯首席AI科学家姚顺雨全权管理。与此同时,原大语言模型部、多模态模型部全部撤销。
如果你对AI行业足够敏感,应该能闻出来——这不是一次简单的人事变动,这是腾讯在AI赛道上发起总攻的信号弹。
Hy3暴增68倍,腾讯尝到了甜头
为什么选在这个时候合并?答案藏在一个数字里:68倍。
7月初,腾讯正式上线了新一代大语言模型Hy3。这款模型的表现极其凶悍——展现出显著强于同尺寸模型、且能比肩参数规模2到5倍旗舰模型的智能水平。一周之内,Hy3的总调用量较上一代Hy2暴增68倍。在WorkBuddy自选模型的用户中,选择Hy3的占比直接干到了60%。
60%是什么概念?意味着腾讯内部最懂AI的那批工程师,用脚投票,绝大多数选了自家模型而不是外部模型。这个数字比任何benchmark都更有说服力。
Hy3已经在WorkBuddy/CodeBuddy、元宝、Marvis、ima等多个业务全面接入,API在腾讯云TokenHub和多个海外平台上线。这代表什么?代表腾讯的AI能力不再停留在"实验室发论文"的阶段,已经进入"全业务线真刀真枪用起来"的阶段。
但恰恰是这个68倍的增长速度,暴露了一个问题:多模态和语言模型分成两个部门做,效率不够了。
为什么要合并?不是在搞"机构改革",是被市场逼的
腾讯混元目前构建了图像、视频、语音、3D生成模型等完整的模型矩阵。混元3D世界模型2.0(Hy World 2.0)社区下载量超过300万,是"全球最受欢迎的3D开源模型"。混元图像模型3.0在LMArena榜单上居国内开源模型第一。
但问题在于:这些能力是分开训练的,语言模型一个团队,多模态模型另一个团队。
分开做的好处是短期内各条线能跑得很快。坏处是:越往后跑,语言理解能力和视觉/听觉/3D能力之间越会出现"隔阂"。用户问一句"帮我分析这张财报图表里的利润率趋势",语言模型需要理解"利润率"是什么,视觉模型需要读懂图表里的数字和曲线,两者如果底座不一致,回答质量就是会打折扣。
这还只是消费侧的问题。在企业侧更严重——一个工厂的AI质检系统,既需要视觉模型看懂产品瑕疵,又需要语言模型输出规范的质量报告。如果两个模型是分家的,系统复杂度直接翻倍。
所以这次合并的本质不是"组织架构调整",而是"技术路线收束"——腾讯想清楚了,要做全模态,就不能各搞各的。
姚顺雨,这个人的履历值得再看一遍
姚顺雨是2025年12月正式加入腾讯的,title是"腾讯CEO/总裁办公室首席AI科学家"——这个title本身就是巨大的信号,意味着他直接向最高管理层汇报,不是某个业务线下面的"AI负责人"。
加入之后他干了几件事,时间线非常紧凑:
- 2026年1月底,启动混元底层基础设施全面重建,涵盖预训练、强化学习、数据体系和评估体系——这是"地基重挖"级别的动作。
- 2026年3月,撤销成立近十年的腾讯AI Lab,核心研发人员并入大语言模型部——砍掉了一个历史包袱,集中兵力。
- 2026年7月初,前OpenAI研究员、麻省理工学院博士田永龙加入腾讯大语言模型部——从全球最顶尖AI实验室挖人。
- 2026年7月23日,大语言模型与多模态两大部门合并,姚顺雨正式掌舵"基础模型部"。
八个月的时间,从重建底层设施,到整合科研力量,到让Hy3打出声量,再到把全模态研发收归一个部门——每一步都在为"大一统"铺路。这节奏快得不像是腾讯。
全模态大一统到底是什么意思?
说人话就是:未来的混元模型,会是一个能同时处理文字、图片、视频、语音、3D的"超级模型",而不是"文字一个模型、图片一个模型、视频一个模型"的拼盘。
这件事有多难?谷歌搞Gemini搞了好几年,OpenAI的GPT-5虽然能看图但主流场景还是文本。全模态的难点不在于"每一种能力单独做到最好",而在于"所有能力共享同一个底座却不互相拖累"。
比如你训练视觉能力的时候,不能让新增的参数把已经学会的语言能力"冲掉"。这叫灾难性遗忘,是大模型领域的经典难题。
腾讯现在的路径是:Hy3作为语言基座已经证明了自己(68倍调用量增长,同尺寸最强),在这个基座上往上叠加全模态能力。相比从零开始训练一个全模态模型,这条路更稳,也更现实。
但这只是第一步。真正的全模态,不只是输入输出多几种格式,而是AI能从不同模态的信息中建立跨模态的因果关系。比如看到一张交通路况的照片,听到广播里说"前方发生了一起追尾事故",能把两件事关联起来,理解拥堵的原因。这种深层次的全模态推理能力,目前在业界还处于非常早期的阶段。
对行业意味着什么?
第一,腾讯的AI战略从"防守"转为"进攻"。过去一年,腾讯在AI上给人的印象更多是"什么火做什么"——大模型火了做混元、AI搜索火了做元宝、AI编程火了做CodeBuddy。但架构调整之后,底层的研发逻辑从各业务线各自探索,变成了一次集中突击。进攻姿态非常明显。
第二,全模态赛道正式进入军备竞赛。腾讯不是第一个喊出"全模态"口号的,但很可能是国内落地速度最快的。如果Hy3的性能增幅能延续到全模态版本,各家大厂都得重新评估自己的全模态路线图。
第三,AI人才战争白热化。姚顺雨+田永龙,一个从普林斯顿挖来的技术领袖,一个从OpenAI挖来的研究员。腾讯在AI人才上的投入已经不讲性价比了,要的就是"最好的人做最难的事"。
别急着叫好,冷静一下
说实话,全模态这个概念被炒了好几年了,但真正落地的产品屈指可数。腾讯这次的组织架构调整方向是对的,但考验也才刚刚开始。
全模态模型的训练成本是纯语言模型的数倍,推理成本也更高。腾讯能不能在成本控制上找到平衡点,决定了这个全模态模型最后是"能跑起来"还是"能大规模商用"。
另外,Hy3暴涨68倍的数据需要持续观察。新模型上线初期的使用量激增是正常的,真正的考验在于3个月后、6个月后,用户留存和日均调用量能不能稳住。
还有一件事不能忽略——OpenAI、Anthropic、谷歌都在往全模态方向走,而且跑得不慢。腾讯在国内的生态优势是实打实的,但到了全球市场,要面对的是已经打了很多年的老对手。
结语
腾讯混元这波架构调整,可以看作是一个AI巨头从"摸石头过河"到"全速冲刺"的转折点。姚顺雨用八个月时间完成了一次教科书级别的技术路线收束,Hy3用68倍调用量增长证明了这个方向的正确性。
但全模态不是终点,只是一个新起点。当所有大厂都朝着全模态狂奔的时候,真正的分水岭会出现在谁能率先把全模态能力变成用户每天都离不开的产品。
腾讯有微信、有QQ、有游戏、有视频号,有全世界任何一个AI公司都羡慕的超级应用矩阵。全模态模型一旦练成,这些应用的体验天花板会被重新定义——那一天到来时,才是这场豪赌真正揭晓胜负的时候。
热门跟贴