《智能涌现》独家获悉,腾讯混元多模态理解负责人胡瀚近期已提出离职。这位前微软亚洲研究院视觉计算组首席研究员,于2025年初加入腾讯,原本负责视觉大模型研究,后续调整中进入大语言模型部旗下的“Frontier”前沿技术研究组,专攻多模态理解方向,向姚顺雨汇报。

与此同时,腾讯大语言模型部负责人姚顺雨正在密集梳理旗下团队。知情人士透露,胡瀚此前所在的研究组或将聚焦世界模型的前沿研究。自2026年年中以来,混元体系的人员变动一直在持续——7月初,前OpenAI研究院、麻省理工学院博士田永龙加入大语言模型部,将接替胡瀚负责视觉语言模型方向的研发,同样向姚顺雨汇报。

打开网易新闻 查看精彩图片

姚顺雨加入腾讯后的核心任务很明确:补全短板,把混元基模的能力快速拉入第一梯队。重新梳理资源分配、将人才和算力聚焦到大语言模型部主导的基础模型研发,是他上任后的关键动作。腾讯撤销AI Lab后,核心研发人员全部并入大语言模型部;大模型人才的招聘力度也随之加大,来自字节Seed Infra团队和后训练团队的多名研发已陆续加入。

打开网易新闻 查看精彩图片

但紧迫感远不止于外部观察。6月5日的腾讯云AI产业应用大会上,腾讯集团高级执行副总裁汤道生替外界抛出一个尖锐问题:很多人说腾讯在AI上慢了,你觉得我们真的慢了吗?一名混元研究员向《智能涌现》坦言:“顺雨比腾讯的高层更急。”他透露,姚顺雨多次向高管为混元争取更多算力资源。另据“晚点LatePost”报道,Hy3发布前一个月,一批数据出现问题时,姚顺雨用少见地严厉措辞告诫团队:“数据非常重要。如果下次再出现这样的情况,直接走人。”

当各条AI战线均未跑出领先身位时,腾讯必须重新衡量各个技术方向的收益。胡瀚所从事的多模态理解研究已趋于成熟,继续投入资源的收益十分有限。一名多模态研究员对《智能涌现》解释:“文字、图像、视频识别准确率基本上能达到85%以上,难的其实是视觉推理——让模型理解图像和视频意味着什么。这一步靠多模态研究是不够的,要提升语言模型的推理能力。”多位受访者指出,多模态理解对应的“识图”“看图写话”等场景无法直接商业化。一位元宝产品经理直言:“没有用户愿意为识图付费,市面上有大把免费可替代的产品。用户真正愿意付费的,是文档处理、PPT制作、研报制作这些办公场景——背后对应的是推理、Coding、Agentic能力。”

打开网易新闻 查看精彩图片

算力资源的掣肘更让取舍变得迫切。2025年腾讯全年资本开支为792亿元;同一时期,阿里的财年资本开支达到1260亿元;据彭博社报道,2026年字节计划将AI基础设施投入最高推至700亿美元。资源有限,混元内部难免面临僧多粥少的局面。暂缓技术红利有限的多模态理解研究,聚焦更代表未来的前沿方向,是腾讯权衡收益后的抉择。

7月6日,姚顺雨交出了加入腾讯后的第一份正式答卷——大模型Hy3。在同等参数量的中等尺寸模型中,Hy3已能与GLM-5.2、DeepSeek V4 Pro掰手腕。在腾讯AI自身的坐标系上,姚顺雨加入以来的组织重组、基建体系重构以及回归基模的战略,让混元在短短半年内获得了坐上AI Tier 1牌桌的资格。