智猩猩AI整理

编辑:林夕

刚刚,Ricky T. Q. Chen在 X 平台以简短文字的形式发布一条个人更新,称“这是我在 Meta 的最后一周”。

该推文未具体说明下一站去向,仅以“兴奋地开启新的冒险,并期待发现更多未知的事物”作结。

打开网易新闻 查看精彩图片

Chen 自 2021 年起在 Meta AI 下属的 Fundamental AI Research(FAIR)实验室担任研究员。

打开网易新闻 查看精彩图片

加入 FAIR 之前,他在多伦多大学师从 David Duvenaud 完成博士阶段研究(2017–2021),并于英属哥伦比亚大学获得硕士学位(2015–2017)。

打开网易新闻 查看精彩图片

在公开履历中,Chen 把研究兴趣概括为生成模型、深度学习、动力系统、归一化流与 Neural ODE / SDE / 扩散模型

其博士期间的代表性工作是2018年发表的《Neural Ordinary Differential Equations》。

该论文获得NeurIPS 2018最佳论文奖,核心思路是用常微分方程描述神经网络中的连续变换,也成为Chen此后持续研究生成模型的重要起点。

打开网易新闻 查看精彩图片

加入 FAIR 之后,Chen 与长期合作者 Yaron Lipman 等共同推动了 Flow Matching(FM)方法论的建立与扩展。

该方向的起点为 2022 年 10 月发表于 arXiv 的Flow Matching for Generative Modeling,该论文经修订后于 2023 年 2 月进入ICLR 2023 接收版本

打开网易新闻 查看精彩图片

次年 2 月,Chen 与 Lipman 发布Flow Matching on General Geometries,把方法推广至黎曼流形,并被ICLR 2024 接收

打开网易新闻 查看精彩图片

2024年12月,Meta FAIR联合MIT、魏茨曼科学研究院的研究者发布《Flow Matching Guide and Code》,对Flow Matching的数学基础、设计选择和扩展方法进行了系统总结,并同步开源代码。

打开网易新闻 查看精彩图片

Chen 在其离任推文中将过去五年描述为“与了不起的长期合作伙伴一起开创 Flow Matching 研究方向”,并把该方法归纳为生成模型在“图像、音频、视频、分子、材料、文本、多模态”领域的核心方法。

该说法与 2024 年“Flow Matching Guide and Code”综述对 FM 适用范围的列举相一致。

在 Flow Matching 之外,Chen 近年的研究也已经延伸到视频和多模态生成

其个人主页目前将Muse Image 和 Muse Video列为 2026 年的代表性研究项目,并将其归于 Meta Superintelligence Labs。

打开网易新闻 查看精彩图片

他的最新研究列表中还包括Flowception,这项工作将 Flow Matching 用于视频生成,并已发表于 CVPR 2026。

除此之外,他还参与了OneFlow、Edit Flows等工作,继续围绕 Flow Matching 在生成模型中的应用展开。

打开网易新闻 查看精彩图片

而在离开 Meta 前的最后一段时间里,Chen 已经转向更偏产品和模型落地的工作。

他在离职帖中透露,自己后来加入 TBD 团队,并参与了Muse Image 和 Muse Video 从零开始的训练

就在 Chen 宣布离开 前一天,Meta 在生成式 AI 产品层面亦有动作,Meta 发布其语言模型系列的最新版本 Muse Spark 1.3

打开网易新闻 查看精彩图片

首席 AI 官 Alexandr Wang 表示该模型在编程任务上优于OpenAI 同期模型 GPT-5.6 Sol,与Anthropic 的 Claude Fable 5.1表现持平。

打开网易新闻 查看精彩图片

官方介绍显示,新版本重点提升了Agent和编程任务能力。在长任务中,它可以自己整理上下文、修正计划并完成最终任务。

从 Artificial Analysis 的测试来看,Muse Spark 1.3(xhigh)的 Intelligence Index 达到61分,max版本进一步达到 62分。61分已经与 GPT-5.6 Sol、Grok 4.6 等模型处在同一档位,62分的max版本则进一步逼近顶级Claude模型

打开网易新闻 查看精彩图片

9月1日,Meta还发布了Muse Voice Transcribe,进入实时语音模型。

打开网易新闻 查看精彩图片

也就是说,这段时间Meta正在连续补齐Muse系列:Spark做推理和Agent,Image做图像生成,Video做视频,Voice Transcribe则负责实时语音。

在 Muse 系列快速推进之际,参与 Muse Image 与 Muse Video 从零训练的 Chen 选择离开,且未公布下一站。

对一个从 Neural ODE、Flow Matching 一路做到大规模生成模型的研究者而言,他下一步会把这套经验带向何处,目前没有公开信息。

关注+星标,获取AI前沿进展与开源一线动态