打开网易新闻 查看精彩图片

2026 年 3 月,英伟达 GTC 大会的现场,黄仁勋在主题演讲中放出一张幻灯片:在中国开源模型 Kimi K2.5 的推理速度排名里,一家名叫 Eigen AI 的公司排在首位。

“我们事先并不知道。是他在台上讲的那一刻,我们才发现,原来我们真的做到了最快的速度。”Eigen AI 创始人兼 CEO 王瀚锐向 DeepTech 回忆当时的心情:非常意外,也非常兴奋。

那时,Eigen AI 才正式成立 9 个月,员工 20 人左右。不到两个月后,上市 AI 云服务商 Nebius 宣布以超 10 亿美元对价收购 Eigen AI。消息一出,Nebius 股价连续大涨。王瀚锐当时感到一种“复杂”的心情:股价上涨是资本市场的认可,但市场的期待也随之水涨船高,“越涨,我们肩上的重担就越大”。

王瀚锐博士就读于麻省理工学院(MIT)电子工程与计算机科学系(EECS),是韩松教授的“开门弟子”。他从 2017 年起就聚焦 Transformer 和 GPT 架构的高效计算,主导开发的稀疏注意力(sparse attention)系统 SpAtten 是 2020 年以来 HPCA(高性能计算机架构国际研讨会)引用最高的论文之一,配套加速器完成了台积电 28nm 工艺流片。

2024 年从 MIT 毕业后,他推迟了加州大学洛杉矶分校(UCLA)计算机系助理教授的入职时间,选择与两位 MIT 校友联合筹办 Eigen AI。公司的业务很好懂:让开源大模型在 GPU(图形处理器)上跑得更快、更省,再按 Token 对外出售。截至被收购前,在独立评测平台 Artificial Analysis 上,Eigen AI 的推理性能在 25 个主流开源模型上均位列第一。

近日,凭借在 AI 推理效率上的一系列突出工作,他入选了亚太区《麻省理工科技评论》“35岁以下科技创新35人”(Innovators Under 35)。

加入 Nebius,王瀚锐出任高级副总裁(SVP),全面负责 Token Factory 业务,涵盖推理、后训练和智能体系统三条产品线。7 月底,Nebius Token Factory 成为 2.8 万亿参数混合专家(MoE)模型 Kimi K3 的 Day 0 首发合作伙伴。

从学者到创业者,再到大公司的管理者,王瀚锐在几年间换了三种身份,他对此的看法很务实:不为创业而创业,学术和产业之间也从来不是单选题,关键看哪种组织形态最能让技术落地。

看到了领域内尚未被解决的关键问题,也是他做出很多决定的核心驱动力:创业是因为发现GPU大部分时间都在空等数据;谈到未来还想进入哪些领域,他同样描述了两个尚未得到满足的需求:自动为用户挑选最合适的模型,以及人与智能体之间的交互能否突破说话和阅读速度的限制。

在对话中,问及对 AI 长期走向的看法时,王瀚锐的态度相当乐观。在他看来,模型的规模增长(scaling)远没有到头,“再提高 1,000 倍都是有可能的”,Token Factory 的终点则是让智能变得像水和空气一样便宜。

落到具体的产业判断上,他又很冷静。他坦言,推理服务夹在 GPU 厂商和客户之间,是微笑曲线的中段,“更容易受到挤压”。本科和博士期间都做过芯片设计,他却不急于跟进自研推理芯片的热潮,理由是模型的底层算子仍在快速变化,“现在造出来的芯片,3年之后可能就会不适配”。

以下是DeepTech与王瀚锐的对话实录,经过编辑整理。

从 NLP 研究者到 AI 研究者

DeepTech:先请你向我们的读者介绍一下自己,包括之前的经历,以及现在在做什么。

王瀚锐:我目前在 Nebius 工作,负责整个 Token Factory 业务,包括推理、后训练和智能体系统。之前本科就读于复旦大学,2018 年毕业后进入 MIT,成为韩老师的第一个博士生。当时的研究方向是高效 AI 计算(efficient AI computing),核心问题是如何通过跨层级的硬件-算法协同设计,来提高模型效率、降低成本和内存消耗。

我从 2017、2018 年就开始做 Transformer 相关的研究,主要方向是稀疏化,包括 Token 剪枝(为模型去除不重要的 Token 或 KV 缓存),和量化(对高精度模型的压缩)。除此之外,还做过早期的缩放定律(scaling law)研究,观察不同规模的模型对性能和速度的影响。我们也做过芯片,比如稀疏注意力(sparse attention)芯片 SpAtten,用台积电 28nm 工艺流片做出来。当时是把算法从上到下、一直做到底层硬件平台。

2024 年博士毕业后,我全职开始筹办创业,2025 年正式创办了 Eigen AI。公司的方向是帮助企业用户做开源模型的优化和部署,一边有训练团队,帮企业用自己的数据把小模型训练到超过闭源模型的准确率;一边做推理系统,把后训练好的模型大规模部署到 GPU 集群上,让用户可以通过 API 调用。2026 年春天,我们并入 Nebius。进入这个更大的平台,是为了把之前的技术最大化地部署到更多 GPU 上,惠及更多客户。

DeepTech:你是韩松的开门弟子,为什么会选择加入他的实验室,你们当时做的事在整个领域里算前沿吗?

王瀚锐:韩老师是整个高效 AI 方向的开山鼻祖,我在读博前就和他有合作。当时高效 AI 计算已经是一个有一定关注度的方向,但我是整个实验室里第一个做 Transformer 方向的人。当时很多同学还在做其他模型的效率优化,比如视觉模型、3D 点云模型。

这个方向当时确实小众。我选它,一是因为它的架构不同于传统的卷积网络,更适合并行计算。二是 Transformer 本身展现出的能力很有意思。当时最流行的是 BERT 这类模型,GPT 架构还不是主流,只在实验里做一些纯生成式模型的对照。

但我们看到 Transformer 既有并行加速的潜力,又能解决之前解决不了的问题,还展现出生成文章的能力,感觉有机会突破图灵测试,最终决定做这个方向。

DeepTech:ChatGPT 火了之后,Transformer 成了非常主流的架构。你们当时预料到今天这样的局面了吗?

王瀚锐:没有预料到规模化会这么快,也没想到零样本学习(zero-shot learning)的能力会变得这么强。

这个领域最早叫“机器学习”:做任何任务,都得先准备数据、设计输入输出和损失函数,把模型“教”会才谈得上推理。其实在七八年前,模型都只能从一个任务扩展到十个、几十个,直到 GPT-4 前后,所有任务才被统一成文字输入/输出的形式。

就像现在已经没人自称机器学习研究者了,大家都叫 AI 甚至 SI(Super Intelligence)研究者,因为智能成了模型自带的属性,泛化能力强到足以忽视“学习”的过程。

最早的原始 Transformer 只有千万级参数,最近 GPT-6 发布,网传参数超过 10 万亿,6 年里差了 6 个数量级,我觉得这非常惊人。硬件也一样,2020 年我在英伟达实习时常去参加黄仁勋主持的公司会议,当时英伟达的主要业务还是游戏,数据中心只占据一小块。但现在大家也看到,训练和推理所需的算力规模已经相当大了。

DeepTech:你觉得这种规模化有没有接近极限?

王瀚锐:我觉得远远没到头,再提高 1,000 倍都有可能。预训练确实受数据限制,但在后训练和强化学习(RL)阶段,模型可以在各种各样的强化学习环境中自由探索、自我演化,不再受制于数据。

如果只把网上的文字喂给模型,它的能力上限就是人类智能;如果给模型一个足够复杂的客观环境,它的上限就变成环境本身的复杂程度。人的智商最高可能在 200~300,但以数学为例,这是一个非常复杂的环境,模型在数学世界里或许能达到 500 甚至 1,000 的智商,提出一些人类已经无法理解,但很有启发性的想法。

训练是证明能力,推理才真正让能力被用起来

DeepTech:你们 2025 年创业时,正是训练最火的时候,为什么选择做推理?

王瀚锐:当时训练确实非常火。GPT-4 横空出世,接着是备受欢迎的 GPT-4o,人们也很期盼 GPT-5,大家都在讨论规模化能达到什么高度。

我们的判断是,训练在资本市场很火热,是因为它证明模型具备很多以前无法想象的能力。但到 2024 年,这种证明已经做得很充分了,滞后的是应用:模型能力上限越高,能解锁的任务就越多,影响的行业也越多,这部分市场很大。

真正发挥模型能力的应用,必须在经济上说得通。我和其他联合创始人此前的研究,都是在让模型更实用、更高效。这些技术正好可以帮大家从惊叹、观望,走到真正下场使用。

DeepTech:决定创业有没有具体的契机?

王瀚锐:2024 年就决定了,一个很重要的原因来自技术层面,我们做架构研究时发现,Token 的生成是内存受限的,每次都要把模型权重重新加载一遍,GPU 大部分时间都在等数据搬运。但如果把很多用户的请求聚合在一起,这一层计算就从矩阵与向量乘法变成了矩阵与矩阵乘法,大幅提高 GPU 的利用率。我们做了实验和性能剖析,发现确实能做到。

当时 OpenAI、Anthropic 都是云端服务模式。因此,我想到自己之前的稀疏注意力工作、联合创始人的 AWQ(激活感知权重量化,一种大模型低比特量化方法)也不必局限在边缘设备和端侧 GPU 中,可以放到大规模云上,处理更大的吞吐量和流量。

图 | Eigen AI在NeurIPS 2025 展览(来源:受访者提供)
打开网易新闻 查看精彩图片
图 | Eigen AI在NeurIPS 2025 展览(来源:受访者提供)

DeepTech:现在也有人在做端侧推理。在你看来,云端和端侧有优劣之分吗?

王瀚锐:我们在 Eigen 也思考过是否要把一部分工作放到端侧。在卷积神经网络(CNN)时代,手机上能跑的模型和最前沿的模型差得不多。但6年过去,模型规模涨了 10 万倍,手机和电脑的内存显然没涨这么多,最前沿的模型越来越难在端侧运行——我们不太可能把 Kimi K3 压缩一下放到手机上跑。

最近一个有意思的变化是,很多模型都在出轻量级版本。比如 Qwen-3.8-27B 只有 270 亿参数,能力却远超两年前的同规模模型。如果以后可以压缩到几十亿参数,32GB 内存的笔记本都能跑,两者的差距又在缩小。

不过目前看来,唯一能证明端侧必要性的应用场景是隐私,总有小部分人和公司需要在本地运行模型,这个需求会一直存在,但占比不大。从增长速度来讲,云端依然快于边缘推理。

光速就是第一性原理

DeepTech:你 2020 年在英伟达实习,当时公司是什么样的氛围?对你后来的工作思维有哪些影响?

王瀚锐:对,2020 年我在英伟达研究院(NVIDIA Research)研究全连接层的稀疏化,公司有几个理念对我影响很大。

一个是研究要从真实问题出发,必须思考技术转化。在英伟达研究院,做项目需要在产品部门找到一个支持者,并且在它启动之前就要回答一个问题:如果这件事做得非常成功,会带来怎样的影响?所以后来我们创办 Eigen AI、决定做推理,也是从真实需求出发。

另一个是“光速”(Speed of Light)。它有两层意思,一层是做事要快;更深的一层是,光速是不变的物理定律,代表第一性原理。我们做推理优化时,会先算 GPU 有多少个流式多处理器(基本计算单元),如果全部用满,理论上能达到什么速度,再反推现在的每个环节离上限还差多少。这就让我们有了一个明确的、可以逼近的目标。

DeepTech:从需求出发的理念,是在英伟达形成的,还是更早?

王瀚锐:其实从读博时就有了,我们实验室跟工业界的合作很紧密,经常和产业方对接,他们会反馈实际生产中的问题和想要的解决方案。韩老师的理念是,高效AI计算必须能产生真实的影响力。所以从读博开始,我们做的东西坚持全部开源,论文全部发表,所有细节都列出来,就是为了让企业能直接用上,也方便后来者在我们的基础上继续往下做。

DeepTech:在你们看来,做推理最大的技术壁垒在哪里?

王瀚锐:最大的壁垒是让系统不断适应快速增长的规模。谁能最快地把服务模型的能力提高 10 倍,不断提高一个又一个数量级,谁就能领先。用计算机领域的话说就是,“任何比现有系统大 10 倍的东西,都是完全不同的东西”。

推理这个词的内涵很广,在笔记本上跑一个三层全连接网络是推理,在几万、几十万张 GPU 上每秒处理海量 Token 也是推理。难的是在大规模 GPU 上把开源模型部署得既稳定、又快、经济上又划算。这和业务相辅相成,足够多的需求才能推动技术更上一层楼。

另一个壁垒是让技术的演进自动化。现在最前沿的研究话题之一是递归式自我改进(RSI),我们也在把它用到服务引擎和内核设计上。未来一两年,用智能体优化系统会是很重要的壁垒,但目前还有很多问题需要解决,比如不同模型能优化到什么程度,自我改进的边界在哪里,什么时候需要人来监督。第一个攻破这些问题的公司,就会和对手拉开差距。

DeepTech:你们做推理的前提是开源模型。客观来讲,如今开源模型和闭源模型的差距有多大?

王瀚锐:和最前沿的 GPT-6.1、Claude Fable 5.1 比,开源模型在基准测试和最难的推理任务上肯定还有差距。但一年前大家觉得差了 9 个月到一年,半年前觉得差 6~9 个月,现在可能只差不到 6 个月。

在 Token Factory,我们有一个很重要的观察:客户其实并不在意模型是开源还是闭源,也不需要最强的、面面俱到的模型。拿到客户的数据,针对他们的任务、调用框架和运行环境做后训练,让开源模型在客户更关注的问题上表现超过闭源模型,这就够了。

DeepTech:你们的客户也会价格敏感吗?

王瀚锐:客户大致有两类需求。一类看重可控性和安全性,他们想知道自己的数据是怎么被处理的、用的是什么模型,还希望把积累的客户数据和经验变成竞争壁垒。这需要我们对模型进行定制化的调整,只能用开源模型。

另一类更看重成本和容量。很多客户直接用 OpenAI 或 Anthropic,未必能拿到足够的预留容量,比如需要几千张 GPU、几十亿 Token 的额度。开源推理服务商能提供更大的预留容量,既满足他们持续扩张的需求,成本也更低。

开源模型能力变强的同时,价格也在上涨。但对流量非常大的企业来说,哪怕把成本降低 5% 都是很大一笔钱,降低一半就更有吸引力了。

DeepTech:直接用开源模型的企业,和“先闭源跑通、再切换到开源”的企业,二者的相对比例在最近有没有变化?

王瀚锐:直接尝试开源模型的企业越来越多。一方面是品牌认知,以前大家信任 OpenAI、Anthropic,因为这两家做的最早,而这两家恰好都做闭源;后来 DeepSeek、Kimi 的品牌声誉做起来了,大家看到它们用更低的成本达到了不错的准确率,就会直接尝试开源模型。

另一方面是实际使用。用过一段时间闭源模型的客户,跑出的工作流里往往有很多个模型,有的用开到最高推理强度的模型,有的用小一些的。他们会逐步把简单环节换成开源模型,最复杂的高层规划、判断类环节先保留闭源,慢慢地,他们也会把一部分高难度环节换成开源模型。这是一个渐进的过程,因为他们已经积累了真实的调用记录、失败案例和评测基准,能判断出某个模型的准确率够不够。

DeepTech:在模型能力、品牌、价格、灵活性、隐私安全等因素中,客户的权重大概是怎样的?

王瀚锐:成本大概占了一半,准确率提升占 30%,可控性占剩下的 10% 到 20%。很多客户还在意我们能不能帮他们做后训练,做到超越闭源模型。例如本来要用最大的闭源模型、开最高的推理强度才能达到某个准确率,但客户希望在准确率和成本的权衡曲线上找到更好的点。为了满足这部分需求,我们在训练上也投入了很多,帮企业搭建数据飞轮,让模型持续变好。

DeepTech:国内也有企业在做类似的事,中美两边的公司,在商业模式上有哪些不同?

王瀚锐:我和国内一些同行交流过,从技术交流和开源社区来看,两边都很有活力,技术规律和趋势有很多相似之处。商业模式也非常类似,都是按 Token 计价,一些差异是在按 GPU 还是按 Token 数预留容量等细节处。不过,两边最大的区别是硬件层面,也就是能否用上最新的硬件。

“从来不会为了创业而创业”

DeepTech:在 2026 GTC 的演讲幻灯片里,黄仁勋展示了 Eigen AI 在 Kimi K2.5 上的推理速度排第一。这件事对公司影响大吗,你们事先知道吗?

王瀚锐:这是我们公司非常难忘的一段经历。他发布之前我们并不知道,是在发布的那一刻才发现,原来我们真的做到了最快的速度,当时非常意外,也非常兴奋。

这次曝光对我们的帮助肯定很大。一方面,老黄在 3 月份的主题演讲里再次强调推理,大家对推理的关注开始升温,当然,这也和 OpenClaw、Kimi 等工具或模型的出现有关。另一方面,我们在正在爆发的推理市场里做到了最快,主动找来的客户更多了,对团队士气也是很大的鼓舞。

(来源:X@Eigen_AI_Labs)
打开网易新闻 查看精彩图片
(来源:X@Eigen_AI_Labs)

DeepTech:公司成立一年左右就被收购,当时是怎么考虑的?

王瀚锐:如果只看公司的成立时间,这个速度确实很快。但我们在这个领域已经有了十年左右的技术积累。我从 8 年前开始做稀疏注意力、KV 缓存量化,另两位联创中,金帝 2015 年就开始做 NLP 研究,韋程也从 2015 年开始做效率和内存系统,这些技术都直接用到了我们的推理和训练产品上。

我们的出发点一直是让研究产生更大的影响,尽量保持初创公司的发展速度,同时解决一些硬性约束。进入 Nebius 一个季度(Quarter)后——在大公司才会“按季度过日子”(笑),我们确实感到客户、GPU 数量等各方面的规模都比以前大了很多,所以这是一个互利共赢的选择。

DeepTech:你们对被收购的态度一直是比较开放的?

王瀚锐:我们的思路是,有些事情一定要在创业公司做。放在 5 年前,推理平台根本不存在,这类新产业用创业的速度来做肯定是合理的。但我们还要找到最能让技术产生影响的组织形态。

近期大家都意识到了推理的价值,更多的算力、更大的市场和更强的销售团队可以支撑更快的发展,我们自然对这些选择保持开放。当然,我们也可以选择独立发展,这是一个权衡问题。

DeepTech:当时接触的公司里,为什么最后选择了 Nebius?

王瀚锐:有几个方面。首先我们的瓶颈是 GPU,那就要选一家有 GPU 的公司,也就是各种新型云服务商(neocloud);因为我们做的是软件,所以需要一家非常重视全栈的公司。

Nebius 从 Yandex 分拆而来,后者相当于俄罗斯的 Google,企业文化里对软件有很强的信念,Nebius 的愿景也是做全栈,我们加入后会比较受重视。GPU 是 Nebius 的强项,它的市场团队也非常强,正好补上我们的短板。

其次,我们希望有足够大的施展空间。Nebius 规模很大,但又没有大到失去灵活性,虽然是上市公司,行动速度依然像创业公司一样快。有硬件、重视软件、行动又快,满足这几条的公司在市场上其实很少。另外,我们和 Nebius 在并购之前就合作了很长时间,一起推进了很多个模型的推理加速,比较“情投意合”。

DeepTech:如果没有 Nebius 这个选项,你们最想加入的公司会是哪一家?

王瀚锐:如果没有 Nebius,我们可能就会选择独立走下去。

DeepTech:交易宣布后,Nebius 股价连续大涨,到 6 月交易完成时,涨幅已经相当可观。这个过程中你们是什么心情?

王瀚锐:心情还是挺复杂的。股价上涨大家肯定都很高兴,交割时收购对价翻倍,Eigen AI 成为独角兽,这是资本市场的认可。超出预期的是,最后涨出来的部分已经远超这笔收购的对价。但越涨,我们肩上的重担就越大,大家的期待会更高,我们需要尽快交付实际的成果。

DeepTech:你们团队二十多人整体加入了 Nebius,但硅谷这两年流行另一种模式:只挖走创始人和核心团队,再签一份技术授权,公司本身留在原地。你们整体加入,是你们的坚持,还是有其他原因?

王瀚锐:其实我们没有经过很复杂的谈判,默认就是收购整个公司。Windsurf、Groq 等交易是最近才出现的一种模式。它的好处是,如果只收购人才、签技术授权,就不需要经过复杂的审批流程,符合 AI 快速发展的节奏。但它也有弊端,公司对剩下的员工、投资人,以及原有客户的善后工作都会变得非常棘手。

DeepTech:所以它可能只是权宜之计。

王瀚锐:没错。比如英伟达宣布收购 Hugging Face,就没有用挖角式收购(acqui-hire),关键在于公司是偏技术,还是更依靠整体的市场影响力。像 Hugging Face、OpenRouter 这种平台型公司,不可能只靠挖走几个工程师实现收购目的,必须整体收购。但如果目标只是几个人、几项核心技术,而且很容易剥离,大公司就会希望快刀斩乱麻,把人和技术授权一起拿过来,这样可以省去很多法律风险和原公司的担责风险。

我不认为“部分收购”会成为标准模式,它更多像特殊时期的特殊办法,只有在大家抢同一家公司、或者出于战略考虑必须快速完成的时候,才会用这一招。大部分收购最终还是要整体并购。

DeepTech:其实你对收购这件事应该不是很陌生,曾经实习过的深鉴科技被赛灵思(Xilinx)收购,导师韩松联合创办的 OmniML 被英伟达收购,现在你自己的公司也被收购了。做 AI 系统方向的初创公司,保持独立是不是一个伪命题?如果要保持独立,至少需要具备哪些特质?

王瀚锐:这里肯定有选择性偏差,被收购的公司更容易被看到。但 AI 系统软件在整个价值链上确实只是中间的一环。

微笑曲线告诉我们,越靠中间,就越容易被挤压,利润率很难做高。推理业务一边要面对 GPU 厂商,一边要面对客户,同一层还有很多竞争对手。

回看上一代基础设施,有个很有意思的现象:亚马逊云服务(AWS)、微软 Azure、谷歌云都背靠一家大公司,没有哪家独立云服务商做到非常大的规模。大公司的资本资源不用说,客户资源和渠道也是现成的。

AI 基础设施的增长取决于客户业务规模的增长,AI 系统这一层要想独立存在、持续做大,需要绑定几个稳定的大客户一起成长,最好是高增长的客户。

另一个生存之道是保持中立,可以接入不同的 GPU、不同的芯片和数据中心,支持各种各样的模型,成为一个中立平台。大公司总会和客户在别的业务上有重合,比如有的客户不想用谷歌云,因为和谷歌有竞争。

还有一点,AI 系统不从某个垂直行业出发,可以用在很多行业,所以很难积累某个行业的专门知识。也许另一条路是做更适配某个垂直行业的基础设施。比如有几家公司专门给药企做云服务和软件平台,它们是技术公司,但非常了解药企的各种合规要求,这也是能持续增长、保持独立的一种方式。

把 Token Factory 变成“万物工厂”

DeepTech:从创业到加入 Nebius,你的状态、关注点和日常工作有什么明显变化?

王瀚锐:创业公司的 CEO 是“首席什么都管官”(chief everything officer),客户、融资、招聘、产品、工程、营销都要管,核心任务是让公司活下来。

加入大平台,至少融资不用我负责了,我开始管预算、对损益负责,更多时间花在协调不同组织之间的行动上。比如要和 GPU 团队协调,因为他们提供算力;要和市场团队协调,确保对外传递的信息准确。我们作为“应用 AI 部门”,目标很明确,就是把模型产品做到最好,也能做得更深。

另一个挑战是我们现在是全球团队,欧洲也有大团队加入了“应用 AI 部门”,需要做很多全球协调,这是以前在创业公司不会面对的挑战。

DeepTech:在现在的团队里,你觉得把技术做到最前沿更重要,还是把产品打磨好更重要?

王瀚锐:产品打磨更重要。我们是基础设施公司,不是新的 AI 实验室,也不是研究机构。基础设施公司要做到每件事都可以复现、值得信任,我们不一定永远做最前沿的技术,但做出来的东西一定要让客户最放心。产品必须可复现、可扩展、可靠,让大家一提到 Nebius 就知道,找它一定没问题。像空气一样不被人注意到,可能是基础设施的最高境界。

研究我们也做,因为这个领域发展太快,基础设施还远没有到稳定状态,需要做一些前沿研究才能跟上最新的变化。但发论文、开发新技术不是我们的唯一目的,更重要的是把它们做成真正可落地的产品。

DeepTech:团队做研究和做产品的取向,和你个人的取向有没有细微的差别?

王瀚锐:我个人博士期间做过一些更前沿的硬件,比如用光子器件加速 Transformer,也做过用量子器件加速 Transformer。现在做“应用 AI 部门”的研究,还是希望能落到真实产品和生产环境里。不是说每项研究都必须落地,但很多问题是从产品里出现的真实问题,或者我们预测未来几个月会出现的问题出发的。

DeepTech:现在没有太多精力做前沿探索,你会觉得可惜吗?

王瀚锐:以前做研究,是在智识上很有满足感;现在在公司里把业务做起来、解决客户的实际问题也很有意思,两者各有吸引人的地方。

DeepTech:加入 Nebius 之后,你们陆续做了很多新模型的 Day 0 上线,比如 Kimi K3。为了做到这一点,你们有什么特别的尝试?和之前自己创业时做发布有什么不同?

王瀚锐:我们是所有新型云服务商里唯一一家做到 Day 0 支持 Kimi K3 的。因为我们是 Kimi 的合作伙伴,会提前做计划,准备好算力和各种优化。一是准确率,我们要通过 Kimi K3 的厂商验证工具(vendor verifier),保证准确率完全对齐。二是我们同时并行做几种优化,哪种有效就在 Day 0 用上。

能做到这一点,一是现在团队更大,可以在 Day 0 之前同时推进几个优化方向;二是我们有英伟达 B300 这样更先进的 GPU。

DeepTech:你们现在除了推理和后训练,还在做智能体。在你看来,智能体和之前的推理有哪些不同?

王瀚锐:智能体要做规划、调用工具、读结果、自我纠错、重试,步骤多得多。步骤多了,KV 缓存复用的机会就多。早期我们在 Eigen AI,聊天、客服这类请求的 KV 缓存命中率达不到 80%,但在智能体、编程、协同办公这些场景,命中率可以到 90%,甚至 95% 以上。这对 KV 缓存管理提出了更高的要求。

另外,评价指标也在变,从单纯计算每秒 Token 数转向看任务成功率或者每个任务的耗时。换一个小模型,Token 可能生成得更快,但需要重试更多次,时间反而更久;同样地,每个 Token 更便宜,完成任务需要的 Token 却更多了。所以智能体需要更高一层的评估。评估框架和接口层也要跟上,比如调用框架和模型是否兼容,能否支持各种对话模板和结构化输出,这些我们都必须支持。

DeepTech:那你们在智能体上有没有做一些比较有意思的尝试?

王瀚锐:一个是模型的自动选择,相当于一个路由器(router),智能体在不同步骤可以切换不同的模型。比如我们之前有个产品叫 Eigen Data,是一个合成数据生成平台,流程里要调用 14 个不同的智能体。现在我们在研究如何在不同位置用不同的模型,并根据生成数据的难度来切换模型,从整体上优化智能体工作流。

DeepTech:在智能体完成任务的过程中,你们观察到了哪些新的风险?

王瀚锐:一个是有些模型不支持工具发现,用户希望它完成某个任务,它知道某个工具的名字,却不知道具体实现和参数格式,就会凭空“编”出一个工具来,导致用户的调用框架报错。

另一个是系统层面的挑战,如果某个节点宕机,它存储的 KV 缓存就没了。如果不能快速恢复,重启后重新预填充这些缓存要花很长时间,还会打乱整个缓存路由过程,用户体验会变得很差。

DeepTech:现在大家都在谈 RSI,让 AI 自己改进自己。作为中间层,你们在这件事上可以做些什么?

王瀚锐:我觉得关键在于怎么定义验证器(verifier),也就是怎么定义对错、怎么定义进步。我们现在也在大量使用这种方法,比如内核设计智能体,我在一些会议上也介绍过相关进展,和英伟达、MIT 也有一些合作。

我们能做的,是让 RSI 在我们的基础设施上跑得更快,用更强的模型来做验证。它的消耗确实很大,用好的话,一个月写上百万行代码都有可能。但最核心的瓶颈,比如怎么设计验证闭环、怎么设计评判机制,很多不在基础设施的范围内。

DeepTech:现在 Artificial Analysis 的排行榜上,你们和 Together AI、CoreWeave、Fireworks 等公司你追我赶。这种竞争有没有尽头?如果有一天大家不那么关注速度了,最终比的是什么?

王瀚锐:Artificial Analysis 更像一个展示平台,决定了谁能被看到。上面除了速度,还有模型的智能水平、多模态评分,大家在上面看各种信息、互相分享,会形成一个整体的市场印象。

但基准测试和实际生产不可能完全一样。实际生产中,并发量、输入输出五花八门,Artificial Analysis 只能反映一部分,准确率也是同样的道理。既然它决定了谁能被看到,大家就会一直在上面展示,相当于宣布“我们支持这个模型了,速度很快,快来试试”。能不能把客户留下来,还是看生产环境的稳定性。

还有很重要的一点是算力,谁有卡。现在 GPU 非常紧缺,大家的瓶颈都卡在台积电的产能上,这也是为什么马斯克要做 TeraFab。这个瓶颈显然不是一两年能解决的,所以除了模型速度,谁能提供稳定、可持续扩展的算力,也是一层壁垒。

DeepTech:未来基准测试会不会有变化,比如加入模型性能或其他维度的评估?

王瀚锐:这个变化正在发生。Artificial Analysis 上大部分模型比的是速度,但像 GLM-5.2 这样的模型已经有了准确率指数,不只比推理服务商谁快,还要比谁准确。Nebius 目前在准确率上经常排第一。

我觉得 Artificial Analysis 以后会引入更多针对推理端点的比较维度。除了基准测试的准确率,真实生产中还有很大一部分在于API前端,比如工具调用处理得好不好,是否支持延迟加载工具,结构化输出的格式是否准确。这些都是智能体实际使用中的细节,也是我们花时间最多的地方,但目前 Artificial Analysis 的排行榜没有体现这些内容。

客户会看整个 API 前端,也就是模型之上的接口层,能不能把工具调用做得非常稳定、没有漏洞,这决定了他们会不会留下来。之后它可能会推出类似测试调用框架的基准,看挂到调用框架上能不能真正完成任务。大家的注意力正在从聊天转向智能体,很多指标也从 Token 层面转到了任务层面。

DeepTech:作为个人用户,我的感受是,随着推理能力变强,大家对速度的容忍度好像提高了。企业客户有没有类似的趋势?比如以前要求一秒出结果,现在等一个小时也能接受,只要最后能把任务做好。

王瀚锐:这个观察很有意思。我们看到,大家对首个 Token 的响应时间依然要求很高,因为这直接影响用户体感。但在高吞吐、高并发的情况下,每个用户的输出速度是每秒 300 个 Token还是 500 个 Token,其实人已经看不过来了,或者输出是给智能体调用工具用的,人也不会直接看。所以我们观察到,对每秒 Token 数的需求有一个上限,到 300 到 500 这个范围之后,很少有人再要求一定要到 2,000 甚至 3,000。

但随着大家把更多任务交给智能体,完成任务的端到端速度会越来越重要。现在让智能体写个文档,可能要等将近 10 分钟,我自己已经会有点不耐烦了。我们和英伟达合作的 Groq LPX 可以做到每秒 3,000 个 Token,想象一下,准备一份幻灯片从等 10 分钟变成等 1 分钟,用户体验还是会有明显提升的。

DeepTech:有时候模型回得太快,反而让人怀疑它是不是没认真推理。

王瀚锐:没错。现在还有一个很大的问题,比如 ChatGPT 可以选不同的推理强度,但这个选择很模糊,到底该用超高、最高还是中等,非常不直观。

所以现在开始兴起路由这一层,帮用户选模型,我觉得这是对的方向。就像我们用 Wi-Fi,不会去选它是 5G 还是 2.4G,这属于基础设施的底层参数。根据用户任务的难度,甚至在多智能体系统里,决定不同智能体什么时候用大模型、什么时候用小模型,这还是一个空白领域,也许以后会有更多公司出现,Nebius 也在做这方面的探索。

DeepTech:你毕业时拿到了加州大学洛杉矶分校计算机系的教职,你对未来的职业规划是怎样的?会回到学术界做更基础的研究,还是留在产业界?

王瀚锐:目前还是专注在 Nebius,把 Token Factory 做好。这个领域变化很快,未来有很多不确定性。我觉得不一定要二选一,在 Nebius 也可以做研究、发论文,到时候看整个产业的发展。

DeepTech:你对 Token Factory 这项事业有没有一个长期目标?希望它最终变成什么样子?

王瀚锐:我觉得很重要的一点是,Token Factory 就是一个万物工厂(everything factory)。因为人的输出,包括各种机器、物理实体,都可以看作由 Token 控制的。只要有足够多的 Token、足够多的智能,就可以在数字世界里构建一切,也可以在硬件世界里构建实体。

以此推演,Token Factory 就成了一个不受人口限制、可以持续增长的智能银行。智能可以增长百倍、千倍、万倍,成为一个没有上限的资源,经济不再受限于人。亚马逊、苹果的规模取决于有多少人网购、多少人买手机,Meta 的日活用户有 30 亿,是因为拥有手机的人数有上限,而如果大家可以无限地使用 Token,就能获得无限的智能,这种智能的水平还可能超过人类,我觉得这是非常令人兴奋的一点。

它会构建出什么,风险和机遇并存,有人会说这就是硅基生命,但我觉得人总会想出控制它的办法。我们要做的就是让 Token Factory 真正把智能变得像水和空气一样便宜,然后看它能构建出什么。

DeepTech:现在不少初创公司和大公司都开始自己做推理芯片,你们有这方面的计划吗?

王瀚锐:我个人对推理芯片还是很有感情的,本科时我同时修读了计算机科学和电子工程,做过一颗推理芯片,博士期间又做了一颗。但在 Nebius,我们目前没有做自研芯片的计划,还是先把最擅长的事情做大。

至于现在是不是做芯片的好时机,我觉得主要看基本算子是否还在快速变化。之前大家觉得都用 Transformer,那是不是就可以造 Transformer 芯片了?但最近注意力机制出现了各种变体,比如分组查询注意力(GQA)、多头潜在注意力(MLA)、Kimi Delta注意力(KDA)……底层架构还没有完全固定下来。

另外,模型规模还在不断扩大,每层的规模、KV 缓存的分配方式都在变。这些都会影响芯片的基本处理单元以及多级存储系统的设计。现在造出来的芯片,3 年之后可能还是不适配。所以如果要做芯片,必须提前准备,给未来的算子留出余量,内存层级的设计也要留足空间,才能做到向前兼容。

DeepTech:你刚才提到了物理AI的一些场景。Token Factory 目前有没有明确面向物理 AI 或具身智能的部分?

王瀚锐:Token Factory 内部有个团队专门做机器人方向,我们会支持自动训练物理 AI 模型,用智能体去训练物理 AI 模型,包括设计数据、使用云端仿真器等。另外也在支持多模态模型,其中包括世界模型(world model)。虽然还处在早期,但这是我们的重点关注方向,会做必要的准备。

DeepTech:你认可具身智能的前景吗?

王瀚锐:我不是这方面的专家,但我曾参观过 Figure AI 等机器人公司。这个方向非常必要,但在实现的时间线上,我没有那么确定。自动驾驶需要很多数据和多年积累,但汽车的自由度有限,而且它是工具,人坐在里面开车就可以收集数据。

具身智能的难点在于没法这么自然地收数据,总不能让人穿上钢铁侠那样的盔甲去采集。它的自由度更高,需要的数据更多,收集难度也更大,两方面叠加,数据就成了很大的瓶颈。所以我们看到,过去四五年,语言模型的规模涨了五六个数量级,具身智能模型可能只涨了两个数量级,因为数据跟不上。怎么解决数据瓶颈,我觉得非常重要。

DeepTech:如果有可能,你还会离开大组织,自己出来创业吗?

王瀚锐:我不会为了创业而创业,或者为了成为连续创业者而创业,更多是看我感兴趣、想做的方向,是否需要创业公司的形式。如果它特别新,或者需要跑得很快,可能需要。但目前我们最感兴趣、最兴奋的是构建智能工厂,Token Factory 是当下最有可能支持我们快速推进的平台,它的资源和架构也最适合我们把这件事落地和规模化。

DeepTech:你心里有没有想过一些适合用创业形式来做的方向?不一定真的去做。

王瀚锐:我想过一些从瓶颈出发的方向。比如刚才说的路由,大家选模型的时候很随机,这方面可以做的更系统。另外,在用编程智能体的时候,我需要通过说话或打字把想法传给智能体,瓶颈就在交互方式上,也就是我的说话速度和阅读速度。有没有办法把这个瓶颈去掉,以及未来人和智能体如何交流和共生,我觉得也是很有意义的方向。

注:首图/封面由 AI 辅助生成