打开网易新闻 查看精彩图片

出品|虎嗅科技组

作者|黄天媛

编辑|苗正卿

头图|Reflection AI官网

成立两年后,想做"美国版DeepSeek"的Reflection AI终于交卷了。

美国时间10月5日,Reflection AI公布了首个开放权重模型 Beam,主攻编程、推理和智能体任务。(虎嗅注:开放权重模型指公开训练好的模型参数,用户可以下载、自己部署,能否修改和商用取决于许可证)

许多美国媒体和科技业人士,将Beam视为美国对中国开放AI的回应。

他们公司自己也是这么对标的。

按照公司官网的说法,Beam 在编程和智能体任务上的表现可与智谱 GLM 5.2 竞争,接近阿里的 Qwen 3.8-Max,但在绝对能力上仍落后于 Kimi K3 等领先模型。

但它的意义不只在Benchmark。

Reflection有一套非常明确的定位:服务那些不愿或无法使用中国模型,同时又希望拥有、控制自己AI能力的企业和政府客户。

在美国本土,这样的公司并不多见。Reflection同时拥有数十亿美元融资、顶级GPU资源、Nvidia支持,以及美国政府和主权AI项目资源。

这也是为什么,一款还没有站到开放模型最前沿的产品,仍然会受到如此高的关注。

Reflection到底是一家什么公司?Beam又到底做到了什么?

Beam的成绩单

Beam的成绩单

Reflection创始人在播客采访中披露,Beam采用MoE架构,总参数约5000亿,但推理时只激活约230亿参数。

作为对比,DeepSeek-V3总参数为6710亿、激活370亿;月之暗面Kimi K2达到1万亿总参数、激活320亿;智谱GLM-4.5则为3550亿总参数、激活320亿。

同时,Reflection还强调,Beam从预训练阶段开始完全自主完成(没有蒸馏),并针对Coding、推理和Agent任务重点训练。

打开网易新闻 查看精彩图片

Reflection还尤其强调Beam的推理效率。

公司表示,依靠大规模强化学习,Beam完成相似难度推理任务时需要消耗的Token和推理计算量,可以达到GLM 5.3、GPT-6 Luna等模型的约1/3到1/4。

官方披露,Beam的预训练数据达到23.8万亿Token。作为对比,DeepSeek-V3使用了14.8万亿Token预训练;Kimi K2约15.5万亿Token。Beam随后进行了一轮高强度RL训练,他们用10500张Nvidia GB300 GPU连续运行4周,总共生成超过1亿次Rollout。

Reflection的判断是,前沿模型的Scaling正在发生变化。

过去几年,行业最熟悉的是扩大参数量和训练数据,提升预训练算力。但随着预训练逐渐成为一门更成熟的工程,下一阶段模型能力提升的重要变量,会越来越多来自把强化学习本身继续Scale。

所以,Beam像是Reflection的一次技术验证。

一家新公司能不能靠大规模RL,把一个只有较少激活参数的模型,推到接近中国头部开放模型的水平。

它已经证明自己上了牌桌。

美国"DeepSeek",为什么是Reflection?

美国"DeepSeek",为什么是Reflection?

Reflection并不是一家突然冒出来的模型公司。

它成立于2024年,由两名前Google DeepMind研究人员Misha Laskin和Ioannis Antonoglou创办。Laskin和Antonoglou在DeepMind期间,曾参与Gemini 1和Gemini 1.5相关工作。Antonoglou在DeepMind早期就加入公司,是AlphaGo核心团队成员之一。

但有意思的是,Reflection创业之初,其实没有准备自己从头训练基础模型。

Laskin最近在播客中回忆,两人创办Reflection时,主要押注了两个判断:第一个判断是,强化学习会让大模型从会聊天,进一步走向Coding和Agent;第二个判断则是,西方仍会不断出现足够强的开放模型,Reflection没有必要重复训练基础模型,只要站在这些模型上继续做强化学习和Agent研究。

从今天回看,第一个判断已然成为主流方向,但第二个却落空了。

DeepSeek V3出现后,西方开放模型与中国开放模型之间的差距开始迅速拉大。Reflection又等了几个月,希望美国出现一个足够强的开放模型,但一直没有等到。于是,它决定自己下场。

Beam就是这次战略转向后的第一份答卷。

过去一年,全球最强的闭源模型仍主要掌握在美国公司手中,但开放模型的重心,却越来越向中国倾斜。

DeepSeek、Qwen、智谱、Kimi等中国模型不断进入全球开发者的模型列表。OpenRouter排名显示,在开放模型中,排名靠前的产品大量来自DeepSeek、智谱、小米、腾讯等中国公司。

Reflection和美国政府都想要的,是重新抢回这块市场。

Reflection目前估值约250亿美元,累计融资超过40亿美元,其中Nvidia投资约8亿美元。

今年7月,路透社报道,Reflection 与云计算公司 Nebius 签署超过10亿美元的协议,获取包括英伟达最新芯片在内的计算资源。

此前,Reflection 已与 SpaceX 签下算力协议。按照 Axios 报道,经过初始爬坡阶段,公司从今年7月起每月支付1.5亿美元,协议持续到2029年。

Reflection 官网还称,公司将参与美国能源部 Genesis Mission 科研计划,为美国国家实验室提供开放模型。

一家成立两年多、第一款基础模型才刚刚发布的公司,已经获得这个级别的资源,本身就说明投资者押注的并不只是Beam。

他们押的是美国重新拥有一个开放模型体系。

按照Reflection官网的介绍,公司不仅计划开放模型权重,还在开发配套的开源软件,并支持通过API调用,或在企业私有云、本地服务器、与外部网络物理隔离的环境中部署。

开放权重只是第一层。Reflection真正准备卖的是,模型+推理+软件栈+基础设施+企业部署。

它的主要客户也不是普通消费者。在创始人的描述中,大型企业、政府机构、公共部门和"主权AI"客户,才是未来开放模型最大的买家。

一个现实案例已经在韩国出现。

今年3月,Reflection与韩国新世界集团宣布签署合作备忘录,计划建设一座250MW的AI数据中心,为韩国企业和政府机构提供主权AI服务。项目将使用Reflection的开放权重模型和英伟达GPU,美国商务部长也出席了签约活动并表示支持。

打开网易新闻 查看精彩图片

Reflection 已经拿到了训练大模型的资源,也找到了愿意讨论合作的企业和政府客户。接下来,Beam 要过的还是生态应用关和能力提升关。

这些答案,融资额和合作名单都给不了。

本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。

本文来自虎嗅,原文链接:https://www.huxiu.com/article/4895638.html?f=wyxwapp