Reflection AI Inc. 今日推出Beam,一个拥有5010亿参数的开源大语言模型。

此次发布距离这家初创公司以250亿美元估值完成融资仅过去几个月。大约同一时间,Reflection AI据报道与SpaceX Corp.签署了一项63亿美元的协议,租用英伟达GB300 NVL72设备。这些设备每台包含72张显卡,Reflection AI用它们训练了Beam。

打开网易新闻 查看精彩图片

基准测试对比

Reflection AI将Beam与GLM-5.2进行了基准测试对比,后者是一个参数量多出约2500亿的开源大语言模型。该公司认定,Beam在某些任务上表现更好,同时硬件用量仅为对方的三分之一到四分之一。此外,Reflection AI表示,Beam的性能接近Qwen 3.8-Max,后者参数量超过2万亿。

此次发布尤其值得关注,因为开源生态中许多最先进的大语言模型出自中国公司,包括Qwen 3.8-Max和GLM-5.2。Beam是首个由美国初创公司推出、并展现出相当或更好性能的开源模型。不过,免费大语言模型仍落后于Anthropic PBC的Claude Fable 5.1等前沿模型。

训练流程

Reflection AI开发Beam的起点是训练一个相对较小的原型模型,随后创建了一系列 successively 更大、能力更强的算法。这一工作流程最终产出了Beam Base,即Beam所基于的底座。

Reflection AI使用6144张显卡的集群开发了Beam Base,训练数据量为23.8万亿token,来源包括公开网络和商业渠道。据Reflection AI称,该数据集包含大量软件代码。公司为每种编程语言创建了定制过滤器,以剔除低质量文件。

Reflection AI在不到四周内完成了Beam Base的开发。随后进行了中期训练,这是一个扩展模型上下文窗口并增强推理能力的优化过程。该阶段为训练流程中第三个、也是最吃硬件的阶段奠定了基础。

强化学习阶段

Reflection AI启用了1万张GB300显卡,用它们启动了13亿个强化学习沙箱。沙箱是AI模型学习新技能的虚拟环境。Beam的沙箱针对生成代码、搜索网页和运行AI智能体等任务进行了优化。

Reflection AI表示,该项目的强化学习阶段仅用了四周。公司通过开发防止故障中断工作流的软件,避免了不必要的延误。据Reflection AI称,其集群在训练期间出现的71个错误中,实现了8分钟的中位恢复时间。

Beam最初通过早期访问计划提供。Reflection AI计划于本月晚些时候发布其权重、文档和微调工具。