IT时代网8月8日消息,蚂蚁集团旗下百灵大模型宣布,新一代原生混合推理模型Ling-3.0-flash正式开源。这款模型采用MoE架构,总参数124B,激活参数5.1B。
除基础版本外,官方同步放出了FP8、FP4、INT4等多个版本,对应三条落地路径。想快速接入又不打算自建推理服务的开发者,可以直接走云端API;数据不能出域的企业和团队,MXFP4与INT4版本能在单台NVIDIA DGX Spark上跑完端到端推理;面向单请求时延敏感的高性能服务,在指定GPU测试配置下,平均输出速率突破1100 tokens/s。
速度是这款模型主打的能力点。在一家国际AI评测平台的榜单中,Ling-3.0-flash的输出速度达到353 tokens/s。该平台的智能指数榜单显示,它每项任务的加权平均调用成本约0.04美元,按现汇率折合人民币约0.27元,加权平均解码时间约1.4分钟,同时落进了“智能水平—任务成本”和“智能水平—任务耗时”两个优势区间。
对希望快速验证产品形态、把智能体应用推上线的团队来说,API仍是门槛最低的一条接入方式。
从参数配置看,5.1B的激活规模意味着推理时实际调动的算力有限,这也是MoE架构近来被密集采用的原因——用相对小的激活开销,撑起更大的总参数容量。
提供多种量化版本这一做法,同样在降低本地部署的硬件门槛。对不具备大规模GPU集群的中小团队而言,在单机上跑通一套混合推理模型的可行性,比一年前要高出不少。
打开网易新闻 查看精彩图片
注:本文中包含AI辅助创作的内容。
热门跟贴