蚂蚁百灵发布了 Ling-3.1-flash。总参数量约560B,但每个 token 实际激活的只有约25B,上下文窗口最高支持100万 token。官方同时表示,计划很快将这一模型开源。

稀疏激活的账怎么算

打开网易新闻 查看精彩图片

560B 与 25B 之间的落差,是这类模型最值得看的地方。总参数决定模型能装下多少知识,激活参数决定每次推理真正动用的算力。两者拉开距离,意味着推理成本不必跟着总参数量一起涨。

100万 token 的上下文,则把可处理的输入长度推到了长文档、长代码库这一档。

三组评测数字

官方给出的成绩覆盖工作、编程与医疗三类场景:

  • GDPVal-AA v2.1:1,673 Elo
  • FrontierSWE:
  • HealthBench Professional:

三个基准分别对应通用工作任务、软件工程和医疗专业能力,指向的是同一个模型在不同领域的表现,而不是单一维度的刷分。

开源这一步的分量

真正让这条发布值得留意的,是"计划很快开源"这句话。560B 级别的模型如果开放权重,意味着外部团队可以自己部署、自己微调,而不必只通过 API 调用。

对做垂直应用的团队来说,医疗、编程这类对数据敏感的领域,能本地跑起来的意义,往往比多几个点的评测分数更实际。

目前官方给出的信息集中在参数规模、上下文长度和三项评测结果上,模型的具体架构细节和开源时间表尚未公布。