你以为美团只会送外卖?其实它早已经悄悄把自己的大模型做出来了,而且一出手就是万亿级别。这个模型叫 LongCat-2.5,这几天在开发者圈子里刷了屏。

一万六千亿参数,每次只激活四百八十亿

LongCat-2.5 用的是专家混合架构(MoE):总参数一共一万六千亿,但每次计算只会激活其中的四百八十亿。打个比方,这就像一家一万六千人的大公司,每次来活儿只叫相应的四百八十个人上场干活,其他人待命。这样既保住了大模型的能力上限,又把运行成本压到了很低的水平。

本事不小:一次读完一百万字,还能自己动手干活

它的上下文窗口达到一百万 token,一次能读完一百万字的资料。它看得懂图片,还能自己去操作浏览器、填写电子表格,连设计软件都能上手。

有媒体把它接进编程工具里做了实测:让它复刻 Meta 那个十天冲上美国下载榜第一的现象级应用 Muse,核心功能直接就能跑;让它做星舰发射的动画,还有一辆能漂移的 3D 赛车游戏,它也都做出来了。

价格是真下了血本

说到价格,这次限时折扣直接打了四折:每一百万 token 的输入只收两块钱,输出也只收八块钱,新注册的用户还能免费领一千万 token。在同档位的模型里,这个价格算是把诚意拉满了。

出身更值得注意

上一代 LongCat 2.0,是在纯国产的算力集群上训练出来的,一万亿参数的模型都能做到稳定训练、稳定运行。对国产算力来说,这本身就是一次有分量的验证。

大厂竞争的下半场

所以你看,大厂竞争的下半场,拼的已经不是谁的参数堆得最大,而是谁家的模型更便宜、更好用,还能真的替人把活干完。连送外卖出身的公司都把模型做到这个程度了,你觉得下一个宣布造大模型的,会是什么公司?评论区聊聊。