最近外媒连续两条爆料,把字节跳动悄悄推进的超大参数大模型项目给摆到了台前。从最早传出的超5万亿参数,到最新披露的10万亿参数,这个量级直接甩开国内已发布的所有头部大模型一大截。更值得琢磨的是,字节放着圈内人人都走的快道不走,偏选了一条多数人刻意绕开的难路。这波操作到底藏着什么布局,不少圈内外的人都在猜。

打开网易新闻 查看精彩图片

很多人看到10万亿参数的第一反应就是“这不就是堆参数炫技嘛”。其实大部分人都漏看了字节放出的另一个关键信息,人家明确表态反对模型蒸馏,拒绝靠复制现有模型能力走捷径。模型蒸馏说直白点,就是让小模型复刻大模型的输出结果,短时间内能快速把跑分拉得很好看,却很难生长出真正属于自己的原生能力。一直沿着这条路走,最多就是跟在头部模型后面追,永远没法实现真正的超越。

字节内部早就做好了准备,哪怕接受一段时间内技术进度暂时落后,也要把底层技术的基本功打扎实。放在当下拼速度拼纸面数据的大模型赛道,这个选择真的格外反常识。现在绝大多数团队都在追求快速出结果、快速上线抢占市场,愿意沉下心花几个月做全链路原生预训练的玩家,屈指可数。

之前很多人看不懂字节拆分飞书团队、把产品线并入豆包、销售线划归火山引擎的操作。现在回头梳理就能发现,这步棋早就在为超大模型的训练积攒家底。把火山引擎的算力资源、飞书的真实场景数据、豆包的用户交互数据全部打通整合,字节要构筑的是算力和数据双重层面的独有优势。这恰恰是训练10万亿参数级大模型最核心的两大支撑。

打开网易新闻 查看精彩图片

这个项目由Seed Foundation负责人项亮主导,大语言模型预训练数据负责人沈科配合推进。目前还处于早期预训练阶段,整个预训练周期预计要3到6个月,最终的模型确切规模要到后期才会确定。现在项目披露的参数量级,已经超过国内已发布头部大模型三倍多。一旦训练完成落地,整个国内大模型的能力标尺都会被重新改写。

字节CEO梁汝波在年度全员会上也不藏着掖着,直接点出目前豆包在AI Coding领域的表现还不算突出。这反而说明字节没有回避自己的短板,还把这块当成了下一阶段攻坚的核心方向。现在全球大模型赛道里,编程能力已经成了衡量模型原生推理能力的核心标尺之一。靠蒸馏出来的模型,很难写出逻辑自洽、能直接跑通的复杂工程代码。

只有从底层预训练阶段就把代码语料和推理逻辑做深做透,才能真正补上这块短板。字节提出来的这几条AI发展原则,完全跳出了过去行业里“跑分优先”的竞争逻辑。转头就把长期技术底盘的扎实度放到了第一位,根本不跟你玩短期纸面数据的把戏。大洋彼岸的头部大模型厂商最近接连出状况,多款超大参数模型因为安全可控性问题被限制开放,甚至直接停服。

原本拉得很满的进度条,意外踩了急刹车。这相当于给国内踏踏实实做自研预训练的团队,撕开了一个难得的追赶窗口。此前国内发布的几款头部大模型,已经在多项基准测试里追平了海外第一梯队的部分表现,开发者反馈也相当积极。现在字节这种押注10万亿级参数原生大模型的路线,不是盲目的堆参数凑热度。

就是趁着海外对手踩坑停车的空窗期,往最顶尖技术梯队里冲一把。不少海外网友都已经看明白这件事的影响。10万亿参数模型还没正式露面,就已经改写了整个行业的推理成本算账逻辑。接下来所有同行都得跟着调整自己的技术路线节奏,慢一步就可能被远远甩开。

打开网易新闻 查看精彩图片

现在国内大模型赛道的竞争,早就不是比谁上线更快、谁的跑分更高了。拼到最后,比的就是谁能在没人敢走的难路上,攒出真正属于自己的原生技术底牌。字节这步不走捷径的棋,从早年的架构调整到现在的技术路线选择,每一步都早有规划。整个行业现在都在盯着这个项目,等着看最终落子的结果。不出意外的话,等项目落地那天,带来的震动会远超10万亿参数这个数字本身。

参考资料:第一财经 字节跳动押注超大参数自研大模型