打开网易新闻 查看精彩图片

昨晚传出消息:字节跳动正在讨论训练一个参数规模超5万亿的模型,它超过阿里的Qwen3.8-Max(2.4万亿参数)和月之暗面的K3(2.8万亿参数),也是目前国内已知参数规模最大的模型。

今天下午,又传出新消息:字节跳动正在训练一个超大模型,参数量最高可达10万亿个,目前正处于早期阶段,这比迄今为止中国已发布的最大模型、月之暗面的Kimi K3还要大三倍多。

打开网易新闻 查看精彩图片

字节跳动的这款新模型目前正处于预训练阶段。这一过程通常需要耗时三到六个月,随后才能进入微调并最终发布。

Anthropic并未公开其模型规模,但业内估计其最先进的Mythos 5拥有约8万亿个参数,Fable 5约为5万亿个参数。

也就是说,如果字节跳动这个10万亿参数的大模型训练完成,有机会直接冲击全球第一!

当然,OpenAI和Anthropic也在继续提升,国内大模型确实还存在差距,还需要持续努力。

下面哨兵简单讲几点:

1)字节这一动作的最大意义在于:把国内的AI军备竞赛拉向了一个新的高度!

字节搞出了5万亿、甚至10万亿参数的大模型,那DeepSeek、Kimi、阿里Qwen、智谱等,都得跟进。

而且,10万亿参数不是终点,哨兵反复讲,各大巨头们的终极目标是AGI(通用人工智能),接下来训练的参数规模只会更大。

2)字节这是对于国内AI大模型发展路径的一次纠偏

过去一年,国内AI大模型行业的普遍路径是"蒸馏优先、快速追赶"(不公开讲,但事实就是如此),所以我们才看到了国内大模型在全球排名上的快速进步。

但这样搞,就是永远跟在别人屁股后面,是不可能超过OpenAI和Anthropic的。

而前两天哨兵也提到过,张一鸣近期在内部明确反对通过蒸馏竞争对手模型来快速追赶,要求团队接受短期落后、坚持自研冲击世界第一梯队。

字节现在要挑战10万亿参数,在技术层面肯定是要有一次巨大的挑战和提升。

这也会倒逼国内其它的大模型企业转变路线——放弃蒸馏模式,从"性价比追赶"切换回"暴力算力投入"!

3)国内算力需求将迎来大爆发

目前,国内算力明显不足,特别是高端算力,严重供不应求。

参数规模的倍数增长,以及技术路线的切换(放弃蒸馏模式),都意味着算力需求的飙升,供需会进一步失衡。

而在英伟达高端芯片断供的情况下,预计各家大模型企业将集体转向国产AI芯片,国产算力链将迎来一个大爆发的时代!

近期,哨兵反复讲过一个道理:OpenAI、Anthropic、DeepSeek接下来都在上市,需要为它们的上市造势,特别是国内,DeepSeek的重要性超过长鑫,为DeepSeek的上市造势是接下来村里的主要任务之一。

最近,从Kimi K3,到DeepSeek V4,再到字节的5万亿、10万亿参数的大模型,我们确实看到了国内AI大模型行业的大动作不断,在事实上就是给整个大模型行业造势,也是在为DeepSeek上市造势。

总的来看,哨兵再次强调:国产AI大模型与国产算力链,就是接下来一段时间的市场主角,一直到DeepSeek正式上市之前!