8月10日一早,A股打新页面里,“人形机器人第一股”宇树科技(688836)的申购按钮正式亮起。发行价150.80元/股,上市市值约609.99亿元,远超市场此前预估的超400亿元。社交平台上,不少投资者晒出申购截图排队“许愿求中签”。同一周,AI圈没有闲下来:字节跳动被曝正在讨论训练参数规模超5万亿的新模型,创始人张一鸣在内部会上罕见发声;DeepSeek一边宣布API要涨价,一边被网友扒出创始人梁文锋早年的微博账号;DeepMind两大核心人物的去留问题,也在这个8月迎来关键转折。
一、字节的“5万亿参数”豪赌:一次推到同行数倍
8月6日消息,据媒体报道,字节跳动正在讨论训练一个参数规模超5万亿的模型。这个数字放在当前的国内大模型版图里是什么概念?报道给出了两个参照物:阿里的Qwen3.8-Max是2.4万亿参数,月之暗面的K3是2.8万亿参数。也就是说,字节这个还在讨论中的新模型,参数规模将是已知同行的两倍上下,也是目前国内已知参数规模最大的模型。
不过,这条消息带了一个非常重要的限定条件:该计划仍处于早期阶段,模型最终不一定会发布。换句话说,这更像是Seed团队在技术路线上的一次方向性表态,而不是一个已经落地、板上钉钉的产品排期。
报道称,这个新模型将由Seed Foundation负责人项亮主导,与大语言模型预训练数据负责人沈科合作。两人都是字节跳动人工智能及大模型研发体系内的核心骨干,而且都有同一个出处:字节的“搜广推”体系。项亮本科毕业于中国科学技术大学,博士就读于中科院自动化所,2016年加入字节,曾负责机器学习中台AML团队,后来调任豆包大模型Foundation团队负责人。沈科2018年从清华毕业后加入字节跳动,目前主要负责大语言模型预训练数据。
一位接近Seed的人士向媒体解释了字节为什么要往这个方向走:与其在现有尺寸上继续追赶其他大模型,不如把参数规模一次推到同行的数倍,争取一个领先位置。这个逻辑很直白——不在同一个维度上和对手拼迭代速度,而是直接换一个量级重新定义赛道。
二、张一鸣罕见发声:可接受暂时落后,反对蒸馏
就在这个消息被曝出的两周前,字节跳动创始人张一鸣刚刚在Seed全员会上做过一次安抚。据与会者转述,张一鸣认为训大模型本就是一件很难的事,团队不必过度焦虑。他明确表示,一段时间内可以接受模型落后于行业,希望大家把追求智能上限作为目标,期待Seed的模型能力能跻身世界第一梯队。
这算是张一鸣罕见地在内部场合正面评价大模型竞赛的节奏问题。外界习惯用“落后”“追赶”“超越”来给大模型公司排名,但张一鸣给团队定的调子是:可以接受暂时落后,但不能放弃上限。
更值得琢磨的是他对技术路线的态度。张一鸣认为编程是当前的关键方向,并表态自己反对蒸馏。在张一鸣看来,蒸馏能在短期内改善模型表现,但本质上仍是在复制Claude已有的能力。沿着这条路走,最多只能不断逼近对方,很难真正实现超越。
这句话的信息量不小。蒸馏是当前大模型行业里常见的“提效”手段——用一个强模型(比如Claude)的输出训练另一个模型,让新模型在数学、编程等能力上快速接近那个强模型。张一鸣反对的并不是蒸馏这个技术动作本身,而是把蒸馏当作核心策略的路径依赖:一旦
热门跟贴