要珍惜梁文锋杨植麟们身上的创新动能,要呵护让AI企业可以激烈良性竞争的市场氛围。
文 | 佘宗明
25年前,《少林足球》上映。片中有个名场面:半决赛时,少林队遇到了莫文蔚与张柏芝客串的「玉面双飞龙」,二人顶着夸张脏辫、贴着滑稽假胡,说「想入决赛,先问问我们!」
时间来到2026年,星爷新片《功夫女足》让这对传奇组合重生——张小斐饰演的「双双」与迪丽热巴饰演的「钰珑」,名字合璧正好对应「玉面双飞龙」。
作为峨眉队队长的双双是全队攻防大脑,根基扎实,球路沉稳,招牌绝技是太极卸力盘带、太极沉劲远射等,招式守正出奇,强于以柔克刚;身为峨眉队前锋的钰珑是球队尖刀,身法灵动,攻势凌厉,独门绝技是十二路弹腿、旋风削球等,能精准破局,极具爆发力。
现在看,AI赛道的「粤籍双雄」——梁文锋和杨植麟,也挺像这对组合。
DeepSeek擅长以柔克刚,如果说「大力出奇迹」的scaling law路线是刚,那MoE稀疏激活+原生FP8训练框架+纯RL驱动的卸力打法就是柔。
Kimi爆发力十足,犹记得1年前,Kimi还时常是作为DeepSeek的反面镜像被讨论,「Kimi掉队了」的说法蔚为风行,可如今,它直接整出了王者归来的气势。
而Anthropic和OpenAI领衔的硅谷御三家,则成了摆在它们面前的「大河队」。
01/
「美国为什么没留下杨植麟」,7月17日,有老外在X上发出了这番灵魂拷问。
这掀起了激烈讨论,连杨植麟在卡内基梅隆大学的博士生导师、AI领域知名学者Russ Salakhutdinov都下了场,说「我本将心向明月,奈何明月照沟渠」……说错了,是杨植麟曾收到来自苹果高管的橄榄枝,但他态度已决——要创立自己的公司。
在遭到MAGA信徒攻击「为对手输送人才」后,Russ还回怼:这不就是你们想要的吗?(Ps:这里针对的是特朗普政府制定的H-1B签证政策。)
咱就是说,要是大洋彼岸的网民还学会了扣「反思怪」跟「带路党」帽子,那就更有内味了。
而引发这场争论的直接由头,就是Kimi K3携2.8万亿超大参数架构强势登场,给了硅谷和华尔街亿点点震撼。
如果Kimi K3只在AI圈博主的嘴里遥遥领先,那被「三天一震撼,五天一炸裂」历练出反诈技能的我们大可呵呵一笑。可硅谷技术圈跟华尔街资本市场的表现,还是有参考价值的。
马斯克在评测帖下留言「Impressive(令人印象深刻)」;OpenAI战略负责人Dean Ball说,大规模开放权重前沿模型是「减速主义力量」,还预判美国监管层面会出手搞保护主义;特朗普政府AI顾问David Sacks说,K3的突破令人担忧,加剧AI地缘竞争压力……
秉持「对手肯定>国内同行认可>自嗨式PR」的原则,咱们高低得对K3多看几眼。
《华尔街日报》头版打出大标题——「The Kimi Shock」;高盛研报认为K3标志着中国模型走向定价权的全新节点……也给Kimi走了面儿。
风乍起,吹皱一池夏水并吹掉一堆泡沫:美股AI板块直接来了个「72小时惊魂」,整体市值蒸发约4700亿美元,费城半导体指数单周大跌12.5%,坠入技术性熊市。「DeepSeek时刻」都意思意思了,「DeepSeek2.0时刻」自然也不好意思不意思一下。
顺着「它跌得,我跌不得」的选择性接轨逻辑,A股也成功将这股「跌跌不休,时不我予的哀愁」意绪传递给了本土股民。
而上次让硅谷跟华尔街爬进「惊弓之鸟」成语注释里,还是DeepSeek。
去年1月,R1出来后,也是惊得硅谷跟华尔街哇声一片。著名投资人、A16Z创始人马克·安德森的那句「斯普特尼克时刻」,成了对其影响的最佳定性。
Meta开启危情模式、成立四个「战情局」,Scale AI创始人亚历山大·王说「DeepSeek的发布可能会改变一切」……都是变相为DeepSeek上分。
英伟达股价单日暴跌16.86%,市值一夜蒸发5888.62亿美元,彼时彼刻,恰如K3出来后的此时此刻。
02 /
1年半前,DeepSeek携性能比肩OpenAI o1、API调用成本却仅为o1约2%的R1,拍了拍众人,来了一句「惊不惊喜?」
1年半后,在众人以为惊喜是意外后,Kimi又携跻身全球顶尖大模型第一梯队的K3登场,笑着说「意不意外?」
突破一次,也许是运气眷顾;突破一次又一次,那就……因吹斯听了。
在DeepSeek-R1问世后,《自然》杂志将梁文锋评为了「2025十大科学人物」,说DeepSeek「首次让世界意识到美国并非遥遥领先。」
在Kimi K3官宣后,摩根士丹利评价称,K3证明中国大模型在规模、性能、定价层面对美国头部模型实现「全方位追赶」。
个中意味,颇堪寻思。
都知道,自ChatGPT掀起这波AI浪潮以来,全球AI大模型赛道的剧本就是男一OpenAI跟男二男三Anthropic、谷歌的角力游戏,其他的多为群演……
当时的格局就摆在那:国内「六小虎」虽然也在蹦跶,可OpenAI说「我话说完,谁支持谁反对」,它们只有不吭声的份儿,能争的也就是个「中国版OpenAI」的名头。
亦步亦趋、微调借鉴,成了那时国产大模型的路径依赖。
如此效仿三两年,直到DeepSeek说「头部AI,宁有种乎?」
MLA(多头潜在注意力)把显存占用砍到传统架构的5%-13%,DeepSeekMoE稀疏架构通过稀疏激活让计算量大幅下降,Zero无样本自进化开辟了低成本训练强推理模型的新路线……凭着这些,DeepSeek成功将「中国AI落后美国两到三年」的技术代差缩小了些。
DeepSeek给了「力大砖飞」的硅谷信仰重重一击,给国内外科技企业上了一课:AI核心竞争力不只在参数堆积、算力堆叠,还在于算法架构优化、工程落地能力与资源利用效率等。
整体上,DeepSeek为中国大模型树立的心智锚点是:虽然性能稍有差距,但性价比是真香。
而到了Kimi K3这,中国大模型的角色又从「搅局者」变成了「破局者」,因为K3在复杂逻辑推理、长文本处理、代码生成、多场景落地等核心维度的表现让人意识到:原来中国大模型在性能上也可以多方位、深层次地赶上美国顶尖模型。
在此之前,硅谷AI公司能享受高溢价的核心支撑点,其实就在于依靠「闭源付费+高端性能」模式收割全球市场、依靠技术壁垒维持超额利润的想象空间。
这在此前确实成立:虽然有国产大模型先前就在有些方面赶超了GPT、Claude和Gemini等,但在核心维度很难占优,所以对外口径只能是「位列开源大模型第一梯队」……这里为什么要加上「开源」二字,你懂的。
但Kimi K3综合能力在Artificial Analysis综合智能指数评测中排名第三,在代码评测榜单Arena的前端代码榜上则登顶全球编程模型第一(这点含金量很高),在智能体&自动化任务、长文档检索等维度也是Top1……让顶尖开源模型终于能跟顶尖闭源模型坐同一桌了。
犹记得,上个月,有网友在X上问马斯克:「中国大模型何时能追上 Anthropic的Fable水平?」马斯克预测要等到2027年一季度。随后智谱创始人唐杰回应:「用不了那么久」。
现在杨植麟用K3为他的清华老师这番话撑了腰。加州大学伯克利分校教授伊恩·斯托伊卡就感慨:「我们过去常说开源模型落后最前沿6至9个月,现在差距可能只剩2到3个月。」
从「性能不及顶尖但价格属实美丽」,到「性能也能到顶尖水平」,这样的迈步会让不少人想起中国制造——早些年,中国制造给人的印象是「能造出质量还行价格实惠的商品」,而如今,中国制造已向「智造」跃迁。
03/
说这些,不是要导向「东升西落」式的赢学叙事,也不是要回避「整体差距依旧不小」的基本事实。
DeepSeek-R1和Kimi K3,都让硅谷跟华尔街的中国AI「巨物恐惧症」发作了。但这不等于,差距已经被抹平了。
抛开模型能力代差不谈,从底层算力看,国内高端算力自主可控率仍大有提升空间,不能因为「寒武纪不是小英伟达,英伟达是小寒武纪」的段子,就真把横亘其间的天堑给无视了。
从生态成熟度看,硅谷AI经过多年积淀,形成了「算力+模型+工具+场景+资本」的完整闭环,上下游产业链高度成熟,中国AI生态则处于快速发展期,商业化体系等仍待完善。看看国内AI创企跟Anthropic、OpenAI的ARR量级差距,就知道了。
从人才储备看,国内工程师红利虽然让黄仁勋们眼红,但顶尖AI算法人才、底层架构人才的总量跟硅谷还有差距。在「Our Chinese」跟「Their Chinese」的PK中,我们还需要想方设法吸引更多的杨植麟、姚顺雨回来。
看到中国AI从单点技术突破到体系化能力成型的提升,跟看到中美AI的差距,不矛盾。
事实上,越是能看到差距,就越能在正视的基础上加速追赶。梁文锋就说过:「我们经常说中国AI和美国有一两年差距,但真实的差距是原创和模仿之差。如果这个不改变,中国永远只能是追随者,所以有些探索也是逃不掉的。」
也正因看到了差距,DeepSeek跟Kimi都实现了许多架构级的原创式创新。
如DeepSeek的原生链式思考(CoT)自主推演+R1-Zero无样本自进化机制+MoE稀疏架构+MLA优化长上下文承载力等。
又如Kimi的超大容量稀疏MoE基座+KDA混合线性注意力体系+原生百万Token上下文建模技术+Agent Swarm+RL Scaling全链路强化学习范式+MuonClip大规模训练优化器等。
得益于此,DeepSeek V4解决了大模型长文本推理卡顿、逻辑断层、算力浪费的行业痛点,在万亿级参数模型的轻量化部署上创下全球最优水平。Kimi K3则突破了超大参数模型的训练瓶颈,在长文本理解、复杂代码生成、多模态融合能力上实现了对海外旗舰模型的反超。
从DeepSeek R1到Kimi K3,都让人看到了将代差持续缩小的可能——尽管差距依旧存在。
而这类接连涌现的突破,使得中国AI正实现从仰视到平视海外标杆的改变,也注定会让硅谷迎来心态的转变。
过去数十年,美国科技产业的核心优势在于技术迭代的持续性与领先性,顶尖技术诞生后,经常能长期保持代际优势。其他国家则照搬其技术框架、遵循其硬件标准、接受其定价体系。
但DeepSeek-R1和Kimi K3们,正撼动着这样的叙事。
一次可以叫偶然,两次——不同企业在不同时间节点、不同技术路径上,都实现了深层突破,这难免让硅谷部分企业失去「反正有追赶窗口期」的心理优势。
对硅谷而言,它未必忌惮成为第二名的追随者——哪怕其紧追不舍,却必定会忌惮跳出既定轨道的创新者——即便其隔得很远。
04/
取次硅谷懒回顾,半缘DeepSeek半缘Kimi,这是时下很多人的感受——DeepSeek跟Kimi,都成了AI界「争气机」式的存在。
现在说对硅谷「懒回顾」,终究显得有些膨胀,但DeepSeek与Kimi确实呈现了中国AI最有活力的样子。
说起来,无论是DeepSeek,还是Kimi,都不是一开始就被看好能撼动硅谷的「人」。
DeepSeek起初在「6(六小虎)+2(两家有特色创企)」的行业头部格局中并不靠前,在V4跟R1之前,它充当的不过是大模型界「拼多多」的生态位。
Kimi虽然凭借长文本风光过一阵子,但到了2024年以后就拿到了过山车剧本,特别是在DeepSeek火了后,它更是被置于「既生D何生K」的同框对比中成为被群嘲对象。
但它们却在不怎么被看好的情况下跑了出来。
这跟梁杨二人的朝气锐气有关。
梁文锋说中美AI真实差距是「原创和模仿之差」,决意要做原创式创新。
杨植麟说「很多时候你愿意去做一个你不知道的东西,其实你不知道有很多东西不知道,所以你才有这样的勇气去做。当你做了,你会发现有很多新的问题,也许这个东西就是创新的意义。」「Problems are inevitable, but problems are soluble。」
言语之间,都挺显广东人的务实与锋芒。
他们代表了那股疯狂生长、锐意创新的力量。
这也跟当下相对纯粹的竞争环境有关。
回头看,DeepSeek跟Kimi一柔一刚,「赛马」其实从未停止:
2025年1月,DeepSeek-R1和Kimi K1.5同日上线,相隔仅两小时;2025年2月,两家前后脚发论文改造Transformer注意力机制;2025年4月,Kimi推出数学推理模型没多久,DeepSeek-Prover-V2也发布;今年4月,Kimi发布Kimi K2.6,支持300个子Agent协同,OpenRouter调用量直接冲到全球第一,3天后,DeepSeek发布V4系列……
二者也相互「致敬」:Kimi采用的MLA注意力机制,核心思想源于DeepSeek早期工作;DeepSeek V4中关键的Muon优化器,其有效性由Kimi团队率先验证。
良好的竞争生态之上,才能长出更多的DeepSeek跟Kimi。
因而,要珍惜梁文锋杨植麟们身上的创新动能,要呵护让AI企业可以激烈良性竞争的市场氛围。
在适配创新生长的土壤气候里,DeepSeek和Kimi这样的新锐力量才会有更大的向上拓展空间,才有更多的机会继续在全球AI角力场中证明——
「我们玉面双飞龙,可不是浪得虚名」。
✎作者 | 佘宗明
✎运营 | 李玩
转载须经许可
广告合作请联系微信号:rabgogo88
或手机号:18810070968
敬请关注
热门跟贴