来源:市场资讯

(来源:明亮公司)

作者:罗宾
打开网易新闻 查看精彩图片
作者:罗宾

出品:明亮公司

2026世界人工智能大会(WAIC)期间,在国泰海通主办的“智见AI 合创未来”人工智能投融资论坛上,昆仑芯CEO欧阳剑以“AI算力发展的新机遇,新范式”为主题发表演讲。

Token作为AI时代的“水电煤”,其成本能否以每年下降一个量级的速度持续走低,将直接决定产业能否进入真正的普惠化阶段。

面对这一挑战,技术架构与社会基础设施层面都需建立新范式。欧阳剑表示,技术层面,需通过芯片、硬件系统与软件系统的协同创新,解决系统规模与计算效率的核心挑战;社会层面,则需按照基础设施建设和运营算力的思路,带动半导体、能源等产业的协同发展。昆仑芯实现了三代自研架构产品的量产和大规模商业落地,于2024年底至2025年初率先建成3.2万卡国产集群。

作为完整经历从深度学习到大模型爆发全周期的国产AI芯片企业,昆仑芯的战略演进与AI产业发展高度同频。从2011年AI加速器立项,到2015年落地百度搜索推荐等核心业务,再到2020年昆仑芯1代量产、2021年2代量产、2024年3代量产,每一代产品均精准预判了技术趋势:昆仑芯1代奠定XPU核心架构并实现互联网场景大规模部署,2代前瞻性布局片间互联并率先采用GDDR6显存,3代则直接面向大模型训推一体需求,落地首个3万卡国产集群。“前瞻定义、代代成功”的产品能力,源于昆仑芯对算法演进与算力需求的深度耦合理解。

在系统层面,昆仑芯率先落地的3.2万卡集群将有效训练率提升至98%,集群MFU达到58%,展现了国产AI芯片在超大规模工程化部署上的突破。其超节点产品通过32/64卡超高密度集成方案,卡间互联带宽提升8倍,综合训推性能提升5至13倍,单节点即可支持万亿参数超大规模模型训练。

昆仑芯超节点架构重新定义了AI算力效能,为MoE等新一代模型架构提供了高效的Scale-up路径。昆仑芯早在2023-2024年MoE尚未流行之时,已完成超节点的技术规划与产品布局,使其适配于MoE模型的计算,性能提升显著,并在诸多客户中实现大规模量产。

目前,昆仑芯已服务互联网、运营商、金融、能源、自动驾驶等多个领域的头部客户,以“让计算更便宜、让计算效率更高”为使命,持续推动国产AI算力基础设施的规模化发展。

以下为「明亮公司」整理的演讲内容(未经本人审阅):

打开网易新闻 查看精彩图片

Token普惠化,成本「向下Scaling Law」

当模型能力持续突破,Token消耗量呈指数级增长,已成为开发者、内容创作者及普通用户的新型刚需。Sam Altman曾预言,“我们看到未来,智能就像电力或水一样,人们通过电表、水表从我们这里购买,随心所欲地使用它。”

从实际消耗来看,开发者每日调用可达200-2000次,单次消耗2万至3万Token,Claude Code最高日调用量达77亿;内容创作者单次消耗5万至30万Token,每日支出可达50-500元。当前Token价格虽基于DeepSeek V3.2官方定价(输入2元/百万Token,输出3元/百万Token)已大幅下降,但开发者月均支出仍达数千至数万元,对普通用户而言仍是负担。

技术进步与应用落地正驱动Token需求持续爆发。部分科技公司月度Token调用量从2024年5月的10万亿快速增长至2026年6月的5400万亿;中国推理Token消耗的年复合增长率预计高达230%,2030年将达3900千万亿Tokens/年。Scaling Law仍然成立并得到拓展,预训练、后训练RL新范式、推理CoT共同推动模型性能提升。

与此同时,Token成本必须大幅下降,AI才能真正成为基础设施。过去3-5年,Token价格以每年10倍以上的速度不断下降,o1同等水平模型的调用价格相比发布时点已降低100倍以上。但这还远远不够。算力产业正在经历一场从芯片到系统的全栈式范式变革。

打开网易新闻 查看精彩图片

算力产业从芯片到系统的爆发式创新

面对Token成本每年必须下降一个量级的刚性约束,技术层面的创新不能再局限于单点突破。我们不能只盯着芯片制程,也不能只盯着模型压缩,必须是芯片、硬件系统、软件系统三层协同创新。与此同时,芯片架构上的HBM2E存储配置、推理架构优化以及模型压缩技术的全栈配合,才能推动算力效率的持续跃升。

但技术只是问题的一半。当Token用量真正达到水电煤级别,社会基础设施的范式也必须重构。

能源侧,GW级数据中心与绿电布局不再是可选项;供应链侧,Foundry和OSAT的产能扩张、HBM与CoWoS封装的产能竞争,都需要全产业链提前布局;运营模式侧,运营商必须从单纯的管道角色转向Token运营,构建多管齐下的基础设施服务体系。Token成为核心基础设施,它会像涟漪一样辐射到能源、半导体、零部件、运营服务等每一个维度,带动整个产业协同发展。

打开网易新闻 查看精彩图片

昆仑芯实践:完整经历AI浪潮,三代产品代代成功

昆仑芯从2011年就开始做AI加速器,完整经历了从深度学习到大模型爆发的每一个阶段。从2015年落地百度搜索、推荐等核心业务场景,到2017年启动AI芯片系列产品设计、2018年XPU架构亮相Hot Chips,再到2020年1代量产实现规模化商业落地,每一步都与产业演进同频共振。

做芯片最怕的是产品定义滞后于市场需求。我们的经验是,必须对算法演进趋势有前置判断。三代产品的预判逻辑很清晰:1代奠定XPU核心架构时,国内互联网场景的大规模部署需求刚刚爆发;2代精准预判了大模型发展趋势,前瞻性布局片间互联并率先采用GDDR6显存;3代则直接面向大模型训推一体需求,8张卡就能跑满血版DeepSeek-R1,这在当时是很多同行不敢想的事。而面向2026至2027年的下一代产品,我们将进一步结合前沿算法趋势,实现软硬协同设计,为超大规模系统奠定基础。

三代产品下来,我们验证了一个道理:前瞻定义、代代成功,靠的是对算法和算力需求的深度耦合理解,而不是闭门造车。

打开网易新闻 查看精彩图片

系统层面率先落地3万卡集群,超节点产品开创先河

刚才提到那么多的挑战,我们也在新一代的产品里面努力解决这些问题,包括下一代的高性能推理芯片,以及下一代高性能的训推一体产品。从技术层面,为了解决算力效率和成本的问题,有一个特别好的办法就是Scale-up系统,这也是我们在几年前预判到的一个技术解法。

超节点是我们在2023、2024年就开始做的,当时MoE还没那么流行,我们提前做了一些技术规划。做完之后,确实在2025年DeepSeek出来之后,大家认识到这种大的MoE模型肯定就是以后的主流方向。MoE特别明显的一个瓶颈就是传输的挑战,因为多个专家之间的数据要做交换,而我们超节点特别适合这种大MoE模型的计算,性能提高的非常多,也在很多客户实现了大规模量产。

具体而言,我们率先推出的32/64卡超高密度集成方案,将单卡性能提升了95%,卡间互联带宽提升了8倍,综合训推性能提高了5到13倍;256/512卡方案已全面落地,未来可扩展至4千卡规模,单节点即可支持万亿参数超大规模模型训练。超节点架构重新定义了AI算力效能。过去大家比的是单卡算力,未来比的是单节点、单集群的系统效率。MoE模型对互联带宽的需求,让Scale-up不再是可选项,而是必选项。

从芯片到系统,从万卡到超节点,我们正在完成从卖芯片到定义系统的关键跨越。我们的使命是让计算更智能,拆解下来就是两个维度:让计算更便宜,让计算效率更高。三万卡集群和超节点产品,是这两个维度在系统层面的集中体现。目前,昆仑芯已服务互联网、运营商、金融、能源、自动驾驶等多个领域的头部客户,以芯片和系统层面的双重突破,支撑AI业务的规模化落地。