逛2026年Computex展会的英特尔展台,我挤了半天才挤进人堆。大部分人都围着单颗AI加速卡的参数屏惊叹,我却被产品手册角落一行不起眼的数字勾住了目光。32U的标准机架空间,硬生生塞下了36864个核心,整机功耗还刚好卡在100千瓦。这可不是什么小打小闹的芯片迭代,说是算力行业的拐点信号都不为过。
很多人以为这就是英特尔自己攒的硬件堆料,其实是三家跨界搭伙做出来的量产货。英特尔出最新的至强处理器当算力底座,SambaNova出可重构的数据流加速单元,富士康负责从头到尾的系统集成和量产落地。三家各出长板拼出来的这套东西,从根上就和以前的方案不一样。
以前大家买AI算力方案,基本就是厂商卖完加速卡就走人,剩下组网调试适配,全得客户自己摸黑折腾。动辄好几个月的适配周期,不少本来赶进度的项目,硬生生被拖到错过了窗口期。这套联合方案从设计的时候就把计算网络内存三条链路全打通,客户拿到手不用再慢慢折腾跨硬件适配。
最能直观感受到变化的就是并发推理场景。大流量请求涌进来的时候,传统多卡堆出来的集群经常卡传输,调度还慢得离谱。这些糟心问题,在这套一体化架构里改善特别明显。
不少想搭AI算力集群的企业,都踩过扩容的坑。要么一开始就砸大价钱买满配设备,预算一下就砸进去大半,要么零散买卡扩容,回头发现不同批次硬件不兼容。不少中小AI公司的现金流,就是被前期这些硬件投入拖得喘不过气。
这套方案用的是模块化架构,企业可以跟着自己的业务规模慢慢增减计算模组。不用一开始就把所有预算砸进去,哪怕是几十人的中型AI团队,也能先上半幅机架跑核心业务。等用户量上来了,再慢慢补全剩下的模组就行,灵活度拉满。
它还同时兼容训练和推理两个场景。白天把大部分算力分给线上智能体的推理服务,夜间业务低峰的时候,直接切换去做大模型微调。单套设备的资源利用率,比传统分开部署的模式高出不少,这笔账怎么算都划算。
很多企业其实没算过明白账,算力硬件的采购成本,其实只占总投入的三成。剩下七成全是机房改造、运维调试、资源空转的隐性成本,这些钱花了还看不见,最坑人。富士康还做了高CPU密度的机架变体,专门适配轻量化AI负载,不需要满配三万多核心的企业,也能选到刚好够用的配置,不用为用不上的算力多花钱。
以前行业里的高密度算力机架,动不动就要150千瓦以上的供电。大部分存量数据中心的机柜供电上限也就100千瓦,想要部署就得花大价钱改配电改散热。光这笔基建投入,就能把项目落地拖慢半年多,不少企业扛不住直接就黄了。
这套方案把单液冷机架的功耗控制在100千瓦,还只占32U的标准机柜空间。不少已经做过基础液冷改造的IDC机房,不用大面积动基础设施就能直接上架。直接省掉了高额的前期改造成本,落地速度快了不是一点半点。
这玩意儿是工业级算力设备,个人开发者和小型本地工作室完全没必要凑这个热闹。它从定位上就不是给单台本地部署做的,面向的就是大规模业务场景。真正适合它的,是手里有大模型业务,打算自己建算力集群的中大型科技企业和云服务商。
这类客户的长期运营成本,会随着集群规模扩大慢慢摊薄。一体化方案的协同优势,只会越用越明显。不会像传统方案那样,规模上去了,各种隐性损耗也跟着涨。
过去五年AI算力圈都在说,单颗芯片算力十八个月翻一倍,厂商开发布会核心就是晒跑分秀参数。现在这个赛道的竞争规则已经悄悄变了,单芯片的性能增长,早就碰到了数据传输、调度协同的隐性天花板。传统多卡横向堆叠的方案,入门门槛低采购灵活,可集群规模到几千卡级别,卡间交换延迟和调度开销,能吃掉近三成的理论算力。
很多企业花大价钱堆出来的集群,实际利用率还不到六成,一半的钱都打了水漂。英特尔这套方案,相当于把三家巨头的长板拼到一起,从物理层面就把协同效率的瓶颈提前打通了。以后云服务商把这类资源放到公有云池子里,企业调用大规模算力的等待周期,会从按天算直接变成按分钟算。
不少人担心现有AI软件生态的迁移成本太高。其实做大规模集群的企业客户,早就有专门的算力适配团队。生态迁移的成本,远低于长期低效运营的损耗,怎么选都划算。
回头看过去十年的服务器产业,最早大家拼单CPU性能,后来慢慢转向整机柜定制、一体化交付。AI算力行业现在走的,就是当年服务器产业走过的路。那些还死磕单芯片跑分的厂商,可能还没反应过来,真正的赛场早就移到系统整合、落地适配这边了。
谁能把客户搭算力集群的隐性成本压到最低,谁就能在下一轮产业扩容里拿到更多市场份额。未来两三年,肯定会有更多这种跨界整合的算力方案冒出来。AI算力普惠从来不是靠单颗芯片降价就能实现的,得整个产业链从底层架构重新设计,把每个环节的冗余损耗都挤出去。
等机架级一体化方案变成行业主流,普通企业想启动一个大模型项目,再也不用养十几个人的算力运维团队。拿到手就能直接跑满算力,那才是AI算力真正普及的起点。
参考资料:中国电子报 英特尔富士康联合推出机架级一体化AI算力方案
热门跟贴