过去几年,行业的目光一直盯着“多少张卡、多大闪存、多快算力”。但当模型参数从百亿走向千亿、万亿,一个容易被忽略的短板开始暴露:GPU之间的通信效率,正在成为训练成败的决定性变量。

单卡再强,也扛不住网络拖后腿;集群越大,网络瓶颈就越致命。

打开网易新闻 查看精彩图片

与此同时,机房空间告急、电力成本攀升、芯片持续涨价——这些挑战看似分散,最终却指向同一个问题:如何用更少的资源、更低的成本,建起一张能撑起大规模AI训练的算力网络?

答案并不复杂:网络联接的速度,决定了智能的高度。当千模竞发、万卡集群成为大势所趋,AI网络基础设施的能力,正在成为企业拉开AI竞争力的关键“分水岭”。

01.

大模型爆发,

直面算力网络的“暗流涌动”

这个“分水岭”究竟有多深?一组数据可以说明问题:截至2026年4月,国家级备案AI大模型已达868家,而2024年这一数字仅为188家。短短两年间,从“百模大战”到“千模争鸣”,中国AI产业正式步入“行业模型+AI Agent规模化落地”的全新阶段。

大模型数量的激增与智能体的涌现,让训练和推理对AI网络基础设施提出了前所未有的要求,在具体实践中,集中体现为以下四大挑战:

打开网易新闻 查看精彩图片

一是,大模型训练的“木桶效应”。AI大模型训练的瓶颈不在于单张GPU有多快,而在于GPU之间的通信效率。网络一旦丢包,GPU就会陷入“干等”状态,造成算力闲置,导致千万级投资白白浪费。

二是,网络可靠性不足,训练中断代价高昂。大模型训练动辄数周数月,一旦网络设备出现故障,轻则训练暂停,重则从头再来。频繁的中断不仅浪费算力,更拖慢了模型迭代的节奏。

三是,高密度算力下的功耗与空间危机。机房空间有限、电费高昂的问题日益突出。传统多台小口径交换机堆叠的方案,不仅线缆如“盘丝洞”般杂乱,功耗更是如同“无底洞”,严重制约了算力密度的进一步提升。

四是,供应链持续承压,加剧成本挑战。大规模组网本就意味着海量网络设备的投入,而核心芯片的供应波动让这笔投入“雪上加霜”。据行业信息,博通TH5等主流芯片交货周期长达70—80周,2026下半年国内供给预计仅能满足60%—70%的需求;英伟达GPU芯片同样面临紧缺,客户获取相关GPU的等待时间已持续至2026年底。如何在性能与成本之间找到平衡,已成为每家企业必须面对的必答题。

这四大挑战并非孤立存在,而是彼此交织、相互叠加,分别指向通信效率、网络可靠性、部署密度和采购成本四个维度,它们共同构成了当前AI网络基础设施建设的核心困境:既要跑得快,又要稳得住;既要装得下,还要花得少。也正因此,能否同时破解这四个难题,决定了企业能否真正跨越AI规模化落地的网络“鸿沟”。

02.

旗舰破局,

硬核实力构筑AI网络“最强底座”

要跨越这道“鸿沟”,就需要一把真正的“利器”。联想问天系列的最新旗舰NE8780-128QC2XS交换机正是为此而生,这款基于博通最强TH5芯片打造的128口400G交换机,为大模型训练与推理构建零丢包、超低延迟的算力网络,迈出打通AI训练“任督二脉”的关键一步,其技术优势主要体现在以下四个方面:

首先,超高密度,破解空间与成本困局。联想问天NE8780-128QC2XS交换机单台支持128个400G端口(兼容100G/200G,奇数端口支持一分四),提供高达102.4Tbps的交换容量,实现全线速无阻塞转发。相比传统方案,可大幅减少设备数量与机柜空间占用,有效降低总体拥有成本,这正是对“高密度”与“低成本”要求的直接回应。

其次,零丢包网络,攻克通信效率瓶颈。联想问天NE8780-128QC2XS交换机支持RoCEv2、AI-Fabric无损网络及AI全局负载均衡(RALB/AILB/ENLB)。其中,端网协同负载均衡(ENLB)在实际测试中,4机Llama2-7B训练性能较传统逐包方案提升10%,显著缓解GPU“干等”问题,让“木桶效应”不再成为算力释放的绊脚石。

打开网易新闻 查看精彩图片

第三,高可靠保障,守护训练不间断。面对动辄数周数月的大模型训练任务,网络的可靠性同样是决定成败的关键。为此,联想问天NE8780-128QC2XS交换机配备2+2冗余电源、4+1冗余风扇,支持热插拔设计、无重置固件升级、热补丁以及BFD/NSR/GR等高可靠特性。配合全国原厂3年7×24小时服务(含上架),全力保障训练任务持续稳定运行,让“训练中断”的代价降到最低。

最后,算网协同,释放整体系统潜能。硬件可靠是基础,软硬协同才能释放极致性能。联想作为深耕服务器领域的厂商,拥有独特的系统级调优优势,更懂网卡与交换机的联合调优,可提供“算力+网络”整包优化方案。自研LCCL集合通信库实现节点内(
CPU-Reduce/N-Tree/Multi-Path)与节点间(分层通信/链路预分配)双重优化,有效减少网络拥塞与长尾延迟,从系统层面打通性能堵点。

由此可见,联想问天NE8780-128QC2XS交换机的四大优势并非孤立存在,而是层层递进、相互支撑:超高密度从物理层面破解部署成本与空间压力;零丢包网络从传输层面攻克通信瓶颈;高可靠保障从运维层面守护长周期训练;算网协同从系统层面打通调优壁垒。四者合力,共同构成了联想面向大规模AI训练的网络基础设施“最强底座”。

03.

由点及面,

联想智算网络的“广度与深度”

旗舰产品固然亮眼,但AI集群的规模千差万别——从几十卡到上万卡,单一产品难以覆盖全部场景。基于此,联想构建了完整的AI网络产品矩阵,帮助客户在性能与TCO之间实现最优平衡。

其中,联想问天NE8780-128QC2XS交换机(Tomahawk5,102.4Tbps,128个400G),作为联想AI网络产品矩阵的旗舰,搭载万兆带内管理端口,突破传统千兆带外端口采样带宽不足的行业瓶颈;智能调度引入创新负载算法,实现97%的带宽利用率,结合业务流量与监控流量物理隔离,在万卡大规模组网场景下有效降低整体部署成本。同时,该交换机还可作为数据中心核心(Spine节点)或Leaf节点,构建高可靠性、高度冗余的超大规模数据中心网络。

联想问天NE8770-64QC交换机(Tomahawk4,51.2Tbps,64个400G),面向高端数据中心与AIGC智算场景设计,搭载RALB、AILB、ENLB等多种负载均衡技术,显著提升大模型训练效率,原生支持RoCE一键部署,是一款高性能、高密度的核心AI交换机。

打开网易新闻 查看精彩图片

联想问天NE8570-4C交换机(Tomahawk3,25.6Tbps,128个100G/32个400G),是一款新一代高性能、高密度插卡式交换机,定位为企业数据中心核心+AI交换机,可搭配联想相应ToR交换机,灵活搭建标准Spine-Leaf网络架构。

打开网易新闻 查看精彩图片

三款产品均基于博通Tomahawk系列芯片,从25.6T到102.4T,从100G到400G,实现了从入门到大规模的全场景覆盖:联想问天NE8780-128QC2XS交换机作为旗舰担当万卡级核心组网;联想问天NE8770-64QC交换机承载中型AI集群;联想问天NE8570-4C交换机覆盖入门级和企业数据中心场景,三款产品“各司其职”,客户可根据自身规模和预算灵活选型。

更为重要的是,三款产品均基于Lenovo NOS操作系统,客户从小规模起步,未来扩规模时无需更换网络架构,只需增加设备即可平滑扩展,真正实现“按需选型、平滑扩展”。

产品矩阵解决了“选型”的问题,但要让网络真正“好用”,还需要更深层次的能力和服务支撑,这种“深度”体现在技术、运维、供应链以及生态等几个方面。

在技术方面,联想自研多项核心组网技术,从负载均衡、组网架构、故障自愈等多维度切入,系统性优化GPU集群通信效率,充分释放算力潜能。

打开网易新闻 查看精彩图片

技术底座之上,还需要让客户真正“用好”网络。为此,在运维方面,联想智算网络配套一站式智能运维平台,实现算力网络快速交付与全链路智能管控,包括在“简部署”层面,千卡集群交付从3周缩短至1天,支持设备0配置上线、RoCE一键部署、自动验收;在“易运维”层面,基于Telemetry的秒级遥测(芯片级)实现RoCE业务流可视、故障根因分钟级定位,让运维人员从“救火队”变为“指挥官”;在“智能调优”层面,自适应ECN、智能辅助RoCE调优等能力可将故障导致的业务中断时间减少80%,让网络在无人干预的情况下持续保持最佳状态。

技术与运维之外,更深层的保障来自供应链和生态。在供应链方面,联想凭借与博通的深度合作获得了稳定的供应保障。相比之下,采用同类芯片的竞品方案不仅货期更长,且价格涨幅更大,这让联想的性价比优势更加突出。同时,在生态方面,联想作为UEC(超以太网联盟)高阶会员(全球仅27家),深度参与下一代AI网络标准制定,具备前瞻技术话语权。

“广度”与“深度”兼备,让联想不仅能满足客户当下的网络建设需求,更能陪伴客户从容应对未来的每一次网络升级。选择联想,不仅是选择当前最强悍的产品与最省心的运维体验,更是选择了一条可持续演进的AI网络技术路线。

04.

四大能力,

打通AI训练的“任督二脉”

至此,从旗舰产品到产品矩阵,从技术广度到服务深度,联想智算网络方案已经搭起了一整套系统性能力。那么,这些能力到底能给客户带来什么?归根结底是四个关键词——全栈、弹性、省钱、兜底,它们正好对准了AI网络基础设施建设中最难啃的那几块骨头。

打开网易新闻 查看精彩图片

第一,“全栈”能力。指的是联想从芯片适配到交换机研发、从通信库到运维平台,都具备端到端的整合能力,客户无需在多供应商之间协调适配。从选型到交付再到售后,技术栈的一致性更高,兼容性问题更少,集成效率大幅提升。

第二,“弹性”能力。联想网络产品均基于Lenovo NOS操作系统,客户从小规模起步,未来扩规模时无需更换网络架构,只需增加设备即可平滑扩展,充分保护初始投资。客户可以根据业务发展节奏灵活规划网络投入,不必一次性过度采购,也不必担心未来扩容推倒重来。

第三,“省钱”能力。联想具备IB与以太网双架构的产品布局能力,可根据客户业务需求灵活选择。同时,在当前主流的以太网生态中,联想通过智能算法优化负载均衡、减少设备数量,进一步降低了高性能网络的建设成本。不仅如此,在核心芯片供应趋紧的背景下,联想凭借稳定的供货和极具竞争力的定价,进一步放大了性价比优势。

第四,“兜底”能力。联想拥有国内规模领先的AI全生命周期服务交付体系,依托完善的备件网络、技术中心与专业工程师团队,为智算项目的平稳运行提供坚实保障。

但“兜底”的含义远不止于此。联想智算网络所代表的,绝不仅仅是交换机的交付与运维,而是万全异构智算方案下全栈协同的坚实底座,它与服务器、存储等环节深度耦合,共同构筑从智算中心、模型工厂到词元工厂的全链路解决方案,让万全智算释放算力的每一分效能。

打开网易新闻 查看精彩图片

正因如此,联想智算网络的“兜底”能力,兜的不只是一张网络,而是Token驱动的AI算力基础设施所承载的整条价值链。这背后,是联想万全智算体系为企业AI落地全程护航的郑重承诺。

这份承诺所回应的,归根结底正是客户在AI基础设施建设中最现实的几道难题——选型难、扩容难、预算紧、运维烦,并给出了贯穿全栈的系统性解法。

选型难,联想用“全栈”能力让客户无需在多供应商之间协调适配,一个技术栈贯穿到底;扩容难,联想用“弹性”能力让网络随业务生长;预算紧,联想用“省钱”能力让高性能不再昂贵;运维烦,联想用“兜底”能力让客户从琐事中解脱。

当千模竞发、万卡集群成为“新常态”,谁能帮助客户以更低的成本、更快的速度、更省心的方式构建智算网络,谁就能在这场AI军备竞赛中赢得真正的信任。而联想,正是那个打通AI训练“任督二脉”的“最优解”。