当AI从训练走向推理、智能体和长上下文工作流,行业里被反复念叨的那块短板正在换位置。花旗AI基础设施峰会的会议纪要显示,网络互连、内存带宽与容量、数据传输效率,正在取代算力成为关键瓶颈。

这份纪要给出的判断很直接:算力不再是唯一被盯住的环节。推理、智能体、长上下文这几类工作流对数据搬运的要求,和过去的大规模训练并不一样。

打开网易新闻 查看精彩图片

四家厂商,四种应对

纪要提到,博通、Marvell、三星和AWS各自给出了针对性的应对方案。四家分处不同环节,指向的却是同一类压力。

  • 博通:网络互连方向
  • Marvell:网络互连方向
  • 三星:内存带宽与容量方向
  • AWS:数据传输效率方向

把这几家放在一起看,能看出瓶颈的分布并不集中在一处。互连、内存、传输,三个环节同时被点名。

瓶颈为什么会转移

训练阶段的压力集中在算力上,而推理、智能体、长上下文工作流要反复搬运数据。数据搬得动、搬得快,才谈得上算力被用起来。

网络互连决定数据在节点之间怎么走,内存带宽与容量决定数据能多快被取到、能放多少,数据传输效率决定整体链路是否顺畅。三者中任何一环卡住,算力都会闲置。

峰会纪要没有给出具体的性能数字,也没有披露各家方案的技术细节。但把网络互连、内存带宽与容量、数据传输效率并列为关键瓶颈,本身就是一种判断:AI基础设施的竞争,正在从单点算力转向系统协同。