7月24日,在旧金山举行的AI峰会上,SK集团与英伟达宣布一项备受关注的合作计划。

此前,SK电讯计划在韩国建设一座2GW AI云计算中心,SK海力士将为英伟达下一代AI计算平台长期供应HBM,首座AI工厂预计于2027年投入运营。5000亿美元的合作规模足够吸引眼球,但真正让我关注的,是另一个数字——2GW。

2GW意味着什么?如果按一台AI训练服务器约10kW功耗计算,这座数据中心未来可能部署超过20万台服务器。很多人第一时间想到的是GPU、HBM和高速网络。

这些当然重要,但真正到了工程现场,更大的挑战往往不是算力够不够,而是这么多设备,如何长期稳定地协同运行。

打开网易新闻 查看精彩图片

真正难的,不是算力,而是时间同步

原因很简单,一台AI服务器并不是只有GPU在工作,GPU、HBM、PCIe、交换芯片、光模块等高速器件,都需要共享统一的时钟基准,才能保持协同运行。

如果只是单台服务器,问题还相对简单;可当规模扩大到几十万张GPU、数万个交换节点、成千上万个机柜时,情况就完全不同。

分布式训练过程中,不同服务器之间需要持续交换数据。如果节点之间的时间出现偏差,轻则增加网络重传、降低训练效率,重则影响整个任务的稳定运行。所以,大型AI数据中心拼的不只是算力,更是时间同步能力。

这也是为什么,近年来PTP(精确时间协议)和SyncE(同步以太网)越来越受到关注。

不过,很多人容易忽略一点:PTP、SyncE只是完成时间同步的协议,而真正决定同步精度的,是底层的参考时钟。

高速光模块、交换机、AI服务器通常采用低抖动差分晶振、有源晶振作为高速接口的参考时钟;而数据中心的PTP主时钟、授时设备和核心同步节点,则需要稳定性更高的TCXO、OCXO,甚至VCOCXO,为整个系统提供统一、可靠的时间基准。

其中,VCOCXO(压控恒温晶振)兼具恒温晶振的高稳定性和压控调频能力,能够在接收GPS、北斗等外部授时信号时,对频率进行动态微调,长期保持高精度同步,因此广泛应用于时间服务器、通信网络同步和高精度测试设备等场景。

目前,SJK晶科鑫已布局AI服务器和高精度时钟同步应用,产品覆盖156.25MHz、312.5MHz LVDS差分晶振、有源晶振、TCXO、OCXO以及VCOCXO等系列。其中,9.7×7.5mm封装10MHz VCOCXO采用3.3V CMOS输出,可满足高精度时间同步、授时设备及通信网络等应用需求,为复杂系统提供稳定可靠的时间基准。

打开网易新闻 查看精彩图片

AI工厂越大,越离不开稳定的时钟

回过头来看,SK与英伟达这笔合作,表面上是在扩建AI算力,实际上考验的是整个基础设施的协同能力。从GPU、HBM,到光模块、交换机,再到时钟系统,每一个环节都决定着AI工厂能否长期稳定运行。

AI数据中心越大,对时间同步的要求就越高;算力越强,对底层器件一致性和可靠性的要求也越高。很多时候,真正决定一座AI工厂能跑多远的,不一定是最贵的GPU,而是那些很少出现在新闻标题里的基础器件。

GPU决定AI算力的上限,而时钟决定AI算力能否稳定地跑到那个上限。