来源:市场资讯

(来源:无锡日报)

打开网易新闻 查看精彩图片

AMD Advancing AI 2026大会现场

2026年7月,美国旧金山Moscone中心,AMD Advancing AI 2026全球开发者大会现场,近千名开发者正在同步进行智能体AI、多模态应用、生成式AI、GPU编程和AI应用开发实操。让人想不到的是,他们使用的全部算力,并不来自美国本地机房,而是来自一万公里外——无锡高新区企业构建的一座智算机房里,它就是新威智算千卡集群。

半年多前的2025年12月26日,全球首个基于AMD Radeon的开源生态智算中心——新威智算中心在位于无锡高新区的无锡(国家)软件园点亮,一期建成5000张AMD Radeon PRO W7900D GPU。当时人们并不太清楚这个算力中心能干啥。

半年后,它用一场硬核的跨国实战证明了自己。

01

算力“远征”要过四道坎

跨国送算力,听着新鲜,做起来全是难题。大会Workshop面向全球开发者,网络环境参差不齐,卡顿、掉线都会被现场“抓包”。技术团队锁定了四道必须跨过去的坎:

跨洋不能卡:全球各地同时接入,网络延迟要低到人眼看不出停顿;

千卡随要随到:1024张GPU动态分配,多个任务同时跑不能“打架”;

模型秒级下载:开发者直连Hugging Face、Docker Hub上的大模型,跨国下载不能等;

出故障分钟级恢复:主集群要是出故障,备集群得立马顶上。

打开网易新闻 查看精彩图片

Advancing AI Workshop现场

这些硬指标怎么达成?

靠的是一套扎实的算力“家底”和极限备战。新威智算构建了一套高可靠的“算力堡垒”:128节点的双集群架构,配合25G RoCE无损网络、2PB全闪存储,以及基于K8s深度调优的调度系统。

01

算力层

1024张AMD Radeon PRO W7900D GPU,主备双集群架构,原生适配ROCm开源生态。

02

网络层

25GRoCE集群无损互联,20Gbps跨境出口带宽,全球加速优化跨洋路由。

03

存储层

2PB全闪NVMe分布式存储,200Gbps+写入带宽,Harbor 镜像预热大幅削减海外拉取耗时。

04

调度层

基于云工场科技深度调优的K8s千卡调度体系,秒级GPU分配,多任务并发零资源冲突。

05

安全层

全链路等保三级一体化部署,构建纵深防御体系,保障数据安全与跨境访问合规。

打开网易新闻 查看精彩图片

双集群分布式算力架构示意图

02

四轮测试、五次演练,换来两天零故障

大会开幕前三天,团队进入最后冲刺——四轮极限压测、五次全盘故障演练。

调度有延迟?连夜调参数,最终实现GPU秒级响应;

跨国拉模型卡顿?搭建本地缓存仓库,主流大模型下载提速到20秒以内;

存储有瓶颈?反复调整,写入带宽稳定突破200Gbps;

容灾切换?练到2分钟内完成故障恢复。

7月22日至23日大会两天时间里,母公司云工场科技和新威智算技术团队24小时轮值。

最终成绩单相当硬核:累计完成1159次开发环境启动,覆盖超过900名活跃开发者,核心服务可用性100%,全程零故障、零中断。

03

扎根无锡,服务全球

新威智算的千卡集群并非第一次“出征”。在此之前,它已支撑过全球ASC超算竞赛、AI DevMaster、Lablab Hackathon等10多项国际活动,服务过超5000名注册开发者。

打开网易新闻 查看精彩图片

AI DevMaster全球黑客松

“这套算力能这么快跑起来,离不开无锡高新区的产业土壤。”作为全球首个AMD ROCm开源生态智算中心,它的落地本身就是无锡高新区与全球半导体巨头深度合作的重要成果。

新威智算中心依托AMD ROCm开源体系,面向人工智能推理、AI Agent、科学计算、图形渲染等多类场景,提供高效、灵活的算力服务。无锡高新区近年来全力推进“All in AI”,为这类算力基础设施的应用提供了丰富的场景。

新威智算总经理季黎俊在智算中心点亮时就说过:“我们希望证明开源生态同样可以支撑起高性能、高可靠的AI生产力。”

这场横跨太平洋的算力实战,给出了响亮的回答。