预计这个 OCI 超级集群将成为云端最庞大的 AI 超级计算机。

Oracle 计划部署一台庞大的云超级计算机,其连接的 GPU 数量达到创纪录的水平。

OCI 超级集群将支持多达 131072 块英伟达 Blackwell GPU,并将于 2025 年上半年推出。

Oracle 表示,这将使这套系统的峰值性能达到 2.4 zttaflops,不过它可能指的是 AI 性能,AI 性能用 FP8(即 8 位精度计算)而不是 FP64(64位精度计算)来衡量。

1 zettflops 相当于每秒 10 万亿亿次运算。

全球最快超级计算机的速度通常用 exaflops 来衡量,它比 zettaflops 要小三个数量级。

OCI 超级集群的最高配置版本拥有的 GPU 数量是全球性能最强大的 系统 Frontier 超级计算机的三倍多,是其他超大规模计算 系统 的六倍多。

目前尚不清楚是否所有 131072 块 GPU 在推出时全部配备到位。

Oracle 云基础设施执行副总裁 Mahesh Thiagarajan 表示:“我们拥有市面上最广泛的 AI 基础设施产品之一,并为在云端运行一些要求最苛严的AI工作负载的客户提供支持。”

“有了 Oracle 的分布式云,客户就可以灵活地在自己选择的任何地方部署云 和 A I 服务,同时保留最高 级别 的数据和 AI 主权。 ”

较小的 OCI 超级集群配备英伟达 H100 GPU,其他版本则配备 H200 和 Blackwell GPU。H100 超级集群可以扩展到 16384 块 GPU,性能高达 65 exaflops,聚合网络吞吐量达到 13Pbps。

今年晚些时候推出的 H200 超级集群可以扩展到 65536 块 GPU,性能高达 260 exaflops,聚合网络吞吐量为 52Pbps。

配备英伟达 GB200 NVL72 液冷裸机实例的 OCI 超级集群将使用 NVLink 和 NVLink Switch ,使多达 72 块 Blackwell GPU 能够在单个 NVLink 域中以 129.6 TBps 的 聚合 带宽相互通信。

最庞大超级集群具体放在哪里还没有透露。

几家公司已经得益于这种先进基础设施。WideLabs 和 Zoom 正充分利用 OCI 的高性能 AI 基础设施来加快各自的 AI 开发工作,同时保持主权控制。

昨天 Oracle 创始人 Larry Ellison 表示,该公司目前在全球共有 162 个运营中或在建的云数据中心,其中最大一个云数据中心的容量为 800兆瓦。正计划建造一个千兆瓦的数据中心,将由三个小型模块化核反应堆提供动力。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

近日 Oracle 暴涨: