通过部署定制芯片并结合领先的 AI 基础架构,超大规模企业和 AI 原生公司能够构建兼具专业化与规模化的灵活 AI 工厂。
为了大规模生成智能,AI 工厂需要持续运行,其经济效益由交付的输出决定:每秒 Token 数、每瓦特 Token 数、每 Token 成本、利用率和正常运行时间。这需要将 AI 基础设施作为完整的工厂来设计和构建,而不是简单地将加速器堆积在一起。
构建定制 XPU 的超大规模企业和 AI 原生公司不仅要考虑 XPU 本身的设计,还要考虑整个 AI 平台的设计和开发,包括纵向扩展和横向扩展网络、整机架方案、生产工厂软件以及强大的供应商生态系统。
面对 AI 工厂规模需求,这条路径既复杂又昂贵,成为 XPU 快速推向市场的根本性障碍。打破这一限制意味着要将定制 XPU 与经过验证、成熟可靠的基础架构相结合,使建造者能够将创新重点放在最重要的地方,同时利用已有的技术解决其他问题。
NVLink Fusion 正是为满足这种需求而打造,将 XPU 连接到 NVIDIA 领先的 AI 基础设施,为半定制 AI 算力工厂提高性能、加快上市速度并降低风险。
通过高速纵向扩展释放 XPU 性能
NVLink Fusion 将 XPU 引入 NVIDIA NVLink 纵向扩展互连域。第六代 NVLink 提供领先的高带宽、低延迟网络实现 72 个 XPU 的互连域。与基于通用以太网的替代解决方案相比,XPU 到 XPU 传输的端到端延迟降低至三分之一,数据包速率提高 10 倍。
NVLink Fusion 还包含 NVIDIA NVLink-C2C 技术,可将 XPU 连接到 NVIDIA Vera CPU 或其他生态系统 CPU,能效最高可达 PCIe 接口的 6 倍,显著减少代理式 AI 系统在控制和计算之间的性能瓶颈。
经过验证的堆栈和生态系统,助力开发和部署
开发定制 XPU 的团队往往面临将 XPU 创新成果转化为数据中心部署所需工作量和复杂性的巨大挑战。NVLink Fusion 为快速开发、集成和部署提供了生态系统支持,涵盖 ASIC 设计、CPU 以及 IP 和光互连合作伙伴。
借助基础设施标准化管理风险
AI 工厂的规划无需等待芯片准备就绪才启动。电力采购、设施设计、冷却系统、机架布局和网络架构早在最终加速器组合可用之前就可以开始了。受限于单一芯片选择的数据中心可能会面临进度延误的风险。
NVLink Fusion 通过统一的架构解决了这些挑战。基于 XPU 和 GPU 的系统,例如 Vera Rubin NVL72,可以共用机架空间、网络、冷却、供电和管理系统。运营商可以在尚未确定芯片组合的同时进行扩容,然后根据工作负载需求、芯片供应和业务优先级的变化重新调配容量。
为 AI 工厂进行设计、验证和运营
AI 工厂建设成本高昂,一旦出错可能需要付出昂贵的代价返工。基础设施必须在开始施工之前完成验证。NVLink Fusion 与 NVIDIA DSX AI 工厂参考架构保持一致,实现建筑、供电、冷却、计算和网络的协同设计。NVIDIA Omniverse DSX AI 工厂 Blueprint 为十亿瓦级 AI 工厂提供了数字孪生及开放参考设计,助力合作伙伴能够在正式部署前同步对设施和技术进行建模。
以上为摘要内容,点击“链接”阅读完整内容:XPU 如何满足世界级 AI 工厂的需求 | NVIDIA 英伟达博客
热门跟贴