今天下午,备受关注的东方算芯在上海举办了一场盛大的发布会。

在开场演讲中,东方算芯创始人魏少军博士首先指出,算力是智能时代的核心引擎,但受国际环境影响,我国整个产业在高端算力芯片、核心架构、先进制程甚至底层生态方面都在面临着前所未有的制约与调整。为此,魏少军博士认为,我们必须要走出一条属于自己的路,打造架构自主、技术原创、生态自理和供应链安全可控的生态。

正是基于这种思考,上海东方算芯科技有限公司于2024年5月在上海浦东成立。依托自主原创的软件定义芯片、近存计算两大核心技术以及全国产化供应链体系,东方算芯旨在研发打造高性能、高能效、高灵活性的大算力芯片产品,搭建自主可控的生态系统。

在发布会上,东方算芯也揭开了公司首颗芯片DF1000的神秘面纱。

打开网易新闻 查看精彩图片

作为一颗依托全国产供应链打造的软件定义近存计算3D AI芯片,DF1000是聚焦架构层面的创新优化,在国产成熟工艺条件下实现了高性能算力输出。而基于3D混合键合技术实现晶圆级堆叠,东方算芯有效提升了芯片的访存带宽,降低供应链依赖。除此以外,DF1000系列还遵循 OAM 2.0规范,提供标准化接口可无缝适配国内各大主流 OEM厂商的AI服务器平台,支持大模型训练、推理等应用场景。

得益于这种领先设计,基于该芯片打造的单卡在BF16的精度下算力高达520 TFLOPS,能提供6.4TB/S的超高显存带宽,其Scale-up互联带宽也高达900 GB/s。这样一颗芯片,再配套自主编程框架与软件生态,具备计算效率高、通用性强、访存带宽大、能效表现优的特点,为AI产业提供稳定的国产算力底座。

之所以能在全国产供应链上获得如此优秀的性能表现,如上所述,“软件定义+3D堆叠近存计算”的设计功不可没。“这种设计让芯片在实现高速度、低功耗的同时依然保持很强的可变动性能,满足应用灵活多样的需求”,魏少军博士说。从他的介绍我们得知,这次技术和产品的发布,是东方算芯核心团队自2006年从清华大学起步以来,历经二十年厚积薄发的成果。

首先看“软件定义架构”方面。据介绍,该方案拥有粗粒度块状架构、分布式集合通信极致以及计算单元数据通路复用三个特征。

具体而言,东方算芯团队也已经构建了从硬件到软件的全栈可重构计算体系,动态重构多精度融合计算阵列,能够根据模型特性自动选择最优数据通路;以 TensorTile 为基本调度单元,构建全异步、无阻塞的数据流执行引擎,实现极致计算资源利用率。“通过任务处理的空间并行和硬件资源的时分复用,显著提升硬件资源利用率,从而降低对芯片制造工艺的要求。”东方算芯方面强调。

打开网易新闻 查看精彩图片

至于“近存计算技术”,按照东方算芯所说,这为我国提供了规避HBM存储器供应风险、不依赖海外先进制造工艺的选择。

众所周知,过去几年,全球主要的AI芯片都是包含HBM。但要实现这些设计,不但需要拥有HBM,还需要CoWoS产能。过去两年,这两种技术的价格和产能,让不少芯片厂商头疼。对于国内厂商而言,因为国际竞争关系,还需要考虑供应问题。

在这种环境下,东方算芯的“近存计算”成为了本土AI供应链破局的一个选择。

据介绍,通过采用业界领先的混合键合封装技术,东方算芯在研芯片上实现了逻辑层与DRAM层的无凸点垂直互连。相比传统2.5D HBM方案(依赖硅中介层和微凸点),这种设计能将互连间距从数十微米压缩至亚微米级别,带来数量级提升的互连密度与带宽密度。从数据上看,如上所述,这样的设计能带来6.4 TB/s的访存带宽以及高达900 GB/s的Scale-up互联带宽,性能数倍于传统HBM方案。

打开网易新闻 查看精彩图片

除了上述两项技术外,东方算芯还推出了一个被称为Infinity Chiplet 3.5D+的扩展架构,旨在实现更强算力、更大规模,并突破通信墙。

打开网易新闻 查看精彩图片

如下图所示,据东方算芯方面介绍,东方算芯基于国产成熟工艺芯片的有效算力性能在与国际4nm芯片时不落下风。

打开网易新闻 查看精彩图片

在发布会现场,东方算芯还披露了涵盖基础软件与应用软件、高性能服务器和大规模集群系统在内的解决方案。

软件方面,如魏少军博士所说,算力产业的竞争最终是体系与生态的竞争。为此,在过去两年,东方算芯同步打造了自主可控的底层软件栈,覆盖编译器、算子库、集合通讯部分布式训练框架及一站式攻作链,全面兼容主流深度学习框架。为用户提供简洁高效的迁移与部署方案。

打开网易新闻 查看精彩图片

硬件方面,东方算芯还随着芯片推出了通用模组产品、一体机和超节点等产品。

其中,巅峯 DF1000通用模组产品算力为4.16 PFLOPS@BF16的算力,Scale-up带宽为7200GB/s,Scale-out带宽为3.2Tbps,访存带宽51.2TB/S,CPU为120核,整机功耗12KW;擎元 QY100一体机算力为4.16 PFLOPS@BF16的算力,Scale-up带宽为7200GB/s,Scale-out带宽为3.2Tbps,访存带宽51.2TB/S,CPU为120核,整机功耗12.5KW;拓域 TY64 超节点产品,其算力为33.28 PFLOPS@BF16,Scale-up带宽为57.6TB/s,Scale-out带宽为25.6Tbps,访存带宽409.6 TB/s,CPU为960核,整机功耗120KW。

在发布这些产品之余,东方算芯还披露了公司未来几年的产品路线图:

打开网易新闻 查看精彩图片

综上所述,基于“软件定义+3D堆叠近存计算”和全国产化的供应链体系,东方算芯为国产算力绕开对国际最先进制造工艺和HBM存储器的依赖开拓了一条新路径。

用魏少军博士的话来说:“今天,一条中国自主原创的算力芯片新路线正式启航。”