本周的Hot Chips研讨会上,英特尔进一步披露了Crescent Island AI加速器的架构细节。这款芯片基于Xe3P架构打造,与英伟达Rubin、AMD MI455X GPU走的是不同路线——后两者是面向AI训练和推理的高功耗液冷芯片,配备大规模HBM4内存,追求极致性能;而Crescent Island瞄准的是低功耗、推理优先的细分市场。
350瓦风冷PCIe卡,可部署在传统服务器
从基本规格看,Crescent Island是一张350W的风冷PCIe加速卡,最高可使用480GB LPDDR5X内存。这意味着它不需要特殊的供电和散热条件,可以直接装进传统服务器。英特尔此前已经透露过部分信息,但这次在Hot Chips上把芯片的架构细节讲得更深。
整颗芯片由四个Xe3P切片组成,每个切片包含八个Xe Core,总计32个Xe Core。每个Xe Core内部有八个Xe矢量引擎和八个XMX矩阵加速器,因此全芯片共有256个矢量引擎和256个XMX矩阵加速器。
缓存层级扩容,为更大矩阵加速器服务
Xe3P在缓存设计上做了明显调整。与Battlemage相比,Xe3P Xe Core的通用寄存器文件空间翻了一倍:每个Xe Core现在拥有1MB通用寄存器文件空间,而Battlemage和Xe2是512KB。同时,Xe3P每个Xe Core提供512KB的L1缓存或共享本地内存,这一结构在Battlemage上是256KB起步,在Panther Lake的Xe3 GPU上大约增长了1.33倍。芯片还配备了32MB共享L2缓存。
这些扩大的缓存,是为了支撑芯片上更大的矩阵加速器,服务于以AI计算为核心的任务。Xe3P的XMX引擎在脉动阵列深度上比过去的Xe GPU设计更大:Xe3P的XMX脉动引擎是16深度设计,而Xe2和Xe3是4深度设计。这意味着在通用矩阵乘法运算中,Xe3P理论上可以一次处理更大的矩阵块。英伟达从不以这种详细程度公开其Tensor Core架构,但作为一款AI推理优先的芯片,Xe3P在矩阵乘法中同时处理更多元素的能力,对Crescent Island的推理目标来说是一项重要提升。
数据类型覆盖广,兼顾高性能计算
英特尔还在数据类型上做了较广的覆盖:从支持微缩格式的FP4(即MXFP4),一直到它所说的全速率双精度——每个Xe Core配备64个FP64 FMA单元。FP64在AI工作负载中并不常用,但英特尔表示,加入全速率FP64处理能力后,Crescent Island可以作为一款融合高性能计算与AI的芯片使用。此外,每个Xe Core还支持sigmoid和tanh超越函数。
热门跟贴