最近Intel在Hot Chips 2026上展示一张新卡,名字是Crescent Island,代号Xe3p,它不是给游戏玩家用的东西,连“帧率”和“光追”这些词都没提到,主讲人是Intel的两位资深架构师,他们反复强调这张卡专为数据中心AI推理设计,卡的功耗有350W,用风冷散热,插在PCIe接口上,标准版配160GB LPDDR5X显存,ODM客户还能定制到480GB,它支持从FP4到FP64的各种精度,基本覆盖现在主流大模型做推理时的量化需求。
很多人看到160GB显存的第一反应是觉得夸张,但其实是有原因的,现在做大模型推理的时候,光是模型权重就会占去不少显存,再加上KV缓存、长上下文处理以及像Agentic AI这样需要多轮调用工具的场景,显存很容易就被用满了,以前96GB的显卡得依赖分片和多卡协同,通信开销大,延迟也高,这张卡单卡就能装下FP8权重和完整的KV缓存,省去了互联带来的麻烦,Intel没有选择HBM,而是用了LPDDR5X,这种内存密度高、价格便宜、功耗低,只是带宽稍低一些,他们计算过数据:当模型参数从70B增加到1T,翻了7倍,但每生成一个token要读取的数据反而减少了75%,这说明容量比带宽更关键。
卡的内部结构围绕显存做了调整,Xe核心从20个增加到32个,XMX引擎从4级扩展到16级,每个核的寄存器文件有1MB、L1缓存512KB、L2统一缓存32MB,内存控制器专门为长上下文场景优化,能压缩KV缓存,同时运行多个会话也不吃力,还配备了4个解码和4个编码的媒体引擎,处理多模态任务更顺手,企业级可靠性也没落下,ECC、奇偶校验、动态页面下线、PCIe错误报告都支持,毕竟数据中心不能容忍静默错误。
在软件方面,Intel走的是一条开放路线,它明确表示兼容vLLM和SGLang这些主流推理框架,连NVIDIA的Dynamo也支持进来,显然是想打破CUDA的垄断地位,底层采用Triton、SYCL和oneCCL这些开源工具链,目标是让企业不用修改代码就能迁移过去,这点让人有点意外——以前大家总说Intel生态弱,这次却挺干脆,直接把“迁移成本低”当成卖点打出来。
这卡肯定不会进普通用户的电脑,因为它没有上市时间,也没有定价,而且不面向DIY市场,但如果它真的能稳定运行,可能会间接影响消费端,比如那些在本地跑大模型的人,或许以后不用买三四张卡拼着用,单张卡跑100B以上模型说不定就能实现,甚至软件层的压缩技术,也可能因为硬件提供了更大空间而加快成熟。
目前最让人关心的是实际带宽数据和每瓦能处理多少tokens,这些数字还没公布出来,软件开源方案能不能支撑企业全天候稳定运行,也要看后续测试结果,它和NVIDIA H200、AMD MI325X的竞争重点不在速度比较,而要看谁容量更大、生态更开放,现在只是概念发布阶段,没有现成产品,也缺乏实测数据,大家先别急着做判断。
热门跟贴