大家都在疯抢 GPU 训练大模型的时候,Meta 却反着来——定制的下一代 AMD 加速卡直接把计算单元削掉一半,显存更是只剩三分之一。这份由半导体研究机构 SemiAnalysis 披露的设计细节,颇有点“不追求跑 AI,够推荐就行”的意味。
标准版 Instinct MI455 的配置相当豪华:8 颗基于台积电 N2 制程的计算芯片,配上 12 个 12-Hi 36GB 的 HBM4 内存堆栈,总显存达到 432GB。而 Meta 拿到的 MI450 架构定制版,只有 4 颗计算芯片,内存也降级为 6 个 8-Hi 24GB 堆栈,合计仅 144GB。简单换算下来,计算单元就是标准的一半,显存则砍到三分之一。
打开网易新闻 查看精彩图片
SemiAnalysis 指出,这种“刀法”并非为了省钱,而是 Meta 在机架级系统上的一次精准取舍。提升 CPU 与 GPU 的算力比例、改善内存带宽的效费比,能让这批定制卡在 RecSys 推荐系统上跑得更划算。把宝贵的晶体管留给推荐模型推理,而不是花在通用训练上,恰好贴合 Meta 每天处理海量推荐请求的需求。
不过代价也很直白:这玩意儿并不适合大模型训练或推理。对那些指望靠定制芯加速 Llama 系列模型的人来说,恐怕得另等一张卡了。正在 LLM 这条路上狂奔的厂商和 Meta 这座“广告推荐帝国”,GPU 的剧本根本就不一样。
热门跟贴