品玩7月28日讯,AMD近日宣布推出Instella-MoE,一款拥有160亿总参数、每token激活28亿参数的混合专家(MoE)开源语言模型。该模型完全基于AMD Instinct™ MI300X和MI325X GPU及ROCm™软件栈从零训练,并采用了Gated MLA和FarSkip-Collective等创新架构,显著提升了训练与推理效率。
AMD表示,将开源Instella-MoE的全部训练流程产物,包括各阶段模型权重、配置、数据混合及代码,以推动开源AI社区发展。该模型在多个基准测试中表现优异,其最终版本Instella-MoE-16B-A3B-Think在所有完全开源模型中平均得分最高,尤其在指令遵循能力上提升显著。
此举标志着AMD在构建端到端、全栈式开源AI模型开发能力上取得重要进展,展示了其硬件与软件在大规模MoE模型训练上的可扩展性与高效性。
打开网易新闻 查看精彩图片
热门跟贴