为什么传统GPU越跑越吃力类脑芯片给GPU涡轮增压这条路线到底值不值得跟
9月13日,在2026中国算力大会的发布台上,中国移动云公司甩出一套让行业眼前一亮的方案。一套由国产GPU搭配类脑芯片的异构混合推理系统正式发布,号称在DeepSeek V4 Flash场景下,推理性能和能效提升一倍以上,运营成本下降超过40%。不靠先进制程,靠架构创新把成本打下来,这条路线值得细看。
大模型推理进入爆发期,并发服务对吞吐量和能耗成本提出极高要求,传统单一GPU架构越来越吃力。一方面,数据频繁搬运会带来内存墙和功耗墙;另一方面,国内先进芯片制程供给受限,单纯靠硬件工艺升级提升算力,空间有限。行业需要跳出只追先进制程的思路,从系统架构层面找新解法。
这套系统由移动云联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学共同研发。思路很直接,把大模型拆开分工。团队对Transformer结构做PD和AF分离,把Prefill预处理与Attention注意力计算交给国产GPU,把FFN前馈网络模块交给类脑芯片。
类脑芯片的存算一体和片上大容量SRAM架构,正好承接对带宽敏感的部分。研发团队同时自研了模型编译器、高速互联协议和统一推理引擎,实现两类算力的任务拆解、协同调度与结果聚合。这套方案对标的是英伟达下一代Vera Rubin with Groq异构推理架构。
实测落在一组具体硬件上:3台天数智芯GPU服务器搭配3台类脑机柜,运行DeepSeek V4 Flash模型。相较同等投入规模的纯GPU集群,推理输出和推理能效均提升1倍以上,业务运营成本下降40%以上。项目累计形成15项授权发明专利、6项软件著作权,覆盖异构调度、类脑芯片架构、编译工具链等环节,目前已进入小批量试产阶段。
方案面向Token工厂、AI代码生成、多智能体协同等场景,也可用于金融、安防、通信等安全敏感行业。它的落点很清楚,在不依赖海外先进制程的前提下,靠系统架构创新把推理成本打下来,为大模型推理国产化提供可复制的技术范式。
对国内算力运营方来说,这套思路最大的价值是打开了另一条路。当工艺红利见顶,架构创新就成了必选项。后续团队计划将核心异构推理框架逐步开放,赋能国内GPU、类脑芯片厂商及算力运营商,带动国产算力产业链整体发展。你怎么看用类脑芯片补位GPU的思路,是务实突围还是过渡方案,欢迎评论区聊聊。
【信源】财联社 | 中国移动云公司发布异构混合推理系统 | 2026-09-13
【信源】搜狐科技 | 中国移动新一代大模型异构混合推理系统亮相2026算力大会 | 2026-09-13
【信源】快科技 | 中国移动云发布异构混合推理系统 | 2026-09-14
热门跟贴