谷歌在 2016 年公开 TPU 时,外界对它的理解还很简单,这是一颗为了深度学习而生的专用芯片。彼时,AI 的主战场仍是训练,GPU 凭借通用性和成熟生态占据绝对优势。
十年后,大模型进入推理密集期,智能体反复调用模型,长上下文带来更重的输入负载,算力的衡量方式也更关注单位token的性价比。
这一变化正传导到国内市场。国产大模型快速迭代,DeepSeek、Qwen、GLM 等模型持续更新,国产芯片厂商也在寻找更具体的落点,芯片能否适配模型,集群能否稳定运行,调用成本能否被客户接受。
在 WAIC 期间,中昊芯英发布第二代自研 TPU 芯片“须臾”,并宣布华东地区首个国产 TPU 智算千卡集群在杭州落成。
TPU 又被推到台前,原因是推理成本
大模型训练依然昂贵,但训练是一段相对集中的投入,推理则是一笔持续发生的成本账。
用户每一次与AI的交互,背后都在消耗 Token,智能体的出现进一步放大了这一过程。一项任务可能包含多轮检索、多次调用模型和连续生成,输入 Token 与输出 Token 的比例也可能相差很大。
中昊芯英创始人、CEO 杨龚轶凡提到,当前大模型推理正在走向 PD 分离,所谓 PD 分离,是将模型处理输入内容的 Prefill 阶段,与逐 Token 输出内容的 Decode 阶段拆开调度。前者需要快速处理大量上下文,后者更看重持续输出和低延迟。把两种任务放在同一套资源里运行,容易出现资源闲置或排队,拆开之后,集群可以围绕不同负载进行更细致的配置。
这也是 TPU 再次获得关注的原因。GPU 最初为图形渲染设计,后来凭借强大的并行计算能力成为 AI 训练的核心硬件,TPU 则从一开始就瞄准深度学习中的张量计算,它牺牲了一部分通用性,换取在特定任务中的计算密度和能效表现。谷歌将 TPU 用于自身数据中心和云服务,已经证明专用架构可以在大规模 AI 负载中找到位置。
国内的情况更复杂,GPU 生态长期占据主导,CUDA 工具链和开发习惯构成了很高的迁移门槛。国产 TPU 要进入市场,既要解决芯片本身的性能问题,也要回答开发者如何迁移、模型如何适配、客户如何调用的问题。
须臾是中昊芯英的第二代产品,据悉,这款芯片混合精度浮点算力达到 896TFLOPS,8-bit 推理算力达到 1792TOPS,整体性能约为上一代芯片的三倍,单芯片额定功耗为 600W。
中昊芯英联合创始人、CTO 郑瀚寻将性能提升归因于几项硬件调整:计算流水线重构,双芯粒同基板封装,以及片上存储容量和带宽提升。中昊芯英称,目前已经完成 Qwen、DeepSeek、GLM 等主流开源模型的基础适配,并能在新模型发布后较快跑通流程。
基础适配和商业化效果之间仍有距离,要把模型的吞吐量、延迟和成本调到可用水平,往往需要围绕算子、编译工具和调度策略持续优化,国产 AI 芯片行业常说“从可用到好用”,背后说的正是这段漫长的过程。
千卡集群落地杭州,国产TPU接受检验
此次落成的杭州国产 TPU 千卡集群,由杭州电信、中兴通讯和中昊芯英共同建设,面向大模型训练、推理和科学计算等场景提供算力服务,它也是中国电信体系内首个大规模国产 TPU 集群部署项目。
运营商正在经历角色变化,过去,客户租用的是服务器、存储和带宽;现在,越来越多企业希望直接获得模型调用能力,或按照 Token 购买服务。
杭州电信并没有将 TPU 视为唯一选择,其现有布局中同时包含 GPU 算力池,也在探索其他国产芯片路线。未来的智算中心很可能长期保持异构状态,芯片架构各自承担擅长的任务,运营商负责将底层资源组织成面向用户的服务。
这种模式对集群调度提出了更高要求。杭州电信方面透露,经过数月软硬件调优,TPU 集群的 Token 输出效率较年初提升超过 10 倍。这个数据是系统优化的结果,模型版本、算子实现、服务器配置、网络带宽和调度方式,都会影响最终能交付多少有效 Token。
中兴通讯承担网络和系统集成能力,千卡集群向万卡规模扩展时,芯片之间的连接会迅速成为瓶颈。计算能力提升得越快,通信、存储和散热越容易拖住整体效率,这都是智算中心走向规模化后绕不开的问题。
谷歌 TPU 的经验说明,专用芯片的价值往往建立在完整的软硬件体系之上,对于国内厂商而言,芯片研发、量产交付和软件生态仍需同步推进。(本文首发于钛媒体APP,文|TechPulse,作者 | 张帅,编辑 | 盖虹达)
热门跟贴