100 tok/s!GLM-5.3在GB200上跑出生产级推理
全栈遛狗员
·北京
每秒100个token,这是GLM-5.3在英伟达GB200上跑出的推理速度。Prime Inference把这套成绩称为"生产级",并公开了达成路径——六项工程优化。
六项优化拆开看
打开网易新闻 查看精彩图片
这六项优化分别是:PD分离、DEP8拓扑、NVFP4压缩、BLHNC布局,以及另外两项未在摘要中展开的工程手段。它们共同支撑起100 tok/s这个数字。
- PD分离:把推理流程中的不同阶段拆开处理
- DEP8拓扑:一种针对硬件的连接结构设计
- NVFP4压缩:用更低精度压缩数据以换取速度
- BLHNC布局:数据在内存中的排布方式优化
为什么值得关注
开源大模型的推理性能一直是落地瓶颈。GLM-5.3这次在GB200上跑到100 tok/s,意味着开源模型在生产环境中的响应速度又上了一个台阶。
Prime Inference的这份分析,把工程细节摆到了台面上。对于关注推理部署的团队来说,这六项优化提供了可参考的路径。
热门跟贴