周末轻松点,聊个老本行问题——大模型本地部署

自从 Qwen3.5 开始收窄开源模型后,我都很少关注了,现在 Qwen3.8 预览版都出了,我还在玩3.6,毕竟手里只有几张4090

刚好有朋友问,今天就聊聊 GLM5.2 本地部署要花多少钱?

先说结论:

  • FP8 版本,最低大约需要一台 8 卡 H200, 350 万元左右

  • BF16 版本,最低需要两台 8 卡 H200,算上网络, 大约 730 万—800 万元

  • FP8 稳定支持完整 1M 上下文,使用 H200 的话,按双节点准备, 大约 730 万—800 万元

  • BF16、1M 上下文再加上一定并发,预算很容易来到 1000 万元以上

GLM-5.2 虽然开源了,但真正想把原版模型私有化部署,350 万元只是入场券

PS:FP8以下精度不在本文讨论之列,比如

模型尺寸

GLM-5.2 是一个 MoE 模型,总参数约 743B,每生成一个 Token 实际激活约 39B 参数,并原生支持 1,048,576 Token,也就是我们常说的 1M 上下文

很多人看到“只激活 39B”,可能会觉得它的部署成本应该和四五十亿参数模型差不多

其实不是

MoE 的优势主要是降低每次推理的计算量,但模型的全部专家参数仍然需要放进显存。你不能因为这一次只调用了其中几个专家,就把其他专家从硬盘里临时加载进来

智谱官方版本有俩

FP8 模型权重文件 756 GB

B F16 模型权重文件1.51TB
打开网易新闻 查看精彩图片
B F16 模型权重文件1.51TB
打开网易新闻 查看精彩图片

本地部署时占用显存的不只是模型权重,还包括:

  • CUDA 和推理框架运行空间

  • 激活值和计算缓冲区

  • MTP 推测解码相关开销

  • KV Cache

  • 并发请求预留空间

所以,不能简单用“743B × 每参数一个字节”来决定需要多少显卡

vLLM 给出的部署预算更加直观:

模型精度

vLLM 建议的最低显存

GLM-5.2 FP8

893GB

GLM-5.2 BF16

1786GB

 unsetunset一台 H200 服务器多少钱?unsetunset
打开网易新闻 查看精彩图片
unsetunset一台 H200 服务器多少钱?unsetunset

这里按照我了解到的一个相对现实的采购口径计算:

一台完整的 8×H200 SXM 服务器,去年初还能控到300万一下,今年内存、硬盘大涨价,估计 350 万元都打不住了

以 NVIDIA DGX H200 的完整配置作为参考,大致包括:

  • 8×NVIDIA H200 SXM

  • 每张显卡 141GB HBM3e

  • 总显存 1128GB

  • GPU 显存带宽 4.8TB/s

  • 通过 NVSwitch 连接,GPU 间带宽最高 900GB/s

  • 双路 Intel Xeon 8480C

  • 2TB 系统内存

  • 2×1.92TB 系统盘

  • 8×3.84TB NVMe 数据盘

  • 8 张最高 400Gbps 的 ConnectX-7 集群网卡

  • 整机最大功耗约 10.2kW

不同国产 OEM 厂商的 CPU、内存、硬盘和网卡配置会有差异

unsetunsetFP8 单节点unsetunset

vLLM 官方也把 FP8 称为实际部署时的默认推荐方案,最低显存需求是 893GB,而一台 8 卡 H200 有 1128GB,因此可以在单节点内完整加载,这也是最便宜、最容易落地的方案

单节点最大的优势不是只省了一台机器,而是所有 GPU 都通过 NVSwitch 通信,不需要经过服务器之间的网络。部署和排障都会简单很多,推理延迟也更稳定

但这里要注意:能够加载模型,不等于能够舒服地开启完整 1M 上下文。

vLLM 示例中,单节点 H200 的保守配置通常从 128K 上下文开始。200K 甚至更高也可以继续压测,但上下文越长,KV Cache 占用越大,可支持的并发请求就越少

所以,350 万元也近视可以部署完整的 GLM-5.2 FP8,适合以 128K 左右上下文起步,无法支持高并发的 1M 上下文服务。

unsetunsetFP8 加完整 1M 上下文unsetunset

GLM-5.2 最大的升级之一,就是原生支持 1M 上下文

随着上下文从 200K 增加到 1M,推理瓶颈会逐渐从计算转向 KV Cache 容量、长上下文内核以及 CPU 侧调度

vLLM 明确写出的单节点完整 1M 配置,是 8×B200 + 使用 FP8 KV Cache

如果硬件限定为 H200,又希望比较稳妥地支持 1M 上下文,要按照两台服务器设计,这里还需要200G起步的RAMA交换机、光模块,线缆:

项目

预算

两台 8×H200 服务器

约 700 万元

高速网络及线缆

约 30 万—100 万元

合计

约 730 万—800 万元

而且这机器功耗也是离谱,要配高密机柜,还可能要PDU和供电改造,不过这都是小钱了

BF16 版不赘述了,几乎都是上面 FP8 的双倍

后面更奢侈的方案也不说了,再往上追求并发、高可用和生产级稳定性,这就不再是一台服务器采购,而是一个千万元级别的 AI 基础设施项目了

最后,大家好奇到底什么公司一定要本地部署这些大模型?

据我了解,受监管的金融行业普遍如此,银行、证券,保险,他们本身也都财力雄厚,数据也比较敏感,调用云端大模型是不可能滴

它们购买的是数据不离开自己的边界,是模型能力不依赖外部平台,是服务可以持续运行,也是未来把AI接入全部核心业务的控制权