周末轻松点,聊个老本行问题——大模型本地部署
自从 Qwen3.5 开始收窄开源模型后,我都很少关注了,现在 Qwen3.8 预览版都出了,我还在玩3.6,毕竟手里只有几张4090
刚好有朋友问,今天就聊聊 GLM5.2 本地部署要花多少钱?
先说结论:
FP8 版本,最低大约需要一台 8 卡 H200, 350 万元左右
BF16 版本,最低需要两台 8 卡 H200,算上网络, 大约 730 万—800 万元
FP8 稳定支持完整 1M 上下文,使用 H200 的话,按双节点准备, 大约 730 万—800 万元
BF16、1M 上下文再加上一定并发,预算很容易来到 1000 万元以上
GLM-5.2 虽然开源了,但真正想把原版模型私有化部署,350 万元只是入场券
PS:FP8以下精度不在本文讨论之列,比如
模型尺寸
GLM-5.2 是一个 MoE 模型,总参数约 743B,每生成一个 Token 实际激活约 39B 参数,并原生支持 1,048,576 Token,也就是我们常说的 1M 上下文
很多人看到“只激活 39B”,可能会觉得它的部署成本应该和四五十亿参数模型差不多
其实不是
MoE 的优势主要是降低每次推理的计算量,但模型的全部专家参数仍然需要放进显存。你不能因为这一次只调用了其中几个专家,就把其他专家从硬盘里临时加载进来
智谱官方版本有俩
FP8 模型权重文件 756 GB
本地部署时占用显存的不只是模型权重,还包括:
CUDA 和推理框架运行空间
激活值和计算缓冲区
MTP 推测解码相关开销
KV Cache
并发请求预留空间
所以,不能简单用“743B × 每参数一个字节”来决定需要多少显卡
vLLM 给出的部署预算更加直观:
模型精度
vLLM 建议的最低显存
GLM-5.2 FP8
893GB
GLM-5.2 BF16
1786GB
这里按照我了解到的一个相对现实的采购口径计算:
一台完整的 8×H200 SXM 服务器,去年初还能控到300万一下,今年内存、硬盘大涨价,估计 350 万元都打不住了
以 NVIDIA DGX H200 的完整配置作为参考,大致包括:
8×NVIDIA H200 SXM
每张显卡 141GB HBM3e
总显存 1128GB
GPU 显存带宽 4.8TB/s
通过 NVSwitch 连接,GPU 间带宽最高 900GB/s
双路 Intel Xeon 8480C
2TB 系统内存
2×1.92TB 系统盘
8×3.84TB NVMe 数据盘
8 张最高 400Gbps 的 ConnectX-7 集群网卡
整机最大功耗约 10.2kW
不同国产 OEM 厂商的 CPU、内存、硬盘和网卡配置会有差异
unsetunsetFP8 单节点unsetunset
vLLM 官方也把 FP8 称为实际部署时的默认推荐方案,最低显存需求是 893GB,而一台 8 卡 H200 有 1128GB,因此可以在单节点内完整加载,这也是最便宜、最容易落地的方案
单节点最大的优势不是只省了一台机器,而是所有 GPU 都通过 NVSwitch 通信,不需要经过服务器之间的网络。部署和排障都会简单很多,推理延迟也更稳定
但这里要注意:能够加载模型,不等于能够舒服地开启完整 1M 上下文。
vLLM 示例中,单节点 H200 的保守配置通常从 128K 上下文开始。200K 甚至更高也可以继续压测,但上下文越长,KV Cache 占用越大,可支持的并发请求就越少
所以,350 万元也近视可以部署完整的 GLM-5.2 FP8,适合以 128K 左右上下文起步,无法支持高并发的 1M 上下文服务。
unsetunsetFP8 加完整 1M 上下文unsetunset
GLM-5.2 最大的升级之一,就是原生支持 1M 上下文
随着上下文从 200K 增加到 1M,推理瓶颈会逐渐从计算转向 KV Cache 容量、长上下文内核以及 CPU 侧调度
vLLM 明确写出的单节点完整 1M 配置,是 8×B200 + 使用 FP8 KV Cache
如果硬件限定为 H200,又希望比较稳妥地支持 1M 上下文,要按照两台服务器设计,这里还需要200G起步的RAMA交换机、光模块,线缆:
项目
预算
两台 8×H200 服务器
约 700 万元
高速网络及线缆
约 30 万—100 万元
合计
约 730 万—800 万元
而且这机器功耗也是离谱,要配高密机柜,还可能要PDU和供电改造,不过这都是小钱了
BF16 版不赘述了,几乎都是上面 FP8 的双倍
后面更奢侈的方案也不说了,再往上追求并发、高可用和生产级稳定性,这就不再是一台服务器采购,而是一个千万元级别的 AI 基础设施项目了
最后,大家好奇到底什么公司一定要本地部署这些大模型?
据我了解,受监管的金融行业普遍如此,银行、证券,保险,他们本身也都财力雄厚,数据也比较敏感,调用云端大模型是不可能滴
它们购买的是数据不离开自己的边界,是模型能力不依赖外部平台,是服务可以持续运行,也是未来把AI接入全部核心业务的控制权