GLM-5.3 已在 Hugging Face 平台正式上线。官方账号同步给出了本地运行这套模型所需的硬件配置,从数据中心级的多卡方案到桌面设备都有覆盖。

本地运行配置一览

打开网易新闻 查看精彩图片

如果使用 FP8 精度,需要 10 到 12 块 H100,或者 8 块 H200。这是面向有充足算力储备的团队或机构的方案。

更轻量的选择是 4-bit 或 NVFP4 量化,模型体积大约在 390 到 430GB。这个规格可以放进一台 512GB 内存的 Mac Studio,或者由 4 台 DGX Spark 组成的环境来承载。

再往下是激进的 2-bit 量化,体积压缩到 230 到 250GB 左右。一台 256GB 内存的 Mac Studio 或 2 台 DGX Spark 就能跑起来,但官方提醒,这种方案会在生成质量和上下文能力上做出妥协。

量化版本已经开始出现

发布消息提到,第一批 GGUF 和 NVFP4 量化版本已经在社区中陆续出现。对于想尽快在本地尝试的用户来说,这意味着不用从原始权重自己动手转换,可以直接找现成的量化文件。

官方账号在发布时还留了一句提醒:4 小时后就可以下载并运行这套 SOTA 级别的本地 AI,前提是你的算力足够。配文里那句“What a time to be alive”带着明显的兴奋感,发布时间显示为 2026 年 8 月 28 日下午 3 点 08 分。

从配置看定位

从给出的硬件门槛来看,GLM-5.3 的本地部署并不是面向所有普通用户的。FP8 方案动辄需要多块 H100 或 H200,这基本把个人玩家挡在门外。真正有现实意义的是 4-bit 和 2-bit 两条路线,它们把门槛拉到了高端 Mac Studio 和 DGX Spark 这类设备上。

512GB 内存的 Mac Studio 并不是常见配置,256GB 版本同样价格不低。DGX Spark 作为英伟达面向开发者的桌面级 AI 设备,单台算力有限,需要多台组合才能承载这个量级的模型。换句话说,GLM-5.3 的“本地运行”更接近“个人工作站或小型团队可负担”,而不是“随便一台电脑就能跑”。

官方对 2-bit 方案的描述相当克制,直接点出了质量和上下文的 tradeoff。这种表述没有回避量化带来的损失,反而让配置表显得更可信。对于追求极致压缩的用户,230 到 250GB 的体积确实把门槛降到了一个新的位置,但能不能接受输出质量的下降,需要用户自己判断。

GGUF 格式的量化文件出现,意味着 llama.cpp 生态可以较快接入。NVFP4 则对应英伟达较新的硬件支持。两条路线同时出现,说明社区对这套模型的关注度不低,发布后短时间内就有人开始动手做转换和分发。

这次发布没有给出模型参数量、上下文长度或基准测试成绩,官方消息只集中在“上线”和“怎么跑”这两件事上。对于已经关注 GLM 系列的用户来说,配置表本身就是最直接的信息:先确认自己手里的设备够不够,再决定要不要下载。