模型基座没换,能力却上了一个台阶。智谱这次交出的GLM-5.3,走的是一条不太一样的路。

据36氪消息,智谱正式发布GLM-5.3。与上一代GLM-5.2相比,基座模型保持不变,但通过极致的后训练Scaling(规模化扩展),模型的智能上界被显著抬高。换句话说,这次提升不靠“换底子”,而是靠“把底子榨到更狠”。

打开网易新闻 查看精彩图片

编程能力提升50%,开源第一

打开网易新闻 查看精彩图片

这次升级最亮眼的落点在编程能力上。智谱方面称,GLM-5.3是目前编程能力最强的开源模型。

具体数据上,在内部自建体感评测中,GLM-5.3较GLM-5.2提升50%。在公开基准测试中,Terminal Bench 3.0、Agents' Last Exam(CLI)两项评测均拿下开源第一。

“换壳”还是“质变”?数据说话

有人可能会质疑:基座没变,算不算挤牙膏?从结果看,后训练阶段的投入换来了实打实的基准成绩。50%的体感评测提升,以及两项公开榜单的榜首位置,说明这轮优化并非微调级别的小修小补。

打开网易新闻 查看精彩图片

值得注意的是,开源模型的竞争早已从“参数竞赛”进入“工程优化”阶段。谁的训练技巧更极致,谁就能在同样底座上跑出更高上限。GLM-5.3的选择,恰恰印证了这一趋势。

开源社区的“平权”信号

对开发者而言,GLM-5.3的意义在于:不需要等待下一代基座,就能用上更强的编程能力。在终端操作、命令行交互等真实场景中,开源模型的实用价值正在被快速拉高。

智谱用一次“不大改底座”的发布证明,模型智能的边界,远不止取决于参数规模。后训练能做到什么程度,同样决定天花板的高度。