今天有个重磅消息,智谱正式发布了 GLM-5.2 模型,同时也开源了。

在全球百万用户参与盲测的前端开发评估系统 Code Arena 上,GLM-5.2 取得目前可用模型第一的成绩。

打开网易新闻 查看精彩图片

有一说一,国产模型这次真的站在了世界前列,属于我们普通人能用得上用得起的国产之光了。

这次 GML-5.2 有两个关键信息,我觉得应该重点聊聊。

第一,Coding 继续保持国产第一、开源第一。

在 FrontierSWE、SWE-Marathon、PostTrainBench 等多个长程任务基准上,GLM-5.2 的表现介于 Claude Opus 4.8 与 GPT 5.5 之间,是排名最高的开源模型。

打开网易新闻 查看精彩图片

我在网上看到一个 AI 博主说,如果你是通过中转服务使用 Opus,那你可能分不出有可能是 GLM-5.2 冒充的。

第二,1M token 上下文。

注意,不是标称 1M,是真正能用的 1M。

现在市面上标称 1M 的模型不少,但大部分到了长上下文后半段效果衰减得厉害。

GLM-5.2 通过注意力结构层面的创新,把 1M 长度下的效果衰减和推理成本同时压了下来。

说人话,就是它在处理超长任务时不会到后面就开始犯糊涂、忘前面说过什么。

这个能力为什么重要?我换个说法你就明白了。

现在用 AI 写代码最大的痛点不是它写不出来,而是任务一长它就忘了。

你让它改一个大项目,改到第 30 步的时候它忘了第 2 步定下的规则。你不得不反复提醒它、反复把上下文喂回去,累的不是 AI,是你。

说白了,就是「能干活,但记性差」。

因此,1M 上下文解决的就是这个问题。

一个持续工作数小时的 AI 要经历几千次工具调用、读写数万行代码、积累大量中间状态。

如果上下文窗口不够长,模型就被迫不断压缩、丢弃、再回忆,每一次压缩都是信息损耗,每一次遗忘都可能让任务在第 N 步偏离第 2 步的约束。

长程任务的失败,很多时候不是模型不够聪明,而是它忘了。

GLM-5.2 做到的是在一次任务中完整持有整个项目的全部代码、全部决策历史、全部约束条件。

这个过程,就像一个不会忘事的工程师,从头推进到尾。

这里说个案例。

之前我自己用其他模型结合 Claude Code 开发了一个小程序,当时光是 PRD 文档就有 5000 多字,因为单个文件太大,还是拆分上传的。

打开网易新闻 查看精彩图片

这次我换成 GLM-5.2 试了下,试图让它重构这个项目,还是同一份 PRD 文档。

开启 CC 的 Plan Mode 模式后,我先让模型自己加载分析需求文档并制定开发计划,然后再进入开发阶段。

过程中,我还加了一些需求,并且对一开始的信息做了修改。此时,GLM-5.2 的 1M 上下文优势就出来了,全程无纰漏。

打开网易新闻 查看精彩图片

大概用了 25 分钟左右,这个基于 PRD 的项目就全部开发完了,而且自己调起了本地的微信开发者工具。

我让它统计了代码量,总共 16000 行代码,而且能成功预览。

不过有一说一,我觉得 GLM-5.2 在前端页面的设计美观度上还有提升空间,现在属于可用,但还不是绝对好的状态。

打开网易新闻 查看精彩图片

如果是用来做一些大型项目的重构或者开发,这种 1M 上下文空间的体验就会明显好很多。

在 Terminal-Bench 2.1 上,这是一个评测 Agent 通过命令行操作一台计算机的数据集,GLM-5.2仅比Opus 4.8低4%,相比GLM-5.1提升了17.5%。

在 MCP-Atlas 上(工具使用tool-use评测的数据集),GLM-5.2仅比Opus 4.8 低 0.8%。

打开网易新闻 查看精彩图片

此外,能做的事情也变了。

整个代码库扔进去做跨文件重构,一句话需求直接出完整全栈项目,大型 SaaS 级工程持续推进不跑偏。

这些场景以前只能拆成无数个小任务反复喂上下文,现在可以一次性给完、一次性干完。

我自己也测了一个场景,就是优化我之前用 Agent 开发的个人网站。

先说下,如果你们想用上 GLM-5.2,就得去抢智谱的 Coding Plan,不过这个现在很紧俏,你们可以每天去盯一盯官方放量的时间。

如果抢到了配额,就可以配置到你的 Agent 里直接开始用,我是用 Claude Code 配合 GLM-5.2 用的。

之前开发这个网站我用了几个模型混合完成,包括 GLM-5.1、Claude Opus 4.6 和 4.8。

从前端开发质量来看,Claude 的模型确实做得更好,但是在代码本身的开发质量上,我觉得 GLM 和 Claude 的差距并没有那么大。

这次优化,我完全用 GLM-5.2 来完成,核心就是优化我之前觉得别扭的几个模块。

第一个问题就是我网站上案例墙这部分,现在的问题就是重点不突出、没有数据、视觉不美观。

打开网易新闻 查看精彩图片

我跟 GLM-5.2 提的需求并没有那么明确,只是表达了一句话需求。

但是,它的分析和问题拆解却很精准,而且还发现了代码中存在的命名问题。

讲真,它跟我说话真的是毫不客气。

打开网易新闻 查看精彩图片

不仅找准了问题,而且还给出了方案。

打开网易新闻 查看精彩图片

不仅按照这个新方案做了重新开发,还对我原有的代码结构做了优化,整个网站的代码都有被它 review。

我有一个很直观的感觉,就是一次性成功率更高,而且模型在需求理解、代码执行、完成质量上做得都不错。

优化后的最终效果,明显比之前好太多。

打开网易新闻 查看精彩图片

说实话,结果超出预期。

从实际体感来看,我觉得写出来的代码质量和最终呈现的效果跟之前我用的 Claude 模型差异并不是很大。

还是我之前说的,现在 GLM 系列的模型在国产 coding 领域的确是做得非常好的一家。

说实话,对于我们这些每天重度使用 AI 的人来说,智谱的操作是值得点赞的。

之前大家选模型默认选海外的,Claude、GPT,能力确实强。

但稳定性呢?可用性呢?账号说封就封,模型说停就停,上周 Anthropic 的事就是最好的例子。

现在,国产开源模型的价值正在被重新评估。

不是说它今天在所有维度上都比 Claude 好,而是它稳定、可控、不会哪天突然告诉你「因为政策原因,你不能用了」。

还有一点,现在国产 AI 都在不同程度上被限卡,如果这个环节能突破,我觉得不会比国外差。

GLM-5.2 这次的做法也值得一说,Coding Plan 全量用户直接可用,包括免费的 Lite 版。

这种发布方式本身就是一种态度,不搞花活,你自己试,数据说话。

最后,说下我自己的判断。

过去一年,行业衡量模型的标准正在迁移。以前比的是谁完成任务更好,谁的 benchmark 分高谁就牛。

现在比的是「能独立干多久」,谁能持续工作、不跑偏、不忘事,谁才是真正能用的生产力工具。

上下文长度的可用性和长程任务能力,正在成为下一阶段模型竞争的主线。

技术要真正普及成生产力,就一定是开放的。

所有的不开放和限制,本身其实就是对生产力进步的一种束缚。

智谱在他们官宣内容的最后提到两句英文:

A step closer to frontier intelligence for everyone.

The future of AI is open, and it is for the people.

翻译过来就是:

向前沿智能再近一步,为每一个人。

AI的未来是开放的,它属于所有人。

国产模型走到这一步,值得被看见。

················· 唐韧出品 ·················

用AI思维发现下一个机会

安可时刻

如果国产模型能解决被限卡的瓶颈,那速度和质量又会上去一个台阶。

其实对于大多数任务来说,现在国产模型已经表现不错了。从我的日常 coding 场景来看,GLM-5.2 基本也能满足大多数需求。

国外模型是很强,但我们也要给国产模型一些时间让他们成长。