今天有个重磅消息,智谱正式发布了 GLM-5.2 模型,同时也开源了。
在全球百万用户参与盲测的前端开发评估系统 Code Arena 上,GLM-5.2 取得目前可用模型第一的成绩。
有一说一,国产模型这次真的站在了世界前列,属于我们普通人能用得上用得起的国产之光了。
这次 GML-5.2 有两个关键信息,我觉得应该重点聊聊。
第一,Coding 继续保持国产第一、开源第一。
在 FrontierSWE、SWE-Marathon、PostTrainBench 等多个长程任务基准上,GLM-5.2 的表现介于 Claude Opus 4.8 与 GPT 5.5 之间,是排名最高的开源模型。
我在网上看到一个 AI 博主说,如果你是通过中转服务使用 Opus,那你可能分不出有可能是 GLM-5.2 冒充的。
第二,1M token 上下文。
注意,不是标称 1M,是真正能用的 1M。
现在市面上标称 1M 的模型不少,但大部分到了长上下文后半段效果衰减得厉害。
GLM-5.2 通过注意力结构层面的创新,把 1M 长度下的效果衰减和推理成本同时压了下来。
说人话,就是它在处理超长任务时不会到后面就开始犯糊涂、忘前面说过什么。
这个能力为什么重要?我换个说法你就明白了。
现在用 AI 写代码最大的痛点不是它写不出来,而是任务一长它就忘了。
你让它改一个大项目,改到第 30 步的时候它忘了第 2 步定下的规则。你不得不反复提醒它、反复把上下文喂回去,累的不是 AI,是你。
说白了,就是「能干活,但记性差」。
因此,1M 上下文解决的就是这个问题。
一个持续工作数小时的 AI 要经历几千次工具调用、读写数万行代码、积累大量中间状态。
如果上下文窗口不够长,模型就被迫不断压缩、丢弃、再回忆,每一次压缩都是信息损耗,每一次遗忘都可能让任务在第 N 步偏离第 2 步的约束。
长程任务的失败,很多时候不是模型不够聪明,而是它忘了。
GLM-5.2 做到的是在一次任务中完整持有整个项目的全部代码、全部决策历史、全部约束条件。
这个过程,就像一个不会忘事的工程师,从头推进到尾。
这里说个案例。
之前我自己用其他模型结合 Claude Code 开发了一个小程序,当时光是 PRD 文档就有 5000 多字,因为单个文件太大,还是拆分上传的。
这次我换成 GLM-5.2 试了下,试图让它重构这个项目,还是同一份 PRD 文档。
开启 CC 的 Plan Mode 模式后,我先让模型自己加载分析需求文档并制定开发计划,然后再进入开发阶段。
过程中,我还加了一些需求,并且对一开始的信息做了修改。此时,GLM-5.2 的 1M 上下文优势就出来了,全程无纰漏。
大概用了 25 分钟左右,这个基于 PRD 的项目就全部开发完了,而且自己调起了本地的微信开发者工具。
我让它统计了代码量,总共 16000 行代码,而且能成功预览。
不过有一说一,我觉得 GLM-5.2 在前端页面的设计美观度上还有提升空间,现在属于可用,但还不是绝对好的状态。
如果是用来做一些大型项目的重构或者开发,这种 1M 上下文空间的体验就会明显好很多。
在 Terminal-Bench 2.1 上,这是一个评测 Agent 通过命令行操作一台计算机的数据集,GLM-5.2仅比Opus 4.8低4%,相比GLM-5.1提升了17.5%。
在 MCP-Atlas 上(工具使用tool-use评测的数据集),GLM-5.2仅比Opus 4.8 低 0.8%。
此外,能做的事情也变了。
整个代码库扔进去做跨文件重构,一句话需求直接出完整全栈项目,大型 SaaS 级工程持续推进不跑偏。
这些场景以前只能拆成无数个小任务反复喂上下文,现在可以一次性给完、一次性干完。
我自己也测了一个场景,就是优化我之前用 Agent 开发的个人网站。
先说下,如果你们想用上 GLM-5.2,就得去抢智谱的 Coding Plan,不过这个现在很紧俏,你们可以每天去盯一盯官方放量的时间。
如果抢到了配额,就可以配置到你的 Agent 里直接开始用,我是用 Claude Code 配合 GLM-5.2 用的。
之前开发这个网站我用了几个模型混合完成,包括 GLM-5.1、Claude Opus 4.6 和 4.8。
从前端开发质量来看,Claude 的模型确实做得更好,但是在代码本身的开发质量上,我觉得 GLM 和 Claude 的差距并没有那么大。
这次优化,我完全用 GLM-5.2 来完成,核心就是优化我之前觉得别扭的几个模块。
第一个问题就是我网站上案例墙这部分,现在的问题就是重点不突出、没有数据、视觉不美观。
我跟 GLM-5.2 提的需求并没有那么明确,只是表达了一句话需求。
但是,它的分析和问题拆解却很精准,而且还发现了代码中存在的命名问题。
讲真,它跟我说话真的是毫不客气。
不仅找准了问题,而且还给出了方案。
不仅按照这个新方案做了重新开发,还对我原有的代码结构做了优化,整个网站的代码都有被它 review。
我有一个很直观的感觉,就是一次性成功率更高,而且模型在需求理解、代码执行、完成质量上做得都不错。
优化后的最终效果,明显比之前好太多。
说实话,结果超出预期。
从实际体感来看,我觉得写出来的代码质量和最终呈现的效果跟之前我用的 Claude 模型差异并不是很大。
还是我之前说的,现在 GLM 系列的模型在国产 coding 领域的确是做得非常好的一家。
说实话,对于我们这些每天重度使用 AI 的人来说,智谱的操作是值得点赞的。
之前大家选模型默认选海外的,Claude、GPT,能力确实强。
但稳定性呢?可用性呢?账号说封就封,模型说停就停,上周 Anthropic 的事就是最好的例子。
现在,国产开源模型的价值正在被重新评估。
不是说它今天在所有维度上都比 Claude 好,而是它稳定、可控、不会哪天突然告诉你「因为政策原因,你不能用了」。
还有一点,现在国产 AI 都在不同程度上被限卡,如果这个环节能突破,我觉得不会比国外差。
GLM-5.2 这次的做法也值得一说,Coding Plan 全量用户直接可用,包括免费的 Lite 版。
这种发布方式本身就是一种态度,不搞花活,你自己试,数据说话。
最后,说下我自己的判断。
过去一年,行业衡量模型的标准正在迁移。以前比的是谁完成任务更好,谁的 benchmark 分高谁就牛。
现在比的是「能独立干多久」,谁能持续工作、不跑偏、不忘事,谁才是真正能用的生产力工具。
上下文长度的可用性和长程任务能力,正在成为下一阶段模型竞争的主线。
技术要真正普及成生产力,就一定是开放的。
所有的不开放和限制,本身其实就是对生产力进步的一种束缚。
智谱在他们官宣内容的最后提到两句英文:
A step closer to frontier intelligence for everyone.
The future of AI is open, and it is for the people.
翻译过来就是:
向前沿智能再近一步,为每一个人。
AI的未来是开放的,它属于所有人。
国产模型走到这一步,值得被看见。
················· 唐韧出品 ·················
用AI思维发现下一个机会
安可时刻
如果国产模型能解决被限卡的瓶颈,那速度和质量又会上去一个台阶。
其实对于大多数任务来说,现在国产模型已经表现不错了。从我的日常 coding 场景来看,GLM-5.2 基本也能满足大多数需求。
国外模型是很强,但我们也要给国产模型一些时间让他们成长。
热门跟贴