★ 设为星标 | 只讲人话,带你玩转AIGC。

这两天,中国开源大模型圈连续出现两个非常有代表性的模型。

一个是智谱发布的 GLM-5.3,另一个是阿里开源的 Qwen3.8-27B。

有意思的是,这两个模型代表了完全不同的发展路线。

GLM-5.3 关注的是怎么样榨干一个模型,把它能力推向极致。而 Qwen3.8-27B 关注的是一个优秀的模型怎么样让企业甚至个人本地都能部署起来。

一个向上突破能力上限,一个向下突破应用门槛,而这可能正是未来开源 AI 最重要的两个方向。

GLM-5.3:743B 参数,靠后训练挑战更大模型

在 AI 领域一直相信暴力出奇迹,也就是所谓的 Scaling Law。这就导致大模型竞争出现了一个非常明显的趋势:模型越来越大。

从百亿参数,到千亿参数,再到万亿级别。很多模型开始通过扩大参数规模,追求更高的能力上限。

比如不久前发布的 Kimi K3、Qwen 3.8 Max,参数规模已经分别达到约 2.8T 和 2.4T。(这些模型非常优秀,本文这里举例仅为了说明发展路线)

打开网易新闻 查看精彩图片

但 GLM-5.3 让人惊讶的是:它没有继续扩大参数规模,仍然是基于之前那个 743B 参数规模 的模型。

相比 Kimi K3,GLM-5.3 的总参数量只有约四分之一,但最终效果却真的非常惊艳。

智谱官方表示:GLM-5.3 在 9 个核心基准测试中的 8 个排名开源模型第一。

而从公布的数据来看,它已经进入全球顶级模型竞争范围。

Coding + Agent:从写代码,到真正完成任务

GLM-5.3 最大的提升,集中在 Coding 和 Agent 能力上。

比如 Terminal Bench 3.0。这个测试主要衡量 AI 是否能够像真实程序员一样完成复杂开发任务,包括使用终端、运行程序、调试环境以及解决工程问题。

GLM-5.3 达到 28.3 分。相比上一代 GLM-5.2 的 4.6 分,提升超过 6 倍。

打开网易新闻 查看精彩图片

另一个 DeepSWE 测试,则更加接近真实软件工程场景。它要求模型理解大型代码库,并解决实际开发问题。

GLM-5.3 达到 66.9 分,已经接近 Kimi K3 和 Fable 5 的水平。

而在 Agent 能力方面,AutomationBench 主要测试 AI 能否自主完成复杂工作流

简单来说,就是看模型能不能:理解目标、制定计划、调用工具、连续执行多个步骤,最终把任务完成。

GLM-5.3 在这个测试中达到 48.2 分,排名开源模型第一,超过 Kimi K3、Fable 5 和 GPT-5.6 Sol。

这说明 GLM-5.3 的提升并不只是“更会写代码”,它正在向真正能够执行复杂任务的 AI Agent 靠近。

网络安全:过去 Claude 的优势领域,也开始被国产模型挑战

除了 Coding 和 Agent,GLM-5.3 这次还有一个非常值得关注的方向:网络安全能力。

因为网络安全其实是检验 Coding Agent 上限的一个非常好的场景。

模型需要阅读大量代码,理解程序逻辑,发现潜在漏洞,并完成验证甚至利用。

简单来说:不是让 AI 写一段代码,而是让 AI 像安全工程师一样分析整个系统。

在 CyberGym 测试中,GLM-5.3 达到 84.5 分

这个成绩超过上一代 GLM-5.2 的 77.2,也略高于 GPT-5.6 Sol 的 83.6 和 Mythos 5 的 83.8。

打开网易新闻 查看精彩图片

而在更复杂的 ExploitBench 中,模型需要进一步理解漏洞成因,并完成漏洞利用。

GLM-5.3 达到 54.4 分,相比 GLM-5.2 的 24.4 提升超过一倍。

当然,它距离 Mythos 5、GPT-5.6 Sol 这样的顶级安全模型仍有差距。

但这个变化非常重要:之前 Claude 系列模型一直把 Coding、安全分析和复杂任务处理能力作为自己的优势领域,而现在国产模型正在这些方向快速追赶。

更有意思的是,智谱并没有只停留在 Benchmark。

随着 GLM-5.3 发布,智谱同步推出“开源的盾”计划,让模型直接参与开源项目安全审计。

目前 GLM-5.3 已经发现并收录 2436 个漏洞,覆盖 269 个开源项目,其中包括 1097 个严重和高危漏洞

现在优秀的 Coding Agent,不只是帮人写代码,甚至开始参与整个软件生命周期。

为什么不扩参数,也能获得这么大提升?

GLM-5.3 最大的意义,其实不只是性能。

而是它再次证明:大模型能力提升,并不只有扩大参数规模这一条路。

过去,DeepSeek 的出现,让整个行业重新认识到了强化学习(RL)和后训练的重要价值。

大家发现,一个模型的最终能力,不仅取决于它“看过多少数据”,也取决于它能不能通过后训练学会更好的推理方式、任务规划能力以及工具使用能力。

但随着竞争继续深入,行业也逐渐发现:后训练并不是参数规模的替代品。想要继续突破能力上限,依然需要更强的基础模型作为支撑。

所以现在大模型的发展,其实正在走向两条路线的结合:一方面继续扩大模型规模,提升基础能力上限;另一方面不断强化后训练,让模型真正具备解决复杂任务的能力。

Kimi K3、Qwen 3.8 Max 选择的就是“双路线”:一方面将模型规模扩大到约 2.8T 参数,另一方面继续强化 Coding、Agent 等方向的后训练能力。

而 GLM-5.3 则让我们看到:在没有继续扩大参数规模的情况下,通过后训练优化,依然释放出了巨大的能力提升。

甚至智谱官方在介绍中表示:“可能我们还远未开发出这个基座的智能上界。”

这句话其实非常值得关注。

打开网易新闻 查看精彩图片

因为它意味着,743B 这个规模的模型,可能还有大量潜力没有被释放。也意味着后训练仍然有很多提升空间。

大模型竞争已经不是谁的模型最大就行了,而是谁能找到模型规模、训练方法和实际应用之间的最佳平衡。

Qwen3.8-27B:27B 参数,把旗舰能力带到本地

如果说 GLM-5.3 代表“大模型如何变强”。那么 Qwen3.8-27B 代表的是:大模型如何变小。

它最大的特点:只有 270 亿参数。

在今天动辄几百 B、几个 T 参数的大模型时代,27B 几乎可以算“小模型”。

但它的能力却非常夸张。

官方数据显示,Qwen3.8-27B 在 Coding、Agent、多模态等多个方向,都已经接近甚至超过一些旗舰模型。

比如:Terminal Bench 2.1,用来测试 AI 完成终端开发任务能力。Qwen3.8-27B 达到 73.0

打开网易新闻 查看精彩图片

另外两个编码指标,Agentic Codind 用来测试 AI 自主完成编码任务能力,达到 61.7。而 QwenSWEBench 是测试真实软件工程能力,达到 79.0

这两项都超过了 Opus 4.6 Max,要知道半年前,Opus 4.6 还是编码之神。

而更夸张的是,这个 27B 小模型几乎所有指标都超过上一代 Qwen3.7-Plus。

但真正重要的,不只是 Benchmark。而是它可以真正部署到本地。

AI 正在从云端走向个人设备

这两年,国内的开放模型越来越多、也越来越优秀,但其中最大的一个问题是:虽然开放了权重,但真正能够部署的人并不多。

原因很简单:模型太大。

现在主流开源模型越来越偏向超大规模。几百 B、甚至 T 级参数模型,对于个人开发者和普通企业来说,部署成本非常高。

例如 Kimi K3 这类超大模型,据估算,需要多台高端 GPU 服务器才能运行。(据说需要 8 台 B300,每台市场价 1500 万)

对于普通企业来说,这几乎是不现实的。所以很多企业虽然希望私有化部署、调优,但最终只能选择 API。

这也意味着:数据需要上传云端。代码、客户资料、内部文档,都无法完全掌控。

而这正是 Qwen3.8-27B 这类小模型最大的价值。

它不是单纯证明“小模型也能跑分”,而是在解决一个非常现实的问题:企业如何拥有自己的 AI。

而且“拥有自己的 AI”不只是把模型跑在自己的服务器上。

开放权重意味着企业还可以用自己的业务数据对模型进行微调和后训练,让一个通用模型真正变成懂自己业务、懂自己行业的模型。

对于金融、医疗、制造、法律这些拥有大量专业数据,同时又非常重视数据安全的行业来说,这一点可能比 Benchmark 高几分更重要。

Qwen3.8-27B 是一个稠密模型,相比超大 MoE 模型,它结构更加简单,部署更加容易。

经过量化后:十几 GB 的模型规模,就可以运行。

3090、4090、5090 这类消费级显卡,都有机会运行。

甚至测试显示,单张 RTX 5090 可以达到超过 200 tokens/s 的速度。

这意味着一个小团队,甚至个人开发者,都可能拥有接近旗舰级 AI 能力。

自己的代码库、知识库、企业资料都可以留在本地。

没有隐私风险,没有 Token 焦虑。

甚至可以用自己的数据持续调优,让这个模型越来越适合自己的业务。

这其实是一个非常重要的需求场景,但似乎越来越被市场忽略。

现在很多厂商都在追求旗舰模型,但能够持续推出不同尺寸、特别是小尺寸模型的厂商并不多。

而这恰恰是千问之前长期受到企业用户欢迎的重要原因,因为企业真正需要的,很多时候不是世界上最强的模型。

而是一个足够强、成本可控、可以部署在自己环境里的模型。

从这个角度看:Qwen3.8-27B 可能代表了一条被市场低估的路线。

未来 AI 不一定全部运行在云端,大量企业级 AI 应用,很可能会回到本地。

两条路线,正在重新定义开源 AI

把 GLM-5.3 和 Qwen3.8-27B 放在一起看,非常有意思。

GLM-5.3 代表如何突破模型能力上限,Qwen3.8-27B 代表如何降低 AI 使用门槛。

一个向上挑战 GPT、Claude 这样的旗舰模型,一个向下让更多企业和个人拥有 AI。

过去大模型竞争的关键词是谁更大,而现在已经变成了谁更聪明,谁更容易被使用。

这也是中国开源模型正在探索的两条路线:一边挑战世界最强模型。一边把 AI 带到更多企业、更多个人的设备里。

而这,可能才是开源 AI 真正改变世界的开始。