昨天智谱放出了GLM-5.3-Flash,我盯着价格表看了三遍——每百万Token输入0.8元、输出2.8元,缓存命中只要0.23元。说实话,这个数字比模型参数更让我愣住。我花了一晚上把它塞进我现在的日常工作流跑了几轮,今天不吹不黑,把账和体感都摊开说。

一、为什么突然想测它

起因很简单:我每个月AI工具的账单一直在涨。主力编程模型按美元计费,一个稍微大点的重构任务跑下来,几美元就没了。之前那个神秘的"牛来"模型在榜单上挂了几天,大家猜来猜去,8月26日谜底揭晓——智谱正式发布GLM-5.3-Flash,权重也开源了。

我一看架构就来了兴趣:总参数320B,激活只有18B。说白了就是"脑子很大,但每次只动一小块",这种设计天然就是奔着低成本高吞吐去的。财联社还提到它是用10万张国产算力卡训练的——这个先按下不表,咱们只看开发者视角。

二、先算账:这个价格到底便宜多少

我做了张对比表,数据都来自各家官方定价页:

模型

输入(每百万Token)

输出(每百万Token)

GLM-5.3-Flash

¥0.8(限时五折约¥0.4)

¥2.8

GLM-5.3(本体)

约10倍于Flash

约10倍于Flash

Claude Opus 4.8

约¥36($5)

约¥180($25)

折算下来,活动期间的实际调用成本大约是Claude Opus 4.8的四十分之一。好家伙,四十分之一什么概念——以前一天的模型开销,现在够用一个多月。

按我自己的月用量粗算(大概每月输入2000万、输出400万Token),理论上能从几百块的量级压到几十块。当然这是纯按价目表推演,实际还得看效果,效果不行再便宜也是白花钱。

三、实际跑了几个任务

我把手头一个真实的活丢给它:一个Python脚本的优化加一个TypeScript模块的重构。

你输入:这个脚本里有个O(n²)的循环,帮我找出瓶颈并重构成线性复杂度 AI回复:定位到了双重循环的哈希查找,给出了用字典预建索引的重构方案,附带复杂度说明和边界情况提醒。

体感上,常规的代码理解和改写任务没有掉链子,输出结构也比较干净,不需要反复追问。官方基准里它超过了自家上一代的GLM-5.2(DeepSWE实测63.4对46.2),我的几个场景里没感觉到明显短板。

但我也踩了个坑:第一次调用没注意上下文长度,把整个项目目录的日志全喂进去,直接超限报错。翻了文档才知道要先做内容裁剪。这怪我自己手快,但提醒你们别学我。

四、什么情况下它不是好选择

说实话,有两类活我现在还不敢全交给它:一是超长链路的自主编程任务,那种要连续跑十几个小时的agent活儿,我还会用更稳的旗舰模型兜底;二是对输出质量容错极低的场景,便宜模型的"抽查率"你得提高。

另外限价五折是有期限的,长期成本要按原价算,别被活动价锚定了预期。

五、我的判断

我的结论很直接:日常80%的编码辅助任务,GLM-5.3-Flash的价格性能比已经够用了,值得切换。剩下20%的高难度任务,留着旗舰模型当保险。

三类人的具体建议:

  • 个人开发者和副业党:直接切,省下来的都是净利润
  • 小团队:主力任务用Flash,关键路径双跑(Flash出初稿+旗舰复核),综合成本能砍一大截
  • 重度agent用户:先小流量灰度,观察长任务的稳定性再说

说到底,模型价格打到这个份上,"用不用AI"已经不再是问题,"怎么组合着用"才是。别纠结了,先用起来,反正这个试错成本也就几块钱。

你们会为了四十分之一的价格换模型吗?还是觉得便宜没好货?评论区聊聊。