来源| Tech星球
文| 任雪芸
最近,大模型厂商集体看向了“Flash”。
变化可以从7月份的一个发布日开始追溯,7月21日,Google DeepMind一口气端出三款Flash模型,但旗舰Gemini 3.5 Pro缺席。
彼时,Gemini 3.6 Flash的表现被吐槽不如中国一线开源模型,但国内大模型厂商们却一同捕捉到Flash背后的产业信号,纷纷跟进布局这一效率架构路线。
十天后,国内大模型市场,DeepSeekV4 Flash正式版上线并开源,284B总参数、每次推理只激活13B。DeepSeek还调整了卖模型的方式,涨价的同时,改成了峰谷分时的计费方式。
8月26日到28日这三天,Flash成了主战场。三天至少五款重量级模型落地,但Flash版本占到了多数。
智谱把匿名刷屏“牛来”(Ox-Alpha)认领为 GLM-5.3-Flash,320B总参数,每次只激活 18B;阿里在同一天连夜放出 Qwen3.8-Flash,总参数 125B,每个token只唤醒6B参与计算。9月1日,腾讯发布了其最新一代旗舰模型预览版本Hy4 preview的轻量版模型。
上半年,大模型行业的叙事主线还停留在比拼更多数据、更多参数、更多算力,各家追求的是更大规模参数的模型。
但开源与低价的浪潮正在改写行业逻辑,过去Flash原本只是Google产品线上一个不起眼的档位,定位追求快、便宜、够用,如今新一代Flash已经进化为效率优先的架构版本,行业的比拼重心,也已经从 “谁的参数更大”,转向 “谁成本更低、更具备落地价值”。
Agent需要Flash:效率模型登上产业主舞台
如果只有三分之一的价格,已经能完成大部分日常任务,那你还会默认把所有工作交给最强模型吗?答案当然是否定的。这也是2026年下半年,DeepSeek、智谱、阿里通义扎堆推出Flash等轻量模型的现实动因。
在此之前,市场认知里的Flash,只是旗舰模型的阉割减配版本。
厂商砍掉部分模型能力,换取更快的推理速度与更低调用成本,适合做简单对话,一旦遇到复杂推理、长链路任务,就会出现明显的能力断崖下滑。Flash版本更多是作为旗舰产品的补充,承接边缘流量,很难走到业务舞台中央。
新一代Flash不是简单裁剪参数的减配思路,重点是架构层面的效率革新。依靠MoE稀疏路由机制,模型保留庞大的总参规模与完整知识底座,每一轮推理仅激活一小部分参数参与运算。
真正把Flash推到主流位置的,是AI Agent规模化的兴起。以阿里Qwen3.8Flash为例,模型发布的同时,千问办公Agent产品同步上线,模型与智能体业务的绑定趋势十分直观。
Agent的业务特性带来两层现实约束:一方面,大量工作集中在意图路由、信息抽取、工具调用等任务,并不需要旗舰模型顶尖的深度推理能力,但对推理延迟、并发承载力、调用成本高度敏感。
另一方面,完成一整套Agent业务闭环,往往需要数十次模型循环调用,倘若全部交由旗舰模型处理,成本会随调用轮次成倍膨胀,商业化规模化就无从谈起。
DeepSeek V4Flash、GLM5.3Flash、Qwen3.8Flash这类国产MoE模型,就是瞄准这类场景痛点打造的。即便旗舰模型综合能力上限更高,但高昂的调用开销与更高时延,并不适配Agent高频次、大批量的运行需求。
一夜之间模型都变便宜了,谁才是新的斩杀线?
海外独立评测社区Artificial Analysis曾实测上百款大模型,并据此画出一张性能与价格对比图。DeepSeek-V4-Flash 在这张图里成了一道醒目的“斩杀线”—— 意思是,在它的价格之下,性能比它差、价格还比它贵的模型,都不用看了。
DeepSeek过去半年的用户增长,很大一部分就是踩着这条 “斩杀线”走过来的。它不一定是同一时间段内最好的模型,但价格却足够便宜。
换句话说,现在各家推出的Flash所做的,就是在尽可能接近旗舰效果的前提下,把价格做到最低。
所以“斩杀线”从来不会只属于一家公司。
就在DeepSeek宣布涨价的节点上,低价价格带腾出了空间。随后发布的 GLM-5.3-Flash 与 Qwen3.8-Flash 几乎同一时间把价格压到同一水位,新一轮“斩杀线”之争就此开场。
具体看三家的定价策略:
GLM-5.3-Flash与Qwen3.8-Flash价格几乎持平:输入0.8元、输出约2.7–2.8元/百万tokens,双双站上行业最低档。
智谱更是叠加限时5折(至9月9日),折后输入0.4元、输出1.4元,进一步压低入场门槛。
DeepSeek则坚持峰谷定价:高峰输入3.0元、输出9.0元,空闲时段半价。平均下来约为另外两家的2–3倍,但视觉能力不额外加价,仍保留一张差异化底牌。
标价之下还有第二层。三款都支持上下文缓存,缓存命中的输入价会大幅下探,Qwen低至0.1 元/百万 tokens;对系统提示长、上下文重复度高的场景,实际账单还能再砍一截。而DeepSeek的缓存命中价在闲时只有0.05元,仍是三者最低。
便宜没有换来能力的缩水。各家自测基准几乎不重合,目前最可比的第三方口径仍是Artificial Analysis智能指数:GLM-5.3-Flash拿到57分;DeepSeek V4 Flash50分,也就是说智谱用比 DeepSeek更低的价格,拿到了高出7分的第三方评分,这一次被斩的反而是当初立线的那个。
如今,斩杀线的位置每隔几周就会往下挪一次,而每挪一次,能活下来的模型就少一批。
大模型下半场:卷性能落幕,拼的是算力与数据
上半年的叙事还是更多数据、更多参数、更多算力;到了下半年,DeepSeek、智谱、阿里、腾讯集体转身,把赌注压在“效率”两个字上。当各家Flash的权重几乎全部开源、MoE“大总参、小激活”成为行业共识的基础架构,模型厂之间的区别,正在肉眼可见地变小。
架构不再是秘密,真正难复制的只剩两样:算力规模,和数据管线。
算力这一侧,效率模型表面上是把成本打了下来,背后却有一场更烧钱的军备竞赛。
智谱动用10万张国产芯片集群支撑GLM-5.3-Flash的线上推理;MiniMax称自己是国内最早建成规模化、长期稳定基础设施体系的两家独立大模型公司之一;腾讯则罕见地公开承认“整体算力严重不足”,拖慢了混元迭代。
同一场竞争里,Flash恰恰是算力紧张时代的最优解:320B的GLM-5.3-Flash每次推理只唤醒18B,770B 的Hy4只激活49B,同样的卡能服务更多用户、摊薄更多成本。与其说厂商选择了效率路线,不如说是算力瓶颈让各家不得不去走效率路线。
但算力用钱能买到,数据却不能。
数据这一侧,预训练语料、后训练数据管线、对齐工程,才是各家真正拉开身位的地方。DeepSeek 靠强化学习与蒸馏,把推理能力压进 13B 激活的模型;Qwen在多模态语料配比上押注;智谱在数据与对齐工程上积累。
更被寄予期待的是,数据如何形成飞轮?
各家都在押注Agent,每一次 Agent 调用都是一次真实使用数据的回流,回流进训练,模型更强,便有更多Agent接入。谁先跑通 Agent 的规模化闭环,谁就同时拿到了算力之外最深的护城河。
这也是千问的Flash发布就在千问办公Agent同步上线、模型与业务绑定如此紧密的原因。
在过去卷性能的时代,大家比的是榜单。但卷效率的时代,比的是工程化的能力还有价格。如今价格战把模型压到成本线附近,模型层利润变薄,落到Agent、端侧与云服务身上的压力变得更重。
接下来模型厂商要么靠规模稳坐头部,要么靠场景做出差异化。一时的便宜不是终局,谁能在成本、效率与数据之间跑通飞轮,谁才能划出下一道斩杀线。
热门跟贴