QWEN3.8 · FLASH 前沿性能 只要 1/3 价格 125B 总参数 · 每次只激活 6B 7 个 Case,整套账单 ¥1.32 OUTPUT PRICE / 1M TOKENS DEEPSEEK PEAK · ¥9.0 ¥2.7 ≈ 1/3 TOTAL 125B ACTIVE 6B CONTEXT 262K → 1M 7 CASES · TOTAL ¥1.32 · KILL LINE MOVED
4 PARTS · CONTENT MAP
PART 01
架构换代
125B 总参,6B 激活
PART 02
七项实测
全套账单 ¥1.32
PART 03
斩杀线上移
从单价到任务成本
PART 04
模型即电力
基础设施竞争
大家好啊,我是甲木。
聊个事儿。
7月底DeepSeek V4 Flash上线的时候,全网都在喊“斩杀线来了”。输入1块、输出2块,OpenRouter上一周刷了7万亿Token,最重要是模型效果也很好,开发者们跟过年一样,什么任务都往上怼。
我当时也挺开心的,手头好几个Agent工作流直接切过去,成本一下子砍了大半。
结果好家伙,8月17号,DeepSeek宣布涨价。梁圣直接变成牢梁。。
峰时输出从2块涨到9块,涨350%。缓存命中从2分涨到1毛,涨1100%。还引入了峰谷分时,高峰时段是闲时的两倍。我稍微融了一下也感到肉疼......要知道 17 号之前,这个价格可以干不少活。
本来以为"价格屠夫"把线划死了,结果屠夫自己先收刀了。
但你不杀,有的是人杀。
8月26号,千问发了Qwen3.8-Flash。
输入 ¥0.8/百万Token,输出 ¥2.7/百万Token。
是DeepSeek V4 Flash涨价后高峰价的三分之一。是Opus 4.6的三十分之一。
关键是:性能不是打折货。SWE-bench Pro超Opus 4.6足足9.1分,JobBench超近20分,AndroidWorld超22.5分。多项Agent评测全面碾压。
好家伙,便宜大碗。
这不是"又一个便宜模型"。这是DeepSeek收刀以后,千问直接把刀捡起来了。
先感受一下6B激活做出来的前端长什么样,然后再拆它架构为什么能做到这个价位:
01
PART
新架构到底改了什么
Qwen4 架构提前预演 · NEXT ARCHITECTURE
Qwen3.8-Flash同步开源了一个叫Flash-Next的版本。不是Flash的迭代,是Qwen4下一代架构的提前预演。今天你看到的Flash,底下跑的已经是明年旗舰的架构了。
而且它是多模态的,文字和图片都能看。这在Agent场景里很关键,后面实测能感受到。而且我看聪哥也发了一篇解读,更为详细。
125B总参数,每次推理只激活6B。
说人话:模型"知道"的东西很多,但每次干活只调动很小一部分。脑子大,手脚轻。
注意力机制换了。传统Transformer处理长文本,历史信息全存着,文本越长越费显存。Flash-Next用GDN先压缩存储历史,再用QSA精准检索需要的内容。不全记,先压后查。长文本场景下显存和计算量大幅下降,原生支持262K上下文,可扩展到1M。
技术报告里给了个数字:在1M上下文长度下,QSA比传统全量注意力快了7.6倍(Prefill)和4.9倍(Decode)。如果缓存命中率到90%,整体Prefill吞吐是上一代Qwen3.7-Plus的8.6倍。
信息传递改了。层与层之间从一条通道扩成四条分支,加了门控决定读写。训练更稳,深层信息不丢。
加了一块“外部记忆”。额外51B的N-gram Embedding,相当于轻量外挂知识库。关键是可以放在主机内存里,不吃GPU显存。容量扩大了,推理成本几乎没涨。
训练效率翻了。引入Muon优化器,重跑Scaling Law。训练成本只有Qwen3.7-Plus的九分之一,但编程和办公能力更强。
这几个改动加在一起:从架构层重新设计了“生产一个Token要花多少钱”。
技术报告还提了一个细节:整个训练过程没有出现一次loss spike,不需要任何梯度裁剪手段。听起来是个无聊的工程细节,但它意味着训练过程极其稳定,不崩不抖不浪费算力在重跑上。稳定本身就是省钱。
不是发优惠券,是生产成本真到了这个位置。每块GPU能处理更多请求,模型更强带来的失败率下降也在省隐性成本。
DeepSeek涨回去了,千问从底层把成本打下来了。路线不同。
02
PART
实测:1块3毛2跑完7个Case
6B激活能干到什么程度 · REAL TEST
我拿Qwen3.8-Flash跑了7个完整case,游戏、工具网站、报告解读、AI早报、答题卡。
全套账单:¥1.32。
跑测环境是 Claude Code 接阿里云百炼端点,截图真浏览器实拍,账单按官方价逐条折算。挑几个聊。
CASE 01
Token 账单计算器
让 Flash 自己做个多模型对比计算器:内置10家最新定价,滑块调参、柱状图排序、明细表。大概跑了 6.2 分钟就成型。
如果是执行我给出的任务,Qwen3.8-Flash大概月成本 ¥167.40,输入输出单价跟GLM-5.3-Flash接近,但缓存命中价只要 ¥0.1(GLM是 ¥0.23),Agent场景大量复用上下文时差距就拉开了。
两轮账单:¥0.28。不到3毛钱给自己做了个广告。
CASE 02
割草小游戏
微信朋友圈经常刷到的那种割草小游戏,10波波次制,波间升级+武器商店,6武器槽可合成。这次不是一句话prompt,是写好完整规格书再让它按规格开发。52KB单文件,离线双击就能玩,效果还不错。
CASE 03
品牌官网
让它先抓 teenage.engineering 真站提炼风格,再做一个虚拟音频品牌官网。出来的东西很有设计感。
CASE 04
部署平台官网(vercel.com 风)
同样的套路抓 vercel.com 提炼特征,做toB虚拟AI部署平台。账单:¥0.17。
CASE 05
定价截图交叉分析(多模态)
6张各家官方定价页截图扔进去,让它读图、提价格、找矛盾。
第一轮价格不在画面里,它没硬编,如实标注「未在可见区显示」。补拍后重跑,找到4个真实矛盾点:GLM划线价话术、新旧模型同价、跨平台币种混用、空白截图正确识别。
两轮:¥0.20。
CASE 06
读自己的技术报告(26万上下文)
2.3MB的tech_report.pdf完整喂进去,做一页图解。5.9分钟,核心数字全部与原文核对通过。
账单:¥0.21。大头是缓存读取1.2M tokens,读长文档正好走缓存命中价,0.1元/百万的优势就这么体现出来了。
CASE 07
其他 Case
CASE
结果
账单
论坛难题快答
6道名题全对,平均18.9秒
¥0.07
滚动叙事页
苹果发布会风,一次成型
¥0.10
AI早报(Agent)
自主抓新闻排版,头条经Reuters核实为真
¥0.03
全套7个case,缓存读取6.49M tokens是最大头,按0.1元/百万计价。长上下文反复引用正是缓存命中价的主场。合计¥1.32。
03
PART
斩杀线上移:从Token单价到任务总成本
大模型的新竞争逻辑 · NEW KILL LINE
DeepSeek被叫「斩杀线」,核心不只是因为便宜。是它出来以后,整个市场开始算一笔账:同样水平的智能,到底值多少钱?
但这一涨价,等于告诉市场:靠压价获客的模式有天花板。算力是物理现实,7万亿Token的恐怖调用量直接把服务器挤爆了,涨价是唯一的自救手段。
斩杀线不是你想划就能一直划住的。
Qwen3.8-Flash换了一种方式来划这条线。从架构上把生产成本做下来了,训练成本降90%,推理效率翻倍。
做Agent的人都知道,一次任务不是一问一答。一个完整的Agent工作流可能跑几十轮调用、消耗几十万Token、调工具、做验证、处理失败重试。
真正决定成本的,不是单次调用多少钱,是跑完一整个任务花多少。
TASK COST · 新斩杀线公式
任务总成本 = API费用 + 等待时间 + 失败重试 + 多Agent协同开销 + 人工修正
Qwen3.8-Flash同时压了好几项:性能强→一次做对的概率高→重试少;推理快→多轮跑得动;价格低且稳定→不用算峰谷、不用半夜起来调度。
斩杀线的定义该升级了:不是每百万Token值多少钱,是每块钱能完成多少工作。
顺带一提,这里面还有个反直觉的事。
模型便宜了,企业花的钱会少吗?不一定。更可能出现杰文斯悖论,单次任务便宜了,用户会把AI塞进更多流程。以前只让AI回答一个问题,现在让Agent跑完整条工作流。
更便宜的模型,反而是推理需求爆发的起点。
04
PART
结语
模型就是电力 · FINAL THOUGHTS
我有个朋友做AI应用的,之前底层调的就是DeepSeek V4 Flash,用户量起来以后,日常跑得挺顺。
8月17号涨价那天,他给我发消息:账单暴涨。峰时叠加缓存未命中、叠加调用量增长,几个乘数一起上去的。当天就把那个模型下线了。
对AI应用来说,模型就是电力。
你平时不会去想电费多少钱。但电涨价的时候,所有生意都在疼。Qwen3.8-Flash在做的事情是:从发电端把成本真正降下来。
千问3.8这一波打了套组合拳:Max冲天花板,Flash接日常,27B给开源社区,Flash-Next把Qwen4架构提前开放验证。
大模型竞争上半场拼「谁最强」。
下半场拼的是:谁能成为AI应用的基础设施。
稳定、便宜、不反复无常。
千问走到这一步了。
以上。
我是甲木,热衷于分享一些AI干货内容,同时也会分享AI在各行业的落地应用。觉得有用的话,点个赞、在看、转发三连,谢谢大家。
热门跟贴