别人卷参数,他卷效率。 融资到账第九天,梁文锋的第一枪,打在了"让现有模型跑得更快"上。
这几天,AI 圈又被一个名字给刷屏了。
DSpark。
我第一眼看到的时候,还以为是哪家公司又发新模型了。。。
点进去一看——好家伙,又是梁文锋。
故事是这样的。
6 月 16 号,DeepSeek 刚刚完成成立以来的第一轮外部融资,超 500 亿人民币到账,投后估值 3300 亿。
腾讯、宁德、网易、京东,挨个排队送钱。
按正常剧本走,融了这么多钱,下一步不是憋个大招放 V4.1,就是开个发布会请明星站台。
结果梁文锋这哥们儿,钱到账第 9 天,6 月 27 号,啪的一下,在 GitHub 上低调挂了一篇论文。
联合北大发的,本人署名。
没发布会,没海报,没 PR 通稿。
就这么悄咪咪地,把自家 V4 的"发动机"拆了重装。
一、那个让我 PTSD 的数据
我看到那个数据的时候,是有点 PTSD 的。
单用户生成速度,比线上原来的 MTP-1 基线,直接提升 60%–85%。
V4-Flash 在 120 tok/s 严苛档下的吞吐?
+661%。
我反复确认了好几遍,没看错,就是这个数。
什么概念呢。
以前你用 V4-Flash 让它写个长文,你可以泡杯茶慢慢喝。
现在你点回车的瞬间,唰,全出来了。
而且最骚的是——
输出分布跟原模型完全一致。 质量不掉,纯加速。二、它是怎么做到的
我尝试用人话讲清楚。
以前的大模型,说白了就是个"挤牙膏型"选手。
你让它写 100 个字,它就老老实实算 100 次神经网络,每次蹦一个字出来。
慢得抠脚。
后来圈子里有人想了一招,叫**"推测解码"**。
意思是雇一个"小模型实习生",先唰唰唰帮你猜一长串草稿,再让"主模型老师"闭着眼一次性核验,对的留、错的扔。
听起来很美好。
但这帮实习生干活儿有两个毛病。
- 第一种实习生太老实
,跟老师一样一个字一个字猜,自己也变得很慢。
- 第二种实习生太浪
,一口气猜十几个字,开头还行,越往后越抽象。
明明前文是 of,下一个该是 course,它非要给你写个 "of problem"。
这毛病在论文里还有个正经名字——"后缀衰减"。
更骚的事还在后面。
主模型老师不管这些。
你扔过来 20 个字,它就老老实实校验 20 个字。
哪怕后 15 个字一看就是瞎扯,它也得算一遍。
在高并发的生产环境里,这就是灾难性的算力浪费。
三、DSpark 的破局思路
就两件事。
1. 让实习生别瞎写
它搞了个 "半自回归" 的混合架构。
前面用并行主干一口气铺开大块草稿,后面叠一个极简的串行小模块,让每个字都"瞄一眼"前面已经写出来的内容。
并行的快还在,串行的准也补上了。
2. 让老师别傻看
它给每个草稿字都打了个 "靠谱分"。
调度器实时盯着——
置信度低?跳过别校。
置信度高?拉满去验。
服务器空闲就敞开了猜,服务器繁忙就收着点猜。
简单粗暴。
但是有效。
四、和谁比?比多少?
对比对象
提升
Eagle3
(自回归草稿)
平均接受长度 +26.7% ~ +30.9%
DFlash
(并行草稿)
平均接受长度 +16.3% ~ +18.4%
MTP-1
(线上生产基线)
而且这套方案不挑模型。
Qwen3-4B、8B、14B 上挨个验证,全部能打。
五、为什么这件事比 V4.1 还值得说
我跟一个做 Infra 的朋友聊起这事儿。
他来了一句:
"这玩意比发 V4.1 让我服多了。"
为啥。
2026 年了,参数堆到这个量级,架构创新的边际收益已经在递减了。
真正的命门,是"同样一张 H100 能跑出多少 tok/s"。
每提 10%,就是真金白银。
而 DeepSeek 还把所有东西都开源了。
- 模型权重
挂在 Hugging Face
- DeepSpec 全栈训练代码
扔在 GitHub
- MIT 协议
,随便商用
意思是——你拿去给 Qwen3、Gemma 训自己的草稿模型也行,随便用。
上线一天,906 个 star。
六、写在最后
这两年我看了太多发布会。
每场都恨不得把自己说成下一个 OpenAI。
PPT 上的数字一个比一个吓人,落到真实用户手里,卡得跟幻灯片似的。
但 DeepSeek 一直在闷头干一件事——
把价格打下来。 把速度提上去。 把代码扔出来。 把门槛踩下去。
500 亿到账第九天打的第一枪,没打在新模型上,打在了"让现有模型跑得更快"上。
这个选择,挺梁文锋的。
愿我们手里的 AI,
别再是挤牙膏的电子算盘。
而是一台,真正能陪你跑起来的发动机。
热门跟贴