9月15日凌晨,一个刚给DeepSeek V4.1交付完核心算子的工程师,在个人平台发了篇长文,标题是《我不得不把才华埋葬在昨天》。

打开网易新闻 查看精彩图片

他叫刘胜与,2021级北大图灵班,当过北大未名超算队队长,代表学校打过SC23国际大学生超算竞赛,现在是DeepSeek机器学习系统方向的系统工程师。这回交付的是V4.1的主Attention算子,head dim 512的MQA attention。V4.1在高效推理上那截性能,是他这样的系统工程师一砖一瓦垒出来的。

打开网易新闻 查看精彩图片

他给自己下的结论很短:得转业了。

不是裁员,也不是被优化。他的原话是,AI成了算子大师。

先说他原来干的活是什么。这行要懂GPU微架构、内存层次结构,往下要钻到PTX汇编和SASS机器码,看流水线为什么停顿,再回来改代码。硬件的脾气是要用命去换的,同一个矩阵乘,换一种分块、换一种访存顺序,性能就能差出几倍。刘胜与2025年2月参与过FP8极致性能GEMM算子优化,2026年4月做过DeepEP V2的专家并行通信库重构,都是这类活。国产模型能在有限算力下把训练和推理成本压下来,靠的就是这批人。

打开网易新闻 查看精彩图片

而现在写这类算子的,越来越多的不是人。

打开网易新闻 查看精彩图片

Cursor和英伟达今年做过一次公开实验。一套多Agent系统,三周时间里自主优化了235个面向Blackwell B200的CUDA算子,几何平均提速38%,其中149个跑过原有基线,45个提速超过两倍。题目来自SOL-ExecBench,取材于124个生产环境里的开源模型,里面就有DeepSeek、Qwen、Gemma、Kimi各自的算子。AI优化的对象里,本来就包含着它们自己。OpenAI在推进自研芯片(代号「墨西哥辣椒」)的时候,也有报道说它调了Astra和Agent工具,直接参与算子生成和编译栈搭建。

打开网易新闻 查看精彩图片

刘胜与看这些数据的角度,比我们近得多。他写:AI能一秒思考300个token、半秒敲出一行命令、二十秒写完一份代码,而我不行。

他往下推了一句更硬的判断:未来半年到一年,AI自主评估调度方案、自己设计并实现端到端极致算子的能力,大概率追平甚至超过顶级人类工程师。

这话从一个刚交完核心算子的人嘴里说出来,分量不一样。

真正值得琢磨的地方在后头。DeepSeek这些年最硬的本事,从来不是模型参数多大,是把成本抠到别人抠不动。训练贵、推理贵,它靠infra一层一层往下削。这条路的门槛很高,高在要有一大批肯钻汇编、懂硬件的人。算子优化一旦被Agent接管,这套本事就从少数团队的绝活变成人人可调的工序。

你越擅长挖护城河,你就越先知道这条河是怎么被填平的。

刘胜与说的转业,也不像我们想的那么悲壮。他说自己不是离开计算机系统这个领域,是换一个位置站。从逐行手写底层指令,退到给Agent下达指令、设定边界、评估方案,去做Agent的机甲驾驶员。饭碗保住了,手感丢了。他自己写得挺克制:我的手中多了些齿轮,但心中少了些节拍。

打开网易新闻 查看精彩图片

他还留了一句更不好听的话。一个工程能力很差的人,配上AI之后,产出屎山的效率可以是先前的数倍。

这句比被替代更扎人。AI抹平的是门槛,同时抹掉的还有区分度。以前写不出算子的人进不了这扇门,现在他能进来了,带着一堆跑得动、但没人敢接手维护的代码。

文末那句被引用得最多的,是他对替代的态度:我当然希望自己不要被革命,但如果非被革命不可的话,我希望革我自己命的人是我自己。

评论区有人自嘲,那我们岂不是49年入国军。也有人贴出自己的实测,说现在拿Codex做国产芯片的Attention算子开发,除了方案不能替他敲定,别的都能帮他完成,又快又好。

他为什么不走,他自己给了答案。留下是因为DeepSeek把强大、快速、普惠的AI开源做下去,或许能把世界从2077那端拉回来一些。

他自己给这件事划了个时间窗:半年到一年。这不是给同行打气的期限,是给自己留的观察期。真到那天,被拿走的可能不只是手写汇编的乐趣,还有DeepSeek这些年最顺手的那条省钱的路。

打开网易新闻 查看精彩图片