打开网易新闻 查看精彩图片

过去三年,梁圣署名了11篇论文,每篇都几乎震动世界。

作者丨高允毅

编辑丨岑 峰

当 RSI 的风吹到了 DeepSeek,这次讨论的是一个新话题“自动化沙箱”。

9 月 19 日,arXiv 更新了一篇 DeepSeek 新论文《DSec:面向大规模智能体训练的高效沙箱基础设施》,论文长达 31 页,首次展示了 DeepSeek 自动化沙箱系统 ——DSec(DeepSeek Elastic Compute)。它是专门应用于其内部超大规模智能体(Agent)强化学习与评测体系的生产级底座,能为每一次训练任务秒级创建独立的虚拟“新考场”。

DSec 的工程能力十分惊人。每日可自动运行 300 万个沙箱环境,单生产单元横跨 160 个 CPU 节点。通过严苛的权限隔离,DSec 不仅能防止 AI 作弊,还能对 AI 在沙箱内每一步环境反馈的精准复现。

这篇论文是这轮 RSI 革命在工程深水区的探寻,在Agent强大到频频失控,甚至意识到自己被“监控”,隐藏起思维链的2026年,沙箱不再是附庸的安全配件,它既是AI进化的训练场,也是锁死 AI 破坏力的关键防线。

而拥有这样前沿意识的,正是通讯作者栏里那个熟悉的名字 —— 梁文锋。

过去三年,梁文锋极少以第一作者或通讯作者身份,出现在 V3.2、V4、V4.1-Flash 这些动辄上百人署名的旗舰模型整体报告中;却始终把名字签在 MLA 注意力、MoE 路由机制、mHC 拓扑流形、DSpark 推理算子、DSec 智能体沙盒这些最底层的原子技术论文上。

整整11 篇梁文锋署名的论文,串起的是一部精准瞄准行业核心痛点、直击底层内核的技术狙击史。

1.《DeepSeek LLM: Scaling Open-Source Language Models with Longtermism》 2.《DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models》 3.《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》 4.《DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence》 5.《DeepSeek-V3 Technical Report》 6.《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》
7.《Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention》 8.《Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures》 9.《mHC: Manifold-Constrained Hyper-Connections》 10《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》 11.《DSec: An Efficient Sandbox Infrastructure for Large-Scale Agent Training》

01


2024 年初的破局之战:

买不起一万张显卡,那就打效率战

2024年初的大模型行业,深陷算力规模的军备竞赛。稠密模型的缩放定律几乎等同于 "烧钱定律",整个赛道被万卡集群、数亿美金的投入门槛圈成了一个巨头专属的 “顶级俱乐部”。

能坐在牌桌上的玩家屈指可数:OpenAI、Google、Anthropic、Meta。像OpenAI的GPT-4 级别模型需要上万张高端 GPU,单次训练物料成本超过 6300 万美元,训练成本动辄数亿美元。

算力资源直接决定了模型能力的天花板。对所有初创公司而言,沿着巨头定下的稠密模型路线追赶,永远只能活在对方的阴影里。

像 Stability AI 这样的明星开源公司 ,2024 年因无力承担高昂的 GPU 云租赁费用,资金链断裂,CEO 黯然离职;Inflection AI 同样扛不住稠密模型持续翻倍的训练成本,2024 年 3 月核心团队被微软反向并购,退出了通用大模型内卷。

国内一众曾在 2023 年喊出 “百模大战” 口号的初创团队,到 2024 年初直面 “万卡集群” 的硬件门槛时,仅凭几百、上千张卡的作坊式训练规模,直接遭遇降维打击,纷纷掉队。

梁文锋的第一波狙击,直接打在了 "算力与能力线性绑定" 这个底层规则上。《DeepSeek LLM》、《DeepSeekMoE》、《DeepSeek-V2》正是这段时间的作品。

《DeepSeek LLM》

2024 年 1 月 5 日,梁文锋团队发布《DeepSeek LLM》,这是 DeepSeek在全球开源社区的首秀,直接给浮躁的“参数军备竞赛”泼了一盆冷水。

经过严密的数学推导与验证,他们发现在算力固定的前提下,盲目扩大模型参数并非最优解,提升数据质量与数据密度的配比,反而能带来更强的模型能力。

在这套思路下,团队在 2 万亿优质中英双语 Token 上训练出 DeepSeek LLM 7B 与 67B 两个版本。其中仅 67B 参数的版本,就在代码、数学与推理基准测试中全面反超当时的开源标杆 Llama-2 70B,更在开放对话测试中击败 GPT-3.5。

这是梁文锋技术路线打响的第一枪,“我可以用更少、更精密的算力,训出比你更聪明的开源模型。”

《DeepSeekMoE》《DeepSeek-V2》

随后,就是大众熟知的经典之作《DeepSeekMoE》《DeepSeek-V2》,直接重构了传统 Transformer 架构。

DeepSeekMoE 架构通过细粒度专家动态路由与共享专家隔离,让每个 Token 仅调用少量专家参与计算,直接将训练开销降低 42.5%。

首创的 MLA 多头潜在注意力机制,精准击破了长上下文推理的“成本黑洞”,利用低秩潜在向量压缩,将 KV Cache 的体积极限压缩了 93.3%。

基于这两项技术突破诞生的 DeepSeek-V2 ,凭借比肩 GPT-4 的性能和极低的成本震惊世界。它把千 token 推理成本打到了此前的几十分之一,直接引爆了国内大模型 API 的价格战。

这不仅让 DeepSeek 挤进核心牌桌,成为性价比代名词,更把一大批买不起算力门票、濒临出局的边缘玩家,连同整个开源社区,重新拉回赛场。

02


2024 年到 2025 年的能力击穿战:

冲击闭源模型的智力高地

如果说第一阶段解决了 "用低成本做出可用模型" 的问题,那么第二阶段的梁文锋,把这条低成本路线推到极致,追赶闭源模型的顶级水平。

《DeepSeek-Coder-V2》

2024 年 6 月,DeepSeek 发布《DeepSeek-Coder-V2》,率先向闭源模型垄断最深的代码垂直领域痛下杀手。

在大模型行业发展的早期,开源模型在复杂代码生成、前沿数学推理等领域,始终无法赶超闭源模型,这背后的原因,既有高质量代码数据的稀缺,也因为老架构算力效率低下。而闭源厂商有几万张 H100 ,可以不计成本地依靠丰富的物理硬件资源,强行堆砌出高端的代码与推理能力,形成商业垄断。

而梁文锋在新架构基础上,额外注入了 6 万亿高质量中英代码与数学数据进行持续预训练。将支持的编程语言从 86 种扩充至 338 种,上下文窗口直接拉满至 128K。

最终, DeepSeek-Coder-V2,在 HumanEval、Codeforces、LiveCodeBench 等主流代码基准上,首次全面超越 GPT-4 Turbo、Claude 3 Opus 等闭源顶级模型。

这次尝试既验证了新 MoE 架构的高端能力,还把推理价格打了下来。其每百万 Token 的输入价格仅为 0.14 美元,输出价格仅为 0.28 美元。作为对比,当时闭源世界的霸主 GPT-4 Turbo 每百万 Token 输入需要 10.00 美元,输出高达 30.00 美元。在提供同等甚至更强代码智能的前提下,DeepSeek 的价格仅为 OpenAI 的约百分之一。

这直接把高端代码智能的调用成本打至近乎可忽略的 “水电费” 级别,让不少中小企业或独立开发者可以构建自己的 Agent 团队。

《DeepSeek-V3》

随后,2024 年底,DeepSeek团队做了新 MoE 架构的超大规模尝试。

在不到2个月的时间,他们仅凭 2048 块 H800 显卡,就从头开始训出顶级模型 DeepSeek-V3。它的参数高达671B ,总成本才 560 万美元,这个数字直接让硅谷破防。当时,同等能力级别的闭源模型,训练成本通常是它的数倍甚至十倍。

当时不少人戏称,“中国团队在用自行车的预算造火箭”。

虽然,科技分析机构 SemiAnalysis 等在复盘时调侃道,这 560 万美元只是“纯 GPU 烧电训练的最浅层账单”,不包括前面的研发亏损、卡群折旧和高达 13 亿美元的基础硬件大总账。但这并不妨碍大家拿这张“漂亮的收据”去羞辱那些动辄要募资 1000 亿美元的硅谷大佬。

560 万美元成为全行业拿来公开处刑的标尺。

而这一切的奥秘藏在了《DeepSeek-V3》论文里,梁文锋团队做了三件事,把每一分算力都榨到极致。一是用无辅助损失的专家负载均衡策略,让所有专家均匀分配任务;二是用更精简的 FP8 数值精度做训练,让显卡的计算效率直接拉满;三是训练大模型时,让“数值计算” 和 “数据传输”并行启动,把硬件的空闲时间压到几乎为零。

这一战彻底证明了, 新 MoE 架构不仅能进行超大规模训练,还能以极低的成本稳定地训练完成。

《DeepSeek-R1》

真正奠定 DeepSeek 行业一哥地位的,来自 2025 那场春节。

在此之前,硅谷牢牢把持着 “深度推理” 的话语权,将其塑造成万卡集群、海量名校博士手工标注才能堆出来的昂贵特权,OpenAI 的 o1 更是被奉为闭源推理的标杆。

DeepSeek-R1 的横空出世,直接斩落了闭源推理王牌 o1。而整个强化学习阶段仅耗资 29.4 万美元,这在动辄需要数千万、数亿美元“强化学习预算”的硅谷面前,无异于降维打击。

在《DeepSeek-R1》论文中,其核心突破在于团队提出的组相对策略优化(GRPO)算法。首次严谨证明无需大规模监督微调(SFT),仅通过纯强化学习,大模型就能自主涌现出链式思考能力;其中 R1-Zero 版本,完全从零冷启动,不依赖任何人工标注数据,仅凭 RL 训练就达到了接近闭源顶级推理模型的水平。

这项成果的影响力迅速突破行业圈层。它后来登上《Nature》杂志封面,成为首个获此权威认可的主流大模型成果。《麻省理工科技评论》《纽约时报》《华盛顿邮报》、CNBC、英国《金融时报》等西方主流媒体密集报道,惊呼美国对中国人工智能领域的限制,根本无法阻止中国在这一领域取得进步。

国内更是掀起了 R1 热潮。无数科技从业者连夜研读技术报告,科技媒体扎堆跟进报道,DeepSeek 从 “性价比黑马” 摇身一变,成为 “全球 AI 底层范式定义者” ,走进大众视野。梁文锋也被请到了政府座谈会上,分享中国 AI 的发展。

梁文锋还顺手把 R1 的硬核逻辑‘蒸馏’给了全球所有开源小模型,直接解构硅谷资源霸权。

打开网易新闻 查看精彩图片

《Native Sparse Attention》《Insights into DeepSeek-V3》

拿下推理能力的高地之后,这一阶段,梁文锋的狙击范围还在向更底层延伸,把成本战下沉到芯片的微观访存逻辑里,解决长文本训练与推理的物理成本问题。

此前业内解决超长上下文,都爱用 “稀疏注意力”,这是个纸上谈兵的技术,真跑在 GPU 上就水土不服,并没有省很多算力。

2025 年 2 月,团队提交《Native Sparse Attention(原生稀疏注意力,NSA)》论文,没有停在应用层做小修小补,直接用 Triton 语言重写了最底层的硬件计算算子。NSA 创造性地设计出分层动态稀疏策略,让稀疏计算的访问节奏,精准对齐 NVIDIA GPU Tensor Core 的微观电路结构,这相当于给算法量身定做了适配硬件的 “跑道”,让稀疏计算能在硬件上全速跑起来。

而且,NSA 是从预训练第一天起就把稀疏性刻进模型里的原生技术,全程不损失模型精度。这直接让模型前向传播速度提升 9 倍,长序列解码速度直接拉高 11.6 倍。

NSA 斩获 ACL 2025 最佳论文奖,也成为了下一代长上下文大模型公认的标配技术方向。

2025 年 6 月发表于 ISCA 的《Insights into DeepSeek-V3》,从计算机体系结构视角,拆解了大规模 MoE 训练的内存墙、通信墙瓶颈,分析了 MLA、MoE 路由、FP8 精度与 GPU 硬件的协同关系,甚至给出了下一代 AI 加速芯片的设计建议。相当于把中国大模型的工程经验,变成了全球芯片行业的可参考的指南。

这一波把 DeepSeek 的技术影响力,从算法层延伸到了硬件层。

2025 年末的深水区攻坚战:当 AI 冲进无人区,用数学重构底座。

03

2025 年末的深水区攻坚战:

当 AI 冲进无人区,用数学重构底座

当模型规模冲到千亿级、网络层数突破上百层,行业彻底进入了无经验可循的 “无人区”。大模型的竞争,也从参数规模的比拼,悄然变成了深层网络拓扑的数学命题。

大模型由上百层网络堆叠而成,训练时信号与梯度要在层间反复传递。过去十年,全行业都沿用经典的残差连接,也就是著名的 x + F (x) 范式。

它像一条保留了直通车道的公路,前一层的信号可以原封不动地流向深层,以此缓解梯度消失,让深层网络得以训练。但当模型做到极深、极宽,这条范式就触到了天花板:数值稳定性不足,梯度很容易在百层传递中逐渐消散或者失控暴涨,训练中频繁出现 Loss Spike(损失突增),一次失控就可能让数千万的算力投入付诸东流。

学界此前提出过超连接架构,相当于把单车道升级成多线并行的高架立交桥,允许多路信号同时交叉、融合,理论上能大幅提升网络的表达能力。但这种架构缺少数值边界约束,信号越传越偏,深层训练极易发散,始终停留在实验室阶段,无法大规模落地。

2025 年 12 月 31 日,梁文锋团队在《mHC》论文中,给出了一个极其优雅的数学解法 —— 流形约束超连接(mHC)。

mHC 相当于在立交桥的所有出入口架起了一道透明的 “数值护栏”:它强制要求所有层间的交互映射矩阵,必须严格落在由双随机矩阵构成的特定数学区域 ,即Birkhoff 多面体流形之内。这样一来,无论多路信号在层间怎么交叉、融合、传递,整体的数值尺度始终保持守恒,从数学底层解决了超深层模型训练不稳定的根源问题。

这一步,梁文锋已经在解决 “规模堆上去之后会不会崩” 的底层数学问题,从拓扑层面,重新定义了深层网络的连接规则,也为千亿甚至万亿参数的极限模型,打下了稳固的数学地基。

04

2026 年的终局卡位战:

把战火烧到 Agent 基础设施层

进入 2026 年,全行业都已认准下一个主战场:智能体(Agent)。几乎所有厂商的注意力,都集中在模型的推理能力、工具调用能力、任务完成率这些显性指标上。而梁文锋已经开始注意到更底层的东西,Agent 训练的基础设施。

《DSpark》

2026 年 6 月,DeepSeek在《DSpark》中提出一个“推理加速”工具——DSpark,它解决的是大模型生成回答的速度问题。

大模型生成回答时,越到后面越慢;当很多人同时用 AI 时,速度就更拉跨。

DSpark 让 AI 生成回答时,不再压榨单个算子的计算速度,而是动态调整生成节奏:有把握的地方就提速,容易出错的地方就慢下来。从根本上避免“猜错要回滚重算”的浪费,把“事后补救”变成了“事前规避”。

在多人同时使用的高并发场景下,DSpark 能让每个人的生成速度提升 60%–85%。

DSpark 之所以重要,是因为它把推理效率的比拼,从“谁的芯片更快”拉到了“谁的调度更聪明”这个层面。现在的大模型正从“答一次题”走向“全天候帮人干活”。当所有人同时发起请求,对基础设施的考验完全不同。这套思路,正是在为“百万人同时用 AI 干活”的未来提前打好地基。

《DSec》

另一方面,底层的沙箱基础设施,可能会是大规模 Agent 训练的关键瓶颈。

Agent 的强化学习需要在可执行环境中反复试错,百万级的交互迭代就需要百万级的沙箱环境。传统沙盒方案启动慢、密度低、成本高、安全隔离差,根本支撑不起日均百万级的生产级训练任务。

它们是为“验证代码”设计的,不是为“培养智能”设计的。

9 月,DeepSeek 发布自动化沙箱 DSec,每天可运行约 300 万个沙箱,并发承载 38 万个实例。同时内置完整防作弊机制,保证训练交互数据的真实性。

在此之前,各家厂商的 Agent 沙盒都是内部定制的黑盒,没有统一标准,也没有公开的生产级参考方案。DSec 的发布,相当于第一次把 Agent 大规模训练的基础设施标准化、公开化。

更关键的是,这是一次典型的 "提前卡位"。当同行还在打磨单个 Agent 的任务能力时,梁文锋已经在搭建能支撑百万级 Agent 并行训练的基础设施。

05

技术狙击手的哲学

回望三年,梁文锋署名的这 11 篇技术论文,从成本战出发,专挑最底层、最硬核的地方下手。

从 MoE 重构算力成本,到 MLA、NSA 击穿长上下文瓶颈;从 R1 颠覆推理范式,到 mHC 筑牢数学底座;从 DSpark 榨干推理效率,到 DSec 卡位 Agent 基础设施。

梁文锋之所以被尊称为“梁圣”,正是在于他的每一步都精准踩在了技术演进的节点上,他的每一枪都解决了行业的致命痛点,最终完成了 AI 的技术普惠。

真正的狙击手,从不炫耀枪支的口径,也不比拼弹药的数量。他只关心一件事:用最精准的打击,完成最致命的突破。而这条 "底层击穿" 的技术路线,或许正是中国大模型在全球竞争中,最有价值的差异化路径。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。