为什么DeepSeek-V4-Flash-0731的后训练如此有效?

今天DS在官宣中提到这次的更新,Flash架构没变,但实际效果提升如此巨大。

很疑惑,为什么如此有效?

一个不能忽视的变量是DeepSeek刚刚成立的Harness团队,以及这个团队背后的一位核心人物:崔添翼Tianyi Cui。

打开网易新闻 查看精彩图片

DS突然开始疯狂招兵买马

如果你关注过这个人的推特的话,你会发现他发的帖子里面绝大多数都是关于 DeepSeek 招人的,而他本人是 DeepSeek Harness 团队的一个技术 staff,有可能就是 leader 级别的。

打开网易新闻 查看精彩图片

因为从他 7 月 21 号发的新帖子来看,Harness 这个部门是新成立的。他提到部门的目标非常远大,很可能就是 ASI 或者 AGI。

目前他们工作非常繁重,非常缺人,正在招三种职位:

1. Harness 研究员

2. 工程师

3. 产品经理

公开报道通常将崔添翼称为DeepSeek Harness团队负责人;他个人公开身份则是Harness团队的技术成员。换句话说,不管DeepSeek内部的正式职级如何划分,他至少是这个团队目前最核心的人物之一。

特别是他提到了最终的终面是由他来面,这也是我判断他是 leader 的主要原因。

打开网易新闻 查看精彩图片

甚至在 LinkedIn 上,我看到他在很多平台上都在招聘 Harness 相关的人员。

打开网易新闻 查看精彩图片

崔添翼的履历也很有意思。

他本科毕业于浙江大学计算机学院,在校期间长期参加ACM-ICPC竞赛。据国内公开报道,他曾六次获得亚洲区区域赛金牌。毕业后,他进入Jane Street,在香港从事软件开发和研究接近9年,业务覆盖交易系统、固定收益和股票;2022年,他又联合创办了量化交易公司TSY Capital,直到2026年3月加入DeepSeek。

打开网易新闻 查看精彩图片

量化系统和Agent,底层能力高度相似

这条职业路线与传统的大模型研究员不太一样。

他不是一路从语言模型论文、对齐算法或者自然语言处理实验室走出来的,而是长期在真实的量化交易系统里工作。

我个人认为,他量化背景对于 Agent 的加持其实非常直接。

其实我觉得这也是很多时候为什么“无心插柳柳成荫”—高频交易和量化系统本质上就是“高可靠性、低延迟、多步骤决策、实时工具/数据集成、不确定环境下的长程策略执行”。这些能力与Agent几乎一一对应。

比如规划、工具链式调用、错误自动回退与重试、多Agent协调、上下文与状态管理。

这是在大方向确立以及核心的框架确定之后,再加上疯狂招人的策略,也让这个 Agent Harness 的能力(也就是后训练效果)倍增。

特别是他最新发的一个帖子,他在招募 Agent 相关开源项目的开发者。

其实这个意思有点像 build in public,也就是招募在 Agent 方面有丰富经验的开发者。这些人其实可以不是我们以前通俗理解的大模型从业者,比如你可以是医疗方面的从业者,也可以是歌曲生成方面的从业者。只要你有相关经验,特别是在大量的 Agent 对话或者测试过程中发现过问题、总结出经验,这反而才是后训练阶段最需要的人。

打开网易新闻 查看精彩图片

你要知道,DeepSeek 可以说是这个地球上最火热的科技IP之一。DeepSeek 发布的招募有很多人自愿响应。靠着 DeepSeek 的声望,再加上 Agent Harness 团队,我觉得 DeepSeek V4 Pro 的效果有很大概率能和 Fable 5 打平,甚至有可能超越它。

这是为什么有人提到了DeepSeek 的新模型甚至已经达到了帕累托最优。

打开网易新闻 查看精彩图片

另外还有个点,那就是 DeepSeek V4 Flash 其实跟它的正式版之间的架构没有任何差别,唯一的区别就是后训练做得更充分。

这非常有可能跟上面这位大佬提到的思路是一致的。他认为在 4 月份的时候,DeepSeek V4 只是后训练做得不够充分,没有完全发挥出它的架构潜力。

打开网易新闻 查看精彩图片

这就说明,其实 DeepSeek 自从发布以来,不管是它的 V3、R1 还是现在的 V4,在架构上面可能已经优化到头了。

对于后训练来说,就是是将一个模型从智商正常的成年人,训练成一个可以干各种复杂工作的全能手。而这个全能手的一个前提,就是它在所有的基础知识上面是没有短板的。目前看来,DeepSeek V4 预训练模型的架构依旧是非常优质的。

这次上涨,不能全部算在模型权重上

这里还有一个很关键的细节。

DeepSeek在V4-Flash-0731的模型卡中明确写道,公开的代码Agent测试使用了尚未发布的DeepSeek Harness,运行的是minimal模式,同时开启了max推理强度。

这意味着,我们看到的成绩严格来说并不是一个完全脱离外部系统的“裸模型成绩”,而是:

DeepSeek-V4-Flash-0731模型+DeepSeek Harness+最大推理强度。

所以,这次能力暴涨很可能包含两部分。

一部分是模型权重经过新一轮后训练后,确实更擅长规划、调用工具和处理长流程任务;另一部分则是Harness更好地管理了工具、文件、上下文和任务循环,把模型原本已经具备、但以前没有稳定发挥出来的能力释放了出来。

这并不是说崔添翼一个人主导了0731版本的模型训练。目前没有公开资料能够证明这一点。

但从时间线看,他3月加入DeepSeek,4月发布的V4还是Preview版本,随后Harness团队快速成立并扩招,7月底正式版Flash的提升又主要集中在Agent和工具使用上。

因此,我更倾向于认为:崔添翼和Harness团队未必是这轮后训练的唯一原因,但很可能是DeepSeek Agent能力迅速补强的重要变量之一。

V4的后训练,为什么特别适合提升Agent?

最后,分享下来自于V4技术报告中关于后训练的细节:

第一阶段是领域专家独立训练。

DeepSeek并不是直接把数学、编程、知识问答、指令遵循和Agent工具使用等所有任务混在一起训练,而是先针对不同领域分别培养专家模型。

每一个专家先使用高质量领域数据进行监督微调,也就是SFT;随后再通过GRPO进行强化学习,并使用与该领域对应的奖励信号。数学题可以根据答案进行验证,编程任务可以直接运行测试用例,Agent任务则可以放进真实或模拟环境中,检查它究竟有没有完成目标。

这样做的好处是,每个专家都可以集中解决自己的问题。

Agent专家不需要同时考虑怎么写好一篇文章,它可以专门练习工具调用、长程规划、错误恢复和任务执行。数学专家也不需要为了兼顾普通聊天而牺牲推理强度。

第二阶段,则是多教师在线策略蒸馏,也就是On-Policy Distillation。

DeepSeek使用了十多个不同领域的专家作为教师,然后让统一的学生模型在自己生成的轨迹上,学习最相关专家的输出分布。

这里学的并不只是“标准答案是什么”。

学生模型在每一步生成过程中,都要学习专家对整个词表的概率判断。DeepSeek还使用了完整词表的reverse KL,而不是只模仿最终选中的那个token。这样得到的更接近一种行为策略,而不是简单背下专家给出的答案。

这对于Agent尤其重要。

因为Agent的好坏往往不是由最后一句答案决定的,而是由中间几十甚至几百个动作决定的:

什么时候搜索,什么时候打开文件,什么时候执行代码,发现错误后是否重试,以及什么时候停止继续探索。

传统的监督微调可能只告诉模型“正确答案长什么样”,而在线策略蒸馏可以让学生模型在自己的行动轨迹上,逐步靠近Agent专家的行为分布。

真正稀缺的是可以大量产生失败轨迹的环境

DeepSeek技术报告里还有一部分非常容易被忽略:它专门搭建了用于Agent后训练和评测的沙箱系统DeepSeek Elastic Compute,也就是DSec。

打开网易新闻 查看精彩图片

根据报告,一个DSec集群可以管理数十万个并发沙箱实例,支持函数调用、容器、虚拟机以及完整的软件工程环境。

这件事可能比多增加一些训练文本更加重要。

普通语言模型可以从互联网文本中学习知识,但Agent必须通过行动学习。模型需要真的运行代码、修改文件、调用工具、观察结果,然后根据失败继续调整。

如果只有少量人工演示,模型很难学会处理各种边缘情况。只有当你能大规模创建执行环境,让模型不断尝试、不断失败,再通过测试用例或者环境反馈自动打分,Agent强化学习才真正有可能扩大规模。

这也是为什么DeepSeek这次的后训练会显得格外有效。

V4的底座并不是一个缺乏知识的弱模型。它已经使用超过32万亿token进行预训练,Flash基础模型虽然每个token只激活较少参数,但在知识、编程和长上下文测试中已经表现很强。

它缺少的未必是“再学一点知识”,而是把已有知识组织成稳定行为的能力。

打个不完全准确的比方,预训练相当于培养出一个知识很全面的成年人;后训练则是在教他如何使用终端、管理项目、检查错误、调用外部工具,并在没人一直监督的情况下把一项复杂工作做完。

底子已经在那里了,后训练只是在把能力接到真实世界的接口上。

一旦训练环境、奖励机制和Harness同时改善,成绩就可能出现跳跃,而不是一点点上涨。

结论

从目前公开的Agent测试看,新版Flash已经在不少项目上接近GLM-5.2和Claude Opus 4.8,同时API价格低得多。至少在Agent性能和调用成本这两个维度上,它已经非常接近性价比前沿。

因此,我依然很看好后续的V4-Pro。

如果Pro版本能够吃到和Flash类似的后训练红利,那么它逼近甚至在部分Agent任务上超过Opus 4.8,并不是一个特别夸张的判断。

至于能不能直接打平Fable 5,现在还没有足够的数据。

但至少可以确定,DeepSeek接下来最值得关注的,可能已经不只是下一篇模型架构论文,而是崔添翼和这支仍在疯狂招人的Harness团队,最终会把DeepSeek的模型变成一个什么样的Agent。