打开网易新闻 查看精彩图片

国庆假期前,“大肥鲸鱼”终于密集发新消息了。

9月29日晚,DeepSeek正式发布Harness v0.2预览版,也正式有了入口,而新版重点补齐了桌面端的日常使用体验。

打开网易新闻 查看精彩图片

官方还首次公布了该产品数据。

DeepSeek 称,目前约 60% 的 Harness 用户使用了第三方插件。按官方模型 API 用户口径统计,Harness 已经成为其用户中日活和日均会话数最高的 Coding Agent 产品。同时还首次披露了未来产品路线,包括

加入个性化的长期记忆、实现浏览器与其它 GUI 软件的自动化操作、支持远程与移动端使用等功能。

此外,DeepSeek还债知乎上公布了弹性计算 (DSec)技术的论文细节。

然而,对于开发者来说,其实分关注DeepSeek Harness什么时候有“眼睛”,能实现多模态和图片生成等,补齐开源AI全模态体系。 9月29日,智能纪元AGI独家获悉,清华大学人工智能学院、复旦大学、DeepSeek、字节Seed、北京大学、北京智源人工智能研究院(BAAI)等团队联合发表论文“统一一步视觉生成分布训练”。 研发人员提出MGFlow(混合梯度流 Mixture Gradient Flow),使得统一分布式训练以实现一步式视觉生成。

打开网易新闻 查看精彩图片

论文中表示,利用视觉空间的分布式训练,引入统一的理论框架MGFlow,将分布建模与匹配差异分开,减少生图流程,并通过Wasserstein梯度流将全局目标与点特征更新相连接,以可调节的粒度在全局矩和基于样本的表示之间用高斯混合模型来建模特征分布,并解决混合表达能力本身无法解决的模态崩溃问题。 在ImageNet上,MGFlow显著优于FD-Loss基线,实现了最先进的结果。对于文本到图像生成,MGFlow对FLUX.2 4B进行后训练,使其成为一个一步生成器,在GenEval和PickScore上都优于原始的四步的模型。 本论文通讯作者是清华大学人工智能学院助理教授刘淼,参与作者当中包括DeepSeek AI研究团队成员、浙江大学的周俊康(junkang zhou),清华大学的Chi Zhang、Shi Haoyang等。 根据其信息,Junkang Zhou是浙江大学计算机科学与技术专业的一名本科生,研究和工程工作专注于构建高效、可扩展的多模态大型语言模型(MLLM)预训练和强化学习系统,今年8月加入DeepSeek 多模态LLM系统团队,之前曾在字节跳动Seed Infra团队实习。

打开网易新闻 查看精彩图片

事实上,AI模型生图和画画,大家都熟。

敲一句提示词,模型要跑几十步迭代,一点点把噪声擦掉,慢慢浮现图片。效果很美,但代价摆在明面上:速度慢,算力开销大。

而无论是AI研究人员,还是开发者、行业人士、普通用户都一直有个梦想:不再抽卡、一步生成。

不需要来回迭代,神经网络向前跑仅仅一次,直接吐出完整成品图像。

这件事很难。

早期的一步模型,很容易出现崩坏:细节糊掉、物体种类丢失、色彩错乱。

为什么?不是网络本身不够强,很多时候问题不出在像素,而出在分布监督。

如今,这件事似乎有了新的办法。

这次,多个团队发表的论文当中,提出现在一套叫“分布训练”的技术路线。它放弃“生成图片和某一张真实图片像素对齐”。换了一套玩法:把图片扔进一个冻结好的编码器,变成高维空间里面的一个个点。

换句话说,利用这个技术,我们不去管单张图好不好,而是让一整批生成图片的点云分布,尽量贴近真实图片的点云分布。

这是群体层面的监督,不靠一对一的对标。

这条路线诞生了两个代表性方案。

其中,FD‑Loss,选择用单个大高斯罩住全部特征点。优点:计算简单,稳定好用。缺点:一个大袋子装所有,只能抓全局均值、整体方差。复杂数据有一大堆子模式,比如猫、狗、飞机、花,全部揉在同一个高斯里面。细粒度的多模态信息直接被抹平。相当于只看全班平均分,看不到每个小组的差异。

另一条路,Gaussian‑kernel Drifting。它走向另一个极端,不用全局大包,落到每一个样本。用核函数,让样本之间互相吸引、排斥。它可以捕捉细碎的局部结构。但代价来了:太盯着局部样本,丢失全局协方差信息。还容易踩坑——模式坍塌。部分类别的样本直接消失不见。

而新的论文当中提出了统一理论框架,适用MGFlow工具,并把分布训练这件事,拆成四个零件:采样样本、冻结编码器、分布模型、差异度量,以及研发出Wasserstein梯度流。

简单来说:我们手里有一团真实数据云,一团AI生成的数据云。两者之间存在差距。梯度流,就是告诉每一个离散的点,该往哪个方向挪,让两团云慢慢重合。

打开网易新闻 查看精彩图片

结论在于,大名鼎鼎的FD‑Loss、Drifting,不是两套完全无关的算法。它们只是这个通用框架下,选了不同的“分布模型”和“差异度量”。

  • FD‑Loss:分布模型选【单个高斯】,差异度量选【W2最优传输】
  • Drifting:分布模型选【样本核密度KDE】,差异度量选【KL散度】

以前大家把两者当成两套完全独立的手艺。现在一张图纸,把两者全部收纳进来。理论打通之后,中间档位就可以制造出来。

于是,高斯混合模型登场。

不用一个高斯全包,也不用落到每一个样本。我们使用一堆小高斯,拼在一起拟合真实特征。K个组件,各自负责一部分子模式。粒度可以自由调。这就是MGFlow的底座。

到这里会产生一个直觉:只要高斯混合组件变多,模型表达能力变强,问题就该迎刃而解。

但现实给研究组浇了一盆冷水。

仅仅把模型表达能力变强,不够。

当各个子模式分得很开的时候,会出现“分数失明”现象。哪怕AI生成出来,某一类物体数量严重偏少。梯度更新信号会变得微弱。算法看不到这个bug,不会主动把样本补回来。于是依旧模式崩塌。光靠增加组件数量治标不治本。

问题根源不是“描述能力不够”,是样本分配和组件之间缺少硬性约束。

研究团队的解法分成两块。

第一块:LP线性规划质量约束分配。

预先拿真实图片,离线训练一套固定不动的高斯混合。每个小高斯组件,天然占有固定的权重,代表这一类模式本该占多少比例。

训练每一批生成样本的时候,不交给网络自己随便分配样本到各个组件。而是解一个线性规划。强制:分给每个组件的样本总质量,严格等于真实世界该模式的权重。

打个比方:现实世界图片里面,猫占5%。那训练过程,分配给“猫组件”的样本总量就强制锁死5%。不许偷偷缩水。

杜绝“某一类模式悄悄变少消失”。

第二块:配对组件更新。

做完分配之后,不让各个组件自由乱配对。生成的第k个组件,就老老实实对齐真实侧第k个组件。

论文实现了两条分支路线:MGFlow‑W2:基于最优传输W2距离做配对;MGFlow‑KL:基于KL分数场做配对更新。

不要全局笼统的场,要组件对组件的定向修正。再配合分层多分辨率策略,可以同时启用K=1、4、16多种组件配置,粗粒度全局约束和细粒度局部约束一起生效。

还有一处工程细节值得一提。

过去,FD‑Loss损失归一化会跟着当前生成质量动态变化。生成效果烂的时候,难拟合的特征维度权重会被自动压低。

而MGFlow改用真实训练集与验证集之间固定差值作为归一化系数,不给模型摆烂的机会。

打开网易新闻 查看精彩图片

做文生图任务的时候,还有额外巧思:不单单匹配图像特征。把图片特征和文本特征拼接到一起,直接对齐图文联合分布,以此强化提示词和画面的匹配度。

实验测试当中,分成两大块:ImageNet类条件生成,以及基于FLUX.2 4B的文生图。

ImageNet当中,MGFlow‑KL、JiT‑H,对比FD‑Loss基线,分别提升23%、38%。

打开网易新闻 查看精彩图片

有意思的一点:MGFlow‑KL压根没有直接去优化评价指标,但在没有参与训练的编码器特征空间,同样拿到更好分数。

重头戏是FLUX.2 4B文生图。原版FLUX.2‑klein,需要4步迭代。GenEval分数0.794,PickScore21.85。

团队拿MGFlow做后训练,只训练1000步,得到纯一步版本。开启图文联合匹配之后,GenEval冲到0.900,PickScore 21.98。

换句话说,利用新的技术跑后训练,只跑一次的AI生图,效果超过原版四步模型。

这是相当有冲击力的结果。

当然,它不是没有代价,比如组件K不能无限加大,否则计算开销分高,而且统计估计会不稳。所以实际工程中,要在表达能力和计算开销之间做权衡。

而这篇工作的启示在于,很多AI生成领域的进步,并不来自把网络堆得更大。

这篇论文就是典型例子:主干模型完全不变,改动全部落在损失与分布匹配逻辑上。对已经训练完成的生成大模型,做后训练微调,就可以把多步模型改造为高性能一步生成器。

一步生成,不是要彻底干掉迭代式扩散。而是打开另一扇门,意味着低延迟场景、端侧部署、大批量快速渲染,单步推理会拥有巨大实用价值。

过去大家在做分布训练的时候,容易陷入二选一:要么全局大高斯,要么纯样本级核方法。MGFlow在两者中间,踩出一条可行通路。

未来,我们或许会看到越来越多经过类似方案改造的生成模型,一张prompt输入,网络只算一次,高质量图像立刻输出。

所以,AI生图不一定非要几百万的成本,有时候,一步其实就能完成生图任务。