打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

做 AI 视频的人,手里都有一本共同的账。

一条十秒的成片,背后可能是几十次生成、筛选和修改。演示视频呈现的是能力上限,生产流程考验的却是可用率和单位成本。创作者不关心某个模型在发布会上跑出了多惊艳的 demo,他们关心的是,生成十次能有几次可用,每一秒成片要花多少钱。

与此同时,视频模型还要继续扩大,这几乎是行业共识。但视频本身包含大量连续画面,一段视频展开成 token,是大量空间 patch 与连续帧的堆叠,再叠加上声音、文本和反复生成,计算开销远高于普通内容模型。参数翻一倍,每一秒视频的成本往往也跟着翻。

Sand.ai 最新发布的 MAGI-2 Preview 出了自己的答案:模型总参数约 114B,单次前向计算只激活约 6B,并且把文本、视频和音频放进同一个 Transformer,画面与声音由同一个模型共同生成。

这不只是纸面参数。在第三方评测机构 Artificial Analysis 的视频生成榜单(Image to Video,含音频)上, MAGI-2 Preview 以 1106 的 Elo 分数排名第六。

打开网易新闻 查看精彩图片

Artificial Analysis 视频生成榜单(Image to Video,含音频): MAGI-2 Preview 排名第六(来源:Artificial Analysis)

这款全球首个千亿开源 MoE 模型,能否让视频模型摆脱「能力越强、每秒越贵」的增长曲线?

打开网易新闻 查看精彩图片

视频生成需要一本新的成本账

当 AI 视频进入规模化生产阶段,行业开始面对一条更现实的约束:模型能力的天花板要继续抬升,扩大规模是必然选择,但每生成一秒视频的成本,不能跟着参数量一起膨胀。

稠密模型的扩展方式很朴素,增加层数、宽度和中间维度。问题在于,每个 token 都要经过全部参数,模型越大,训练和推理成本越高。视频模型又天然拥有很长的序列。一段视频包含大量空间 patch 和连续帧,再叠加音频与文本,每一次计算和通信的代价都被成倍放大。文本模型 scaling 的老路,在视频这里会越走越贵。

Sand.ai 自己就是这条成本的曲线的亲历者。创始人曹越在此前接受采访时回忆,发布音画同出模型 Gaga-1 之后,团队发现「在 Dense 架构下继续 Scale Up,成本会直线上升。视频模型存在一个不可能三角:成本、速度、效果。突破它只能靠研究手段,MoE 就是答案。」2025 年 11 月,Sand.ai 决定把模型架构从稠密转向 MoE,用他的话说,「那个时间点,国内应该几乎没有什么视频公司在全力推进这件事。」

打开网易新闻 查看精彩图片

MAGI-1 的分块自回归生成流程:视频被拆成 24 帧一组的 chunk 逐块生成,长序列是视频模型绕不开的约束(来源:SandAI-org/MAGI-1 GitHub 仓库)

MAGI-2 Preview 的价值,在于它给出了一种新的成本结构:用约 114B 参数容纳能力,每次计算只调用约 6B 参数。庞大的专家池用来学习更丰富的内容、运动和声音模式,稀疏激活则把每次生成实际调用的参数控制在较小范围内。容量与成本解耦,这是一种全新的视频生成生产经济学。

不过,MoE 并不是从语言模型那里搬过来就能用。传统 Expert Parallel 通常先为 token 选出 Top-K 专家,再把 token 复制并发送到专家所在的设备。激活的专家越多,通信量越大,专家负载还会随输入动态变化。到了视频的 token 规模,这些成本很快会成为瓶颈。要跑通这条路,Sand.ai 需要做更多的工作。

打开网易新闻 查看精彩图片

让声音和画面从同一个模型里长出来

MAGI-2 Preview 做的第一个工作,是架构。

它延续了 Sand.ai 在 daVinci-MagiHuman 论文中提出的单流架构:文本、视频和音频被放进同一个上下文,在每一层 self-attention 中直接交互。传统的多流方案则相反,不同模态分别经过各自的主干网络,再通过 cross-attention 或后处理连接起来。前者是从模型内部开始联合处理三种信息,后者是各走各的路,最后再缝合。

这个差别的实际收益,落在音画关系上。单流架构让声音、口型、表情、动作和镜头节奏从生成开始就被共同建模,更适合处理细微的音画对应关系。音画同步这个视频生成的老大难问题,在这里得到的不是后期修补,而是架构级的解法。Google Veo 3 用音画同出惊艳行业时,走的也是类似方向,而 Sand.ai 是除 Veo 3 之外最早拿出音画同出模型的团队。

打开网易新闻 查看精彩图片

daVinci-MagiHuman 的真实生成案例:人物口型、表情与语音由同一个模型同步生成(来源:arXiv:2603.21986 / SandAI GitHub 仓库)

这套思路在今年 3 月已经验证过一次。Sand.ai 与上海创智学院 GAIR 实验室联合开源的 daVinci-MagiHuman,用 150 亿参数的单流 Transformer 联合建模三种模态,在单张 H100 上 2 秒就能生成 5 秒 256p 视频。MAGI-2 Preview 把这条路线从 15B 推到了千亿参数级。

打开网易新闻 查看精彩图片

daVinci-MagiHuman 单流架构:文本、视频、音频进入同一个 Transformer,中间主干层共享参数(来源:arXiv:2603.21986)

细节设计上,模型内部设有共享专家,也为文本、视频和音频保留了各自的专属专家。共享专家处理三种模态的共性,专属专家处理差异,用分工来兼顾统一与特化。统一主干还顺带减少了多套模型串联产生的接口、延迟与维护成本,这对要把模型放进生产线的团队来说,是实打实的工程收益。

打开网易新闻 查看精彩图片

把一个 token 拆成 12 份,交给 3072 个专家

第二个工作,动在 MoE 的路由机制上。

MAGI-2 Preview 受到 Multi-Head LatentMoE and Head Parallel 这项工作的启发,采用了一个此前未被重视的思路:先把隐藏表示拆成多个低维子空间,让每个子空间独立路由;同时把跨设备通信放到动态路由之前,先按 head 分发,再在设备本地选择和执行专家。

这个顺序变化很关键。传统 Expert Parallel 的通信依赖每次路由的 Top-K 结果,激活专家越多,通信量越大。而 Head Parallel 的主要通信量只取决于输入表示本身,不再随激活专家数线性增长。第一章提到的通信瓶颈,正是被这个顺序调换拆解掉的。对长序列视频而言,这为扩大专家数量、提高路由粒度留出了空间。

更深一层的变化,是 MoE 的路由对象变了。传统 MoE 为一个 token 的完整隐藏表示选择一组专家,相当于要求少数专家同时理解这个 token 的所有特征。Multi-Head MoE 则把同一个 token 分解到多个表示子空间:有的子空间偏向动作与时序,有的处理人物外观,有的关注声音或语义。不同 head 独立选择专家之后,模型获得的不只是更多专家,而是一种可以组合的能力结构。

打开网易新闻 查看精彩图片

从标准 MLP、标准 MoE、LatentMoE 到 Multi-Head LatentMoE 的结构演进:同一个 token 被拆到多个子空间,各自独立路由(来源:arXiv:2602.04870)

落到数字上,这种形态的粒度相当惊人。MAGI-2 Preview 把 3072 维隐藏表示拆成 12 个 256 维 head,在 36 层主体网络中使用 Multi-Head MoE。每个 MoE 层包含 12 个 head,每个 head 各有 256 个专家,一层共有 3072 个独立的 head-local 专家单元。每个 token 在每个 head 内选择 6 个专家,合计激活 72 个小专家。单个 token 的理论选择空间是 C(256,6)^12。Sand.ai 把这种形态称为 Ultra-fine-grained MoE。

放到行业坐标系里看,DeepSeek-V4-Pro 的公开配置是每层 384 个 routed experts 选 6 个,Kimi K3 是 896 选 16。当然,两边专家的定义、大小和任务都不同,直接比数量没有意义。真正重要的是,Multi-Head 路由和 Head Parallel,让如此细的专家划分在视频模型上变得可训练、可扩展。

打开网易新闻 查看精彩图片

千亿参数能跑起来,靠的是水面下的 infra

模型能否真正跑起来,取决于结构,也取决于底层系统。

数千个细粒度专家,意味着更频繁的路由、数据重排和小矩阵计算。如果仍然依赖通用 MoE 实现,新增的模型容量很容易被通信和调度开销抵消,账算到最后还是亏的。

Sand.ai 为此自研了一整套基础设施。高性能 MoE kernel 库 MagiMoE 覆盖路由、专家排序和专家计算的完整链路,把原本分散的步骤合并执行,减少中间结果和显存搬运,并针对 Multi-Head MoE 的计算形态优化前向与反向过程。MAGI-2 Preview 当前采用其中经过大规模训练验证的 Triton/BF16 路径,同时为不同硬件和后续迭代保留了低精度优化空间。

分布式层面,Head Parallel 在路由发生前就按 head 分配计算。设备间传输的是形状固定的 head 表示,而不是路由后数量不断变化的专家 token。这既降低了 Top-K 对通信量的影响,也让跨设备流量更稳定、更容易优化。张量并行、上下文并行、专家并行和参数切分,则共同承担其余主干与参数的扩展。

打开网易新闻 查看精彩图片

Head Parallel 与传统 Expert Parallel 的对比:无论激活专家数 k 如何增长,HP 的延迟和显存占用几乎保持平稳,而 EP 随 k 线性上升(来源:arXiv:2602.04870)

训练优化上,MAGI-2 Preview 使用 Sand.ai 的分布式 MagiMuon。它保留 Muon 处理主体矩阵参数的优势,同时以 AdamW 处理更适合常规更新的参数,并针对海量细粒度专家重新适配了参数组织和跨设备计算。这种混合设计,让优化方法能够从中小规模实验稳定扩展到千亿参数 MoE,而不必用同一种更新方式处理性质不同的参数。

正如 Sand.ai 此前在博客中写的,视频模型的 scaling 从来不只是增加参数,通信效率、计算效率、数值稳定性和训练监控必须一起解决。MAGI-2 Preview 的价值,也正在于模型设计与系统能力,在同一次规模化训练中得到了验证。

打开网易新闻 查看精彩图片

数据不是越干净越好

模型规模扩大之后,数据管线的目标也要跟着变。

过去行业习惯把「数据质量」等同于层层过滤,最终得到一个更小、更整齐的数据集。但对生成模型而言,过度清洗可能恰好移除了最重要的东西:复杂运动、特殊镜头、罕见主体、非典型声音,以及长尾组合。模型对真实世界多样性的覆盖,就是在这一次次「优化」中被削平的。

Sand.ai 的选择是把数据工作的重点从「删减」转向「组织」:尽可能保留更广泛的有效数据,通过更准确、细粒度的标注,让模型能够理解主体、动作、场景、镜头、时序,以及音频与文本之间的对应关系。尽可能保留数据的多样性,比追求一个狭窄的「完美数据集」,更符合 scaling 阶段的需求。

预训练与后训练的分工,也随之被重新定义。预训练负责尽可能完整地覆盖数据分布,后训练则聚焦于偏好对齐、可控性、安全性与产品适配。基础模型在预训练阶段学到的能力越完整,产品端依赖后处理去修补运动一致性、细节表现和组合能力的需求就越少。

到这里,MAGI-2 Preview 的完整逻辑浮出了水面:更大的专家容量需要更丰富的数据来填充,更精细的标注来组织,也需要更高效的 infra 来支撑训练与计算。模型、数据、系统的协同扩展,才是完整的 scaling。只放大其中任何一项,参数规模都无法稳定转化为真实的生成能力。

打开网易新闻 查看精彩图片

结尾:Preview 证明的是一条路,不是一个点

MAGI-2 Preview 是 Sand.ai 算法创新和工程创新的双重证明,但它证明的不是一个孤立的、更大的 checkpoint。

单流音视频架构、Ultra-fine-grained MoE、MagiMoE、Head Parallel、MagiMuon 和数据体系,已经连成一条相互支撑的 scaling 路线。后续模型可以沿着这条路线继续扩大参数与数据规模,探索更长的生成时长,而无需每次从头搭建训练系统。对一家创业公司来说,这种「不用重来」的能力,可能比任何单点技术都值钱。

坦诚的部分也应该被看见。按照技术报告自己的说法,正式版发布时,还需要进一步补充生成质量、音画同步、长时一致性、训练吞吐和单位生成成本等数据,并通过产品使用与商业数据,来说明这些技术能力如何转化为真实价值。架构和系统给出的只是第一层答案:千亿参数级统一音视频 MoE 可以训练,可以扩展,成本结构允许「能力越强、每秒越贵」的曲线被打破。

剩下的答案,要回到生产流程里去检验。当模型开始进入生产线,产品经理和系统工程师第一次坐到了同一张成本表前。视频生成的下半场,比的可能不是谁的 demo 更惊艳,而是谁能把每一条被反复生成、筛选、修改的十秒视频,算成一门成立的生意。

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片