8 月 5 日,Sand.ai 发布并开源 MAGI-2 Preview。这是一款统一音视频生成模型:文本、视频和音频进入同一个 Transformer,画面和声音由同一套主干共同生成。模型总参数约 114B,每次生成激活约 6B,这是全球首个开源千亿级 MoE 视频生成模型。
2025 年 4 月,Sand.ai 曾开源 24B 参数的自回归视频模型 MAGI-1。时隔一年多,这家公司再次把主力视频生成模型带入开源体系,参数规模从 240 亿扩大至 1,140 亿。
过去两年,开源视频生成模型的参数规模大多停在十几 B 以内,最大的也不过二三十 B。语言模型那边,开源模型早就进入了几千亿甚至万亿参数,靠的都是 MoE。
虽然说两类模型面对的任务不同,参数规模不能直接代表能力高低,但这组差距仍然说明,视频模型扩展规模要付出更高的计算和通信代价。视频模型的参数规模长期停留在这一水平,也主要受制于这两项成本。MAGI-2 Preview 将总参数推至 114B,尝试解决的正是这个问题。
视频模型为什么一直做不大?
视频的序列远比文本长,模型生成视频,需要把画面切分成大量空间 patch。一帧画面对应一批 token,连续数秒的视频再叠加文本与音频,最终形成的序列远长于普通语言任务。分辨率、帧率和生成时长中的任何一项增加,都会进一步推高 token 数量。
稠密模型中,每个 token 都要经过全部参数。模型参数增加,单个 token 的计算量也会同步上升;再乘上视频的超长序列,训练和推理成本很快变得难以承受。在语言模型中可行的参数扩张方式,移到视频任务上,往往先撞上成本与效率的限制。2026 年 3 月 OpenAI 停止运营 Sora,其背后很大一部分原因就在于:以当时的架构和推理成本,大规模商用几乎不具备经济上的可行性。
语言模型缓解这一问题,依靠的是混合专家模型(Mixture of Experts,MoE)。模型保留一个庞大的专家池,每个 token 只激活其中一小部分,由此把总体容量和单次计算拆开。模型可以继续增加参数,拓展能力上限,但每次推理不必调用全部权重。
把这套方法移到视频模型上,困难主要出现在通信环节。
传统专家并行(Expert Parallel)会先为每个 token 选出需要调用的专家,再把 token 发送到专家所在的 GPU。激活的专家越多、序列越长,设备之间需要搬运的数据也越多;专家负载还会随着输入内容变化,导致不同设备承担的计算量不断波动。
在文本序列中,这套机制尚可运转。但换成视频的 token 规模,跨卡通信就很容易抵消稀疏计算节省下来的算力。视频模型因此需要的不只是 MoE 架构,还包括一套专门为长序列和高频路由设计的分布式系统。
114B 的容量,6B 的激活参数
MAGI-2 Preview 的解法分两步,第一步是把专家切得更细。
传统 MoE 通常为一个 token 的完整隐藏表示选择专家。MAGI-2 Preview 则先把 3,072 维隐藏表示拆成 12 个 256 维子空间,每个子空间称为一个 head。每个 head 拥有 256 个专家,并从中选出 6 个。
由此计算,一层网络包含 3,072 个相互独立的小专家,每个 token 在每层合计激活 72 个。放到整个模型中,MAGI-2 Preview 拥有约 114B 总参数,每次生成实际激活约 6B。
作为参照,DeepSeek-V4-Pro-Preview 每层设置 384 个路由专家,每个 token 选择 6 个;Kimi K3 设置 896 个专家,每个 token 选择 16 个。
大语言模型对“专家”的定义,以及面向的维度和任务与视频模型并不相同,数量不能直接换算成能力。两者对比更能说明的是路由粒度:MAGI-2 Preview 将一个 token 拆进多个低维子空间,让动作、外观、声音和语义分别寻找适合的专家,再把不同专家的输出组合起来。
Sand.ai 将这种结构称为 Ultra-fine-grained MoE。更细的专家分工扩大了能力组合空间,也为统一音视频生成提供了基础。
MAGI-2 Preview 将文本、视频和音频放在同一个上下文中处理。模型内部既有三种模态共享的专家,也有各自的专属专家。声音、口型、表情、动作和镜头节奏从生成开始便相互影响,减少了先生成画面、再串联声音模型所产生的接口和对齐问题。
专家增加到数千个后,传统调度方式很快触及效率上限。对此,Sand.ai 引入了 Head Parallel,改变通信与路由的顺序。
传统 Expert Parallel 先路由、再通信;Head Parallel 先按照 head 分发 token 表示,再由设备在本地完成专家选择和计算。由于分发的数据形状固定,主要通信量只取决于输入表示,不再随激活专家数量线性增长,设备之间的负载也更稳定。
这套机制让 MAGI-2 Preview 能够把专家划分得更细,同时避免通信成本吞掉稀疏计算带来的收益。3,072 个专家能够真正协同工作,前提正在于此。
图丨分层 Head Parallel 架构(来源:Sand.ai)
架构之外,还需要一整套工程系统支撑。
数千个小专家意味着高频路由、反复的数据重排和大量小矩阵计算。通用 MoE 很难在这种负载下保持足够高的硬件利用率。Sand.ai 为此开发了计算内核库 MagiMoE,将路由、排序和专家计算合并执行,减少中间结果与显存搬运。
训练部分由分布式优化器 MagiMuon 支撑。它使用 Muon 处理主体矩阵参数,用 AdamW 更新其余参数,并针对大量细粒度专家重新设计参数组织和跨设备计算方式,使训练能够稳定扩展到千亿参数规模。
专家划分越细,数据也越需要支撑这种分工。Sand.ai 没有把“高质量数据”简单理解为反复过滤,团队希望尽可能保留复杂动作、少见主体、特殊镜头、非典型声音和长尾组合,再通过更准确的标注组织这些数据。这样能让模型更好地模型理解主体、动作、场景、镜头、时序,以及声音、画面和文本之间的关系。
模型、系统和数据由此连在一起。对于视频生成,扩大参数已经不再是单纯的算法问题,模型架构、计算内核、分布式训练和数据管线需要同时变化。
这套改造最终要落到生成成本上。根据 Sand.ai 团队提供的内部测算,在 8 卡 H100、按照当前月租价格折算的条件下,不同推理配置生成一段 10 秒视频的成本约 0.5 元(蒸馏后的模型)。按团队口径,折算到每秒,价格约为行业主流模型的十分之一。
视频生成通常按时长计价。单位成本如果下降一个数量级,批量生成素材、多版本迭代等过去不够经济的用法,才可能进入常规生产流程。
生成效果则有第三方榜单可以对照。在 Artificial Analysis 的图生视频(image-to-video)榜单上,MAGI-2 Preview 排在第 6 位。一个激活参数仅 6B 的开源模型,生成效果已经进入当前视频生成的第一梯队。
作为预览版,MAGI-2 Preview 与最顶尖模型仍有差距,Sand.ai 对此并不讳言;对一家资源远少于大厂的创业公司而言,这个结果证明的是另一件事:把功夫花在架构和系统上,同样的卡可以换出更多的生成能力。按团队的说法,正式版会沿着这套已经跑通的架构继续扩大参数和数据规模,探索更长时长的视频生成,进一步提升生成质量、音画同步和长时一致性,并持续降低单位生成成本。
开源改变的是参与边界
这次发布的另一个重点,是开源本身。过去,千亿级视频模型如何设计架构、保持稳定训练,关键细节大多留在闭源公司的内部系统中。
而 MAGI-2 Preview 提供了一个可供拆解和验证的对象。研究机构可以观察细粒度专家如何分工,路由是否会随着人物、动作和声音变化。推理框架与芯片厂商也获得了一种新的公开工作负载:数千个细粒度专家带来的高频路由、数据重排和大量小矩阵计算,需要新的内核、通信策略和硬件适配。
更下游的变化发生在企业侧。影视、广告、游戏和电商企业掌握大量专有素材,其中一部分受到保密、版权和合规要求限制,不适合直接发送给外部 API。开放权重让模型进入企业自己的计算环境成为可能,企业也可以围绕特定人物、商品和镜头语言继续训练。
应用公司同样多了一个选择。调用闭源 API 时,成本、并发、接口能力和产品节奏主要由模型厂商决定;有了开源模型,应用公司可以在外部 API、本地部署和定制模型之间重新计算成本。
114B 模型当然不是下载后便能轻松运行的工具。部署依然需要一定的硬件、通信、工程和运维门槛。它改变的是参与边界:过去主要由头部模型公司掌握的千亿级视频模型,如今开始进入研究机构、基础设施团队和行业企业的视野。
语言模型已经提供了一条可供参照的路径。开源模型不需要在每一项能力上都超过最强的闭源模型;只要进入可用区间,企业就会开始比较部署成本、数据控制、定制空间和供应商风险,闭源厂商也会面临降低价格、开放更多能力的压力。
视频生成可能形成相近的格局。闭源模型继续在产品体验、服务稳定性和商业支持上保持优势,开源模型则提供部署和改造的空间。双方的竞争会从生成质量延伸到价格、数据和开发工具,性能天花板很难再单独决定胜负。
过去两年,视频模型比较的是画面是否逼真、动作是否自然。接下来,决定行业走向的问题会更多地出现在画面之外:一段视频以什么成本生成,模型由谁控制,规模能否继续扩大。
MAGI-2 Preview 不会立即改写视频模型的排名。它带来的变化,是让这些问题第一次有了一个千亿参数级的公开样本,可以由更多人拆解、验证。
参考资料:
1.https://sand.ai/blog/magi-2-preview
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
热门跟贴