该论文的第一作者和通讯作者均来自北京大学王选计算机研究所,第一作者为博士生蔡鑫豪,通讯作者为博士生导师刘洋。团队近年来在 TPAMI、IJCV、CVPR、ICML 等顶会上有多项代表性成果发表,多次荣获国内外多模态理解与生成竞赛冠军,和国内外知名高校、科研机构广泛开展合作。
本文主要介绍来自该团队的最新论文 Music-to-Dance Generation via Atomic Movements。
该工作聚焦于音乐驱动舞蹈生成任务,首次提出以原子动作作为舞蹈的基本组成单元,建立了具有明确语义和结构的舞蹈表示,并设计了 "动作规划 — 舞蹈生成" 两阶段框架,使生成的舞蹈不仅更加符合音乐节奏和整体编舞逻辑,还具备良好的可解释性和可编辑性,为智能编舞提供了新的研究思路。
目前该工作已被 ECCV 2026 正式接收,相关代码与模型已全部开源。
- 论文标题:Music-to-Dance Generation via Atomic Movements
- 论文链接:https://arxiv.org/abs/2607.13978
- 代码链接:https://github.com/oceanflowlab/AtomicDance
- 项目主页:https://cxhcmhhh.github.io/AtomicDanceProject/
为什么 AI 能跳舞,却不会编舞?
近年来,扩散模型的发展推动了音乐驱动舞蹈生成取得快速进展。输入一段音乐,模型即可生成对应的三维人体舞蹈动作。然而,如果仔细观察真实舞蹈,会发现舞蹈并不是连续动作的简单拼接,而具有明显的结构性。无论是街舞、爵士还是现代舞,一段完整的舞蹈通常都会围绕若干具有明确意义的动作不断展开:某个挥臂动作可能随着不同音乐节拍多次重复;某个转身动作可能不断变化速度、幅度和方向;多个基础动作按照一定顺序不断组合,共同形成完整编舞。
然而,现有主流方法大多将音乐到舞蹈生成视为端到端序列生成问题,直接预测每一帧人体姿态。虽然这种方式能够学习局部节奏对应关系,但无法理解舞蹈背后的结构组织,因此容易导致长时间舞蹈缺乏整体一致性、动作不断重复却缺少变化、很难理解模型为什么会生成某个动作、用户几乎无法编辑已经生成的舞蹈等问题。
因此,AI 是不是应该先学会 "编舞",再学会 "跳舞"?这一问题成为本文工作的出发点。
把舞蹈拆解成 "原子动作"
为此,研究团队提出了一个新的概念 ——Atomic Movement(原子动作)。团队认为,一个真正能够作为编舞基本单元的动作,应满足三个特点:
(1)完整的动作过程,而不是单一姿态。例如,一个踢腿动作不仅包含抬腿瞬间,还包括准备、发力和收腿整个过程,因此能够表达完整动作含义。
(2)能够不断重复,但每次又有所变化。同一个动作可以随着音乐变化速度、方向、幅度和力度,在整支舞蹈中不断重复出现。
(3)具有明确语义。每个动作都能够被自然语言描述,例如 "举起右手"" 双臂展开 ""身体旋转" 等,使动作能够被理解、检索和编辑。
图 1: 从现有舞蹈数据中提取原子动作。
为了自动发现这些原子动作,研究团队设计了一套三阶段构建流程,如图 1 所示:
- 动作分割(Segmentation):如图 1 (1),首先将连续舞蹈划分为完整动作事件,而不是固定长度片段;
- 动作聚类(Clustering):如图 1 (2),利用运动特征发现大量重复出现的基础动作模式;
- LLM 语义重聚类(In-group Re-clustering):如图 1 (3),进一步利用大语言模型分析每个聚类内部的细粒度语义,为原子动作赋予可解释的自然语言标签。
最终,模型获得了一套可重复、可组合、可解释的原子动作,为后续编舞提供了基础。
模拟真实编舞流程:先规划,再完成舞蹈
基于原子动作,团队进一步提出了一种两阶段结构化生成框架,如图 2 所示。
图 2: 完整的方法概览。
第一阶段:动作规划。如图 2 (1),模型首先完整理解整段音乐,并预测各个原子动作的位置、种类、时长。最终形成类似于一份 "舞蹈乐谱" 的高层编舞方案。
第二阶段:舞蹈补全。如图 2 (2),模型根据规划结果,从对应原子动作中选择动作原型,并利用扩散模型生成动作之间的自然衔接,同时对重复动作进行适当变化,使整段舞蹈既保持整体结构,又具有丰富表现力。
这种设计很好地模拟了现实中的创作过程:编舞者负责规划动作结构,舞者负责完成具体表演。相比传统端到端生成方法,模型能够充分利用整段音乐信息,生成更加符合音乐结构、更加连贯自然的舞蹈,同时支持用户直接修改原子动作,实现真正意义上的可编辑生成。
实验结果:生成更加自然、更符合音乐结构的舞蹈
研究团队在 AIST++ 数据集上与当前主流音乐舞蹈生成方法进行了全面比较。
表 1: AtomicDance 的定量实验结果,粗体表示最优表现。
实验结果表明,该方法在舞蹈真实性(FID)、节奏一致性(Beat Alignment Score)以及结构一致性(R-precision)等多个指标上均取得了领先表现。可见,提出的原子动作表示不仅显著提升了长时间舞蹈的整体结构,还使生成结果更加接近真实编舞过程。同时,本研究还进行了消融实验,如表 2 验证了原子动作再创作对舞蹈质量、结构一致性和音乐一致性的有效提升;表 3 验证了原子动作选择时本研究提出的各个策略的性能差异,并证实了根据原子动作长度进行选择的方案总体最优。
表 2: 针对原子动作再创作的消融实验。
表 1: 针对原子动作选择的消融实验。
图 3: 定性结果对比。
此外,定性结果如图 3 和以下的视频进一步验证了本方法相较于现有方法的优越性。
视频链接:https://mp.weixin.qq.com/s/TkBXUyQ_zWFLxPUWROP0VA
从 "生成动作" 迈向 "理解编舞"
相比已有方法主要关注动作生成本身,该工作进一步探索了 AI 是否能够学习人类编舞中的结构规律。通过引入原子动作这一中间表示,模型能够显式学习舞蹈的组成方式,使舞蹈生成从单纯的动作预测发展为具有结构规划能力的编舞过程,也使生成结果具备更好的可解释性、可编辑性以及可控性。
研究团队认为,这一工作为未来数字人表演、智能编舞、人机协同艺术创作等方向提供了新的技术路径,也为结构化动作生成和可解释生成模型研究带来了新的思路。
热门跟贴