阿里巴巴、人大、清华联手打造"舞蹈AI导演"
阿里巴巴等机构研发的MACE-Dance系统,用户通过一张照片和一段音乐即可自动生成流畅逼真的舞蹈视频。系统分为两步:运动专家根据音乐生成三维舞蹈动作,外观专家将动作渲染到人物图像上。该方法解决了音画同步与画面稳定等难题,评测效果领先,支持动作编辑与多舞蹈风格,为个性化视频创。

想用AI生成一段自己跳舞的视频,这事儿听起来简单,做起来却处处是坑。最近,一项由阿里巴巴AMAP、中国人民大学、清华大学、武汉大学及Malou Tech公司联合完成的研究,提出了一个名为MACE-Dance的新系统,试图把这事儿彻底理顺。相关论文以预印本形式发布于arXiv(编号arXiv:2512.18181),并计划发表于ACM期刊。
这项研究的核心目标很明确:用户只需提供一张自己的照片和一段音乐,AI就能自动“编舞”并“表演”,生成一段动作流畅、人物逼真的舞蹈视频。这背后的挑战可不小,舞蹈动作既要符合人体规律、踩准音乐节拍,生成的视频还得保证人物不“变脸”、画面不抖动。现有的技术往往顾此失彼,要么只能生成干巴巴的3D骨架,要么生成的视频动作僵硬、面部模糊。
MACE-Dance的解法很聪明:它不追求用一个“全能模型”一步到位,而是把任务拆成两段“专业接力”。第一棒,由“运动专家”根据音乐生成标准的三维舞蹈动作;第二棒,由“外观专家”将这些动作“穿”到参考图片的人物身上,渲染成最终视频。这种分工协作的思路,成了破解难题的关键。
一、为什么要把一件事拆成两步来做
你可能会问,现在端到端的模型这么流行,为什么非要拆开?原因在于,从音乐直接生成像素视频,本质上要求模型同时掌握两种截然不同的能力:理解音乐并转化为合理动作,以及将动作逼真地渲染出来。强行让一个模型学习,它很容易“偷懒”,找到一些错误的关联——比如把某种背景颜色和音乐风格绑定起来,导致生成结果莫名其妙。
研究团队在尝试调整现有模型时,就观察到了这种“走捷径”的现象。因此,他们引入了一个清晰的“中间语言”——三维人体运动参数(SMPL格式)。这好比导演先写好详细的分镜脚本,明确每一帧的演员姿态,再把拍摄和后期特效交给不同的专业团队。相比于常用的二维关键点,三维参数保留了完整的空间和深度信息,不受视角和遮挡的影响,为后续的视频生成提供了稳定得多的“蓝图”。实验也证实,使用三维中间表示后,各项指标均有提升。
二、第一棒:懂音乐的“编舞专家”
负责“编舞”的Motion Expert,其核心是一个经过精心设计的扩散模型。简单理解,就是先给真实的舞蹈动作数据加噪声,直到变成乱码,再训练一个神经网络学会在音乐的引导下,一步步把噪声去掉,还原出与音乐匹配的动作。
这个网络的结构颇有巧思。它融合了两种组件:双向Mamba(BiMamba)和Transformer的跨模态注意力。BiMamba擅长处理连续序列,能记住前后的时间信息,确保动作短时流畅;而跨模态注意力则让每一帧动作都能“参考”整段音乐的全局风格和情感走向。两者分工,一个管局部连贯,一个管整体协调。
更重要的是,它采用整体生成而非逐帧生成,避免了误差累积导致的“动作漂移”问题,效率也极高,在标准测试集上每秒可生成770帧。
在训练策略上,团队用“无引导训练”(GFT)替代了传统的“无分类器引导”(CFG)。传统方法推理时需要运行两次模型,效率减半。GFT则直接在训练时融入一个可调节的“质量控制旋钮”(β参数),推理时只需运行一次,通过调节β就能在动作多样性和对训练数据的忠实度之间取得平衡。这不仅节省了近一半计算时间,效果也更稳定。
三、第二棒:让“画面”和“动作”完美融合的视觉专家
动作序列有了,如何让它生动地呈现在视频里?这就是Appearance Expert的任务。研究团队选择在强大的Wan-Animate基础模型上进行改造,但并非简单微调,而是设计了一个两阶段的专门化策略。
首先,需要一个衔接步骤:将三维SMPL参数转化为Wan-Animate能理解的二维关键点。这里通过渲染和关键点检测来实现,既保留了三维信息的优势,又适配了下游模型。
第一阶段是“运动学阶段”。舞蹈动作幅度大、全身协调要求高,而原模型更关注人脸。团队只训练一个专门的“身体适配器”,精确增强身体运动信号的权重,而不改动模型其他部分,确保了动作控制的准确性。
第二阶段是“美学阶段”。在动作准确的基础上,再通过插入轻量级的LoRA适配器,专门优化视频的视觉质量,比如皮肤纹理、服装稳定性、对复杂镜头运动的处理等。这两个阶段依次进行,互不干扰,缺一不可。消融实验表明,缺少任一阶段,视频质量都会显著下降。
四、专为这项任务打造的数据集和评测体系
新任务需要新的标尺。为此,团队构建了MA-Data数据集,包含约7万段视频,总时长116小时,涵盖20多种舞蹈风格。数据来源兼顾了专业性与真实性:一部分来自专业舞者的三维动作数据(渲染风格),另一部分来自抖音、YouTube等平台的真实视频(视觉效果自然)。
评测体系也分为“运动”和“外观”两个维度。运动维度从人体运动学角度评估动作质量、多样性及与音乐的同步性;外观维度则借用现有视频生成基准,评估画面质量、一致性、平滑度等。这套双维度协议能更全面地衡量系统的综合能力。
五、实验结果:三项任务全面领先
在三维舞蹈生成、姿态驱动图像动画、以及最终的音乐驱动舞蹈视频生成这三项任务上,MACE-Dance均取得了当前最优的结果。
特别是在最终任务上,无论是与“三维生成+视频渲染”的串联方法比,还是与直接进行视频生成的端到端方法比,MACE-Dance在绝大多数运动和外指标上都排名第一。即便与参数量更大的通用视频大模型相比,MACE-Dance也在人物一致性、动作质量等核心维度上表现更优,实现了专业性与效率的平衡。
六、用户研究和评测有效性验证
量化指标好,真人看着是否也觉得好?团队邀请了40位有舞蹈背景的参与者进行盲测。在舞蹈同步性、质量、创意、画面一致性等六个维度上,MACE-Dance生成的视频均获得了最高的偏好比例,这证实了其技术优势能转化为真实的用户体验。
七、Motion Expert还能做什么:运动编辑功能
除了从头生成,Motion Expert还支持灵活的“运动编辑”。通过类似图像修复的“蒙版去噪”机制,用户可以在推理时对已有动作进行局部修改,例如补全中间段落、固定上半身重编下半身、或指定移动轨迹生成舞蹈,而无需重新训练模型。这大大拓展了其应用灵活性。
由于输出是标准的三维运动参数,这套系统也能轻松接入现有的动画制作、游戏或VR流程,实用性很强。
八、长序列生成与跨风格泛化
系统在跨风格泛化上表现如何?可视化结果显示,对于维吾尔族舞、敦煌舞、K-Pop等差异巨大的风格,模型都能捕捉到其核心运动特征,生成风格鲜明的动作。
面对更实际的分钟级长视频生成挑战,MACE-Dance通过BiMamba模型的长序列外推能力,以及视频渲染时的“接力渲染”策略(同时参考全局姿态、上一帧画面和原始参考图),有效防止了人物“变脸”或背景“漂移”,生成了连贯的长序列。
说到底,MACE-Dance的成功在于化繁为简:通过任务拆解,让两个“专家”各司其职,再用一个标准化的三维动作接口将它们串联起来。这为普通人创作个性化舞蹈视频打开了新的可能,当然,随之而来的深度伪造等伦理问题,也需要业界持续关注和应对。
Q&A
Q1:MACE-Dance生成舞蹈视频需要提供什么输入?
只需要一张参考人物图片和一段音乐。系统会全自动完成编舞和渲染,无需用户设计动作。
Q2:MACE-Dance使用的三维运动参数和普通的姿态骨架有什么区别?
普通二维骨架会丢失深度信息,且受遮挡影响大。三维SMPL参数保留了完整的空间信息,不受视角限制,为视频生成提供了更稳定、高质量的“动作蓝图”。
Q3:MACE-Dance支持对已有舞蹈动作进行修改吗?
支持。其Motion Expert模块内置编辑功能,可进行时序补全、局部关节编辑或轨迹引导编辑,无需重新训练模型。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















