这项由阿里巴巴Qwen团队完成的研究发表于2026年7月,论文以技术报告形式公开,编号为arXiv:2607.11699,有兴趣深入了解的读者可通过该编号查询完整论文。
你有没有过这样的经历:脑子里隐约有一段旋律,或者特别想要一首符合某个心情的歌,却苦于不会乐器、不懂作曲,只能干着急?又或者你特别喜欢某首老歌的旋律,却觉得原来的演唱风格不合胃口,想要一个更清新的、更摇滚的版本?这两个听起来颇为奢侈的愿望,Qwen团队推出的Qwen-Music或许正在把它们变成现实。
Qwen-Music是一个大规模音乐生成系统,核心能力有两项:一是根据文字描述、歌词和音乐属性从零创作完整歌曲,二是接收一首参考歌曲后,以不同的风格和声线重新演绎这首歌,也就是翻唱生成。更难得的是,这套系统在专业人士的盲听测试中,击败了MiniMax Music 2.6、MiniMax Music 2.5+、Mureka V8和Suno V5等商业领先产品,与Suno V5.5持平。在外部权威排行榜Artificial Analysis Music with Vocals Leaderboard上,Qwen-Music以"JazzCat"的化名参与评测,在英文演唱音乐生成领域名列第三。
要理解这件事的难度,不妨把创作一首完整歌曲比作烹饪一道复杂的宴席菜。你不仅要选好食材(确定歌词、旋律和风格),还要掌握火候(节奏和动态),考虑摆盘(混音和立体声),并且让整道菜从头到尾保持风味统一(歌曲结构的连贯性),更关键的是,宴席往往长达数分钟,每一口味道都不能走样。过去的AI音乐系统要么只会短片段,要么缺乏演唱声线,要么生成的音频质量粗糙,Qwen-Music试图在这些方面同时突破。
一、从声音到"语言":给音乐找一种AI能读懂的文字
要让AI创作音乐,首先得解决一个根本问题:AI最擅长处理的是文字序列,而音乐是随时间流动的连续声波。怎么架桥?答案是把音乐也变成类似文字的"符号序列"。
Qwen-Music-Tokenizer承担的就是这个转换工作。把它理解成一位速记员:一段几分钟的歌曲经过它的处理,会被压缩成一串以每秒25个符号速度排列的整数序列,每个符号被称为"音乐语义令牌"(Music Semantic Token)。这个速率意味着每隔40毫秒记录一个符号,就像把一部电影每隔一小段截一帧缩略图,既保留了内容骨架,又大幅减少了数据量。
这位速记员本身的训练经历了四个阶段,每个阶段都在为下一阶段铺路。第一阶段是"自学":用BestRQ这种自监督学习方法,让模型随机遮住音频的某些片段,然后猜被遮住的内容是什么,就像做完形填空题一样。目标答案由一个固定随机编码器给出,不需要人工标注,整个阶段使用双向注意力机制,也就是模型在猜测时可以参考前后的上下文。
第二阶段叫做"因果适应":在第一阶段的基础上,把双向注意力改为单向的因果注意力,也就是只看左边(过去)、不看右边(未来)。为什么要这么做?因为后续的音乐生成模型是自回归的,像打字机一样从左到右逐字生成,训练时必须模拟这种"只有过去没有未来"的条件。与其从头训练一个单向模型,不如直接在已训练好的双向模型上微调,这样既省计算资源,又保留了已学到的音乐知识。
第三阶段叫做"多任务监督微调":在速记员的工作台上同时接了三个评分器——一个检查歌词是否被正确记录(利用CTC损失做歌词转录),一个检查旋律轮廓是否被保留(梅尔频谱重建),一个检查和声信息是否在场(色度特征重建)。这三个评分器同时给分,倒逼速记员记录的符号必须同时携带语义、旋律和和声信息,而不仅仅是抽象的音频特征。这个阶段还去掉了遮掩操作,让模型看完整音频,并且对整首歌(最长300秒)进行学习,而非短片段。
第四阶段是真正引入"字符表":插入一个向量量化(VQ)瓶颈层,把连续的特征向量强制映射到一本包含32768个条目的码本上,每个条目就是一个整数编号,最终产出的就是那串25Hz的整数序列。为了防止突然插入量化层导致训练不稳定,研究者设计了一个平滑过渡机制:先把量化后的特征和未量化的特征按一定比例混合,随训练进行逐渐把比例调向全量化,同时冻结底层参数只训练量化器和上层,之后再逐步解冻整个网络。最终这套码本的利用率超过99%,几乎每个"字符"都被用上,没有浪费。
二、AI作曲家如何先打草稿再下笔:旋律先行的思考链
有了音乐的"文字"表示,下一步就是训练一个AI作曲家,能根据用户的文字描述和歌词,生成这串符号序列。这个作曲家叫做Qwen-Music-LLM,以一个30亿参数的语言模型(Qwen3.5-Omni的密集变体)为基础进行训练。
这里存在一个很微妙的挑战。当用户说"给我写一首温暖的民谣,歌词是关于雨天的思念",这句话确定了风格和情感,却对旋律本身没有任何约束。AI必须同时决定旋律走向、伴奏编排、段落结构,以及如何把这一切组合成几千个符号。这就像让一个厨师在没有菜谱的情况下,从选材到装盘一气呵成创作一道全新的菜——难度相当高,且容易出现前后不一致的问题。
研究团队的解决方案叫做Melody-CoT,即"旋律思维链"。这个机制的灵感来自大语言模型里常用的链式推理(Chain-of-Thought):先让模型写出推理过程,再给出最终答案,推理过程本身会引导答案更准确。对应到音乐生成,就是先让模型生成一段旋律草稿,再根据这份草稿生成完整的音乐符号序列。这就好像作曲家在正式谱曲之前,先用口哨哼出旋律的大致走向,心里有底了再落笔。
旋律草稿的表示方式经过精心设计,核心是一个叫做旋律令牌(Melody Token)的东西。研究者先用RMVPE算法从音频中提取50Hz的人声音高曲线,然后以8倍降采样将其压缩至6.25Hz的序列。降采样的好处是过滤掉颤音、装饰音等演唱细节,保留的是旋律的骨架轮廓。更重要的是,音高值被转换为相对MIDI表示:把所有有声帧的MIDI音高中位数作为基准,每个帧的值都减去这个基准,得到相对半音偏移量,映射到0到255的256个整数中(255代表无声帧)。这样做的目的是抹去绝对音域和调性信息,让旋律条件只传递"形状",而不泄露原唱的音域或者歌曲的调。
在训练时,模型会接触三种序列模式的混合。纯文本转音乐模式直接从标签和歌词生成音乐符号序列;段落级旋律模式在音乐符号序列之前插入每个有歌词段落的旋律令牌,每段旋律前标注段落标签(比如[verse]或[chorus]);独特段落级旋律模式则更进一步,当一首歌有多个副歌时,不是把每个副歌的旋律都写出来,而是只随机选取一个作为代表。这种设计有三重好处:缩短了旋律草稿的长度、提高了训练数据的多样性,以及鼓励模型把旋律理解为可复用的创作素材而非逐帧复制的模板。
对于翻唱生成场景,旋律令牌从参考歌曲中提取后,连同目标风格标签和目标歌词一起作为前缀输入模型,模型则在遵循旋律轮廓的前提下,按照目标标签生成新的音乐符号序列。通过统一的Melody-CoT机制,原创生成和翻唱生成在同一个模型中实现,不需要两套不同的系统。
三、从符号草稿到立体声波:渲染器的三道工序
音乐语义符号序列只是一份粗略的乐谱草稿,要让它变成能放入耳机里聆听的高保真立体声音频,还需要Qwen-Music-Render的三道工序。打个比方,这就像把一张粗略的建筑蓝图,最终建成可以入住的精装房屋。
第一道工序是扩散变换器(Diffusion Transformer,DiT)。这是一个13亿参数的神经网络,输入是充满噪声的连续潜在向量,经过多步去噪后输出干净的潜在表示。网络由32个变换器块组成,每块包含自注意力层、交叉注意力层和前馈层,全部由扩散时间步长参数调制。关键在于,这个模型同时接收两类条件信息:一是语言模型生成的音乐语义符号序列,帧对齐地嵌入输入;二是重写后的文字条件,包括音乐标签(如"女声、温暖、民谣、吉他和钢琴")和歌词。文字条件通过一个冻结的Qwen3-Embedding-0.6B文本编码器提取特征,再通过交叉注意力注入每个变换器块。
在推理时,DiT使用分类器自由引导(CFG)技术:同时运行有条件和无条件两路,最终输出是两者的加权组合,可以在生成质量和多样性之间调节平衡。研究发现,最优策略是在无条件路径中只去掉文字条件,而保留音乐语义符号序列,这样音乐结构由符号序列主导,文字条件则作为补充的语义引导,比两者都去掉或者只去掉符号序列效果更好。
第二道工序是Spec-VAE解码器。这是一个频谱域的变分自编码器,将DiT输出的潜在向量解码回复杂频谱(即STFT的实部和虚部)。编码器将48kHz立体声音频的复数频谱压缩成128维的25Hz潜在向量,压缩比高达192倍;解码器做逆变换,从潜在向量重建复数频谱,再经过逆短时傅里叶变换(iSTFT)得到波形。
在这个解码器里,研究者还引入了一个新颖的激活函数叫做Spec-SnakeBeta。它脱胎于BigVGAN中使用的SnakeBeta激活函数,不同之处在于把参数从按通道定义改为按频率轴定义。每个频率槽对应一个固定的物理频率,因此可以为不同频率设计不同的非线性特性。初始化时,参数按对数频率先验设置,让高频区域具有更强的周期性调制能力,模型再在此基础上学习调整。实验显示,学习后的参数在0到5kHz的低中频区间偏离初始值最大,说明这个频段最需要定制化的非线性处理。
第三道工序是波段模式精修器(Band-Mode Refiner)。这是一个轻量级的ConvNeXt-1D模块,附加在解码器输出之后,专门修复解码器留下的频谱残差误差。精修器对不同频段采用不同的修正策略:低频段只修正相位,中频段同时修正幅度和相位,高频段只修正幅度。这种设计的依据是不同频段的误差模式不同,分开处理更有针对性。为了保证训练稳定,精修器的初始权重全部设为零,这意味着在训练开始时,精修器的输出和解码器完全一致,随训练逐步发挥作用,不会破坏解码器已经学到的能力。
整个渲染器的训练也分三个阶段:先做纯重建的Spec-VAE预训练,再引入波形域对抗训练(加入多尺度STFT判别器和CQT判别器提供反馈),最后冻结Spec-VAE编解码器,专门训练精修器(同时加入频谱域判别器)。这种渐进式训练策略在192倍压缩率的高难度条件下维持了训练稳定性。
四、超过五百万小时的"听歌自学":如何训练一个懂音乐的AI
有了架构,还需要数据和训练策略。Qwen-Music-LLM的训练数据超过500万小时的多语言音乐,覆盖数百种语言。如何从这座庞大而质量参差不齐的音乐山脉中提炼出一个高水准的生成模型,是训练设计的核心问题。
研究团队的策略是质量分级预训练课程。他们首先训练了一个内部评分模型(基于平均意见分,即MOS),由具有专业音乐背景的人工评分员标注训练数据,模型学会预测每首歌的整体音乐质量。然后,在每个音乐类型内部,按评分百分位把数据分成七个质量桶(Q1到Q7),其中Q1是顶尖的10%,Q7是最末的1%。去掉Q7之后,用Q1到Q6六个档次的数据分三个阶段训练。
第一阶段使用Q3到Q6的数据,也就是中等偏下质量的大量数据。目标是让模型先学会从文字条件映射到音乐符号序列的基本能力,建立对各种风格、语言和伴奏形式的广泛认知。训练过程中采用动态质量采样策略:开始时多用低质量数据,随训练进行逐渐增加高质量数据的比例,就像学徒先从最基础的大量案例中积累经验,再逐步接触精品。
第二阶段使用Q2数据配合学习率衰减,这是一个质量整合阶段。经过第一阶段的广泛学习后,模型开始在更稳定、更高质量的数据上巩固,改善音乐结构的连贯性,同时减少低质量数据引入的噪声。
第三阶段专注于Q1顶级数据,并从全库中精选高质量样本补充。这个阶段进一步提升可控性和指令遵循能力,同时保持各类型和语言的均衡,避免模型只在热门流行风格上表现出色。
完成预训练后,还有三个阶段的后训练对齐。第一阶段是监督冷启动,用经过精心挑选的高质量数据做监督微调,确保模型在风格标签和歌词标注方面足够准确,为后续基于奖励的优化奠定干净的起点。第二阶段是迭代离线偏好对齐:让当前模型在多样化提示下生成候选,由音乐质量评分模型和指令遵循奖励模型打分,构建偏好对,再用直接偏好优化(DPO)训练模型。这个"生成—评分—构建偏好对—优化"的循环多轮迭代,逐步提高音乐性和可控性。第三阶段是在线音乐性优化:改用在线群序列策略优化(GSPO),直接从当前策略的采样中学习,优化序列级别的奖励。相比离线DPO,这种方式能更充分地探索新的优质生成方向,在前两个阶段已经打好基础的情况下,专注于音乐细节和音频质量的进一步打磨。
五、专业评委的考卷成绩单:全面评测的结果揭晓
研究团队对Qwen-Music进行了系统全面的评测,兼顾主观偏好和客观指标,既有人耳判断也有算法评分,既有原创生成也有翻唱生成。
在文本转音乐的主观评测中,50位具有音乐创作或制作经验的专业评分员进行了盲听A/B测试。每一对比较中,两首歌匿名随机呈现,评分员只根据整体聆听体验选择更好的那首,顺序也随机打乱以消除位置偏见,每对由三位评分员独立打分。结果显示,Qwen-Music的胜率对MiniMax Music 2.6达到66.7%,对MiniMax Music 2.5+达到59.1%,对Mureka V8为58.3%,对Suno V5为55.4%,对Suno V5.5为50.3%,与这个业内最强竞争对手基本持平。
按音乐类型分析的Bradley-Terry评分(一种从两两对比数据中估算能力的统计方法)显示,Qwen-Music在8个类型中的5个(电子/EDM、爵士蓝调、朋克硬核、R&B/灵魂乐、摇滚)获得最高评分,在流行和嘻哈/说唱中居第二,在金属/硬摇滚中保持竞争力。这说明Qwen-Music的优势并非集中在某一两个特定类型,而是相对均衡地分布于各种风格。
在客观指标评测中,测试集包含300条中文和300条英文提示,所有系统使用AI生成的歌词和均衡分布的音乐标签进行评测,条件完全一致。使用的评测框架包括SongBench(评估旋律、编排、音乐性、人声质量、乐器质量、混音和结构七个维度)、SongEval(评估连贯性、音乐性、记忆点、清晰度和自然度)和AudioBox-Aesthetic(评估内容愉悦感、内容实用性、制作复杂度和制作质量)。在这16个评测维度中,Qwen-Music拿下13个第一,其余3个表现也处于竞争性水平。
在可控性方面,Gemini 3.1 Pro对生成结果在流派、情绪、乐器、人声性别和人声音色五个维度分别打1到10分。Qwen-Music的平均得分为8.44,与所有系统中最高分的差距不超过0.04分,在人声性别遵循上拿到最高分,在情绪和音色控制上名列第二。在歌词清晰度方面,使用Qwen3-ASR识别生成音频中的歌词并与输入歌词对比计算音素错误率,Qwen-Music的得分是6.10,在所有系统中排名第二(最低为Suno V5.5的4.19)。
对于翻唱生成评测,研究团队构建了两个测试集:一个使用AI生成的参考歌曲(Suno V5.5和Mureka V8各出一部分),另一个使用真实世界的流行歌曲作为参考旋律,各包含100条英文和100条中文样本。旋律保留程度通过"旋律平均绝对误差"(Melody MAE)衡量:将生成歌曲和参考歌曲都转换为相对MIDI表示,用动态时间规整对齐后计算半音级别的平均误差,误差越小说明旋律保留越好。
在AI生成参考集上,Qwen-Music(段落级旋律模式)的Melody MAE为1.48,优于Suno V5.5(2.00)、Suno V5(1.87)和MiniMax Cover(1.89)。独特段落级旋律模式的Melody MAE为1.80,不如直接段落级,但在风格标签遵循方面有显著提升,五个标签维度的得分都大幅高于段落级模式。在真实流行歌曲参考集上,两种Qwen-Music模式均优于MiniMax Cover(唯一与Suno系统比较的对象,因为Suno不接受真实歌曲输入)在SongBench七个维度、PER和大多数标签遵循指标上,段落级模式在旋律保留上保持最佳(Melody MAE 1.44)。
渲染器专项评测使用包含546首歌的Song Describer数据集,对比Qwen-Music的Spec-VAE、Spec-VAE+精修器与其他四个开源音频VAE系统。在频谱重建方面,Spec-VAE+精修器取得最佳STFT距离(0.870)和STFTlog1p(0.075);在梅尔频率重建方面,精修器将梅尔距离从0.572大幅降至0.461,是所有系统中最低;在立体声图像质量方面,取得最佳跨通道相位相干性(CCPC 0.973,与εar-VAE并列)和最佳频谱声像误差(0.264)。
说到底,Qwen-Music做的事情可以用一句话来概括:它把写歌这件需要天赋、技艺和大量时间积累的事情,拆解成一套可以被计算机系统模拟的流程,然后在500万小时的音乐数据上把这套流程训练到足够好。
这对普通人意味着什么?意味着以后你只要能描述出自己想要什么样的音乐,系统就能帮你把它变成真实可听的歌曲;意味着你喜欢某首歌的旋律但不喜欢它的风格,可以把它改编成你想要的样子;意味着独立音乐人、播客创作者、游戏开发者等各类内容创作者,在音乐配套方面的门槛将大幅降低。
当然,Qwen-Music并非没有局限。在翻唱生成的评测中,商业竞品在SongBench的旋律和编排等整体音乐质量指标上仍然占优;在歌词清晰度上,仍然逊于最优秀的对手;对于长达数分钟的歌曲,如何在整个结构层面保持更灵活的创意,以及如何实现更细腻的演唱表现力,都是研究团队自己在结论部分提出的未来课题。
一个值得思考的问题是:当AI能够创作出专业级别的音乐,那些以音乐创作为生的人,未来的角色会如何演变?大概率的答案不是"被替代",而是"被解放"——从重复性的技术性工作中解放出来,更专注于那些只有人类才能带来的情感深度和创造性突破。毕竟,Qwen-Music再强,也只是在学习和模仿人类已经创作过的音乐;而人类能创作出Qwen-Music从未听过的东西。
有兴趣了解更多技术细节的读者,可以通过arXiv编号2607.11699查阅这篇由阿里巴巴Qwen团队发布的完整技术报告。
Q&A
Q1:Qwen-Music生成的音乐质量和Suno这类商业产品比怎么样?
A:在专业评分员的盲听对比测试中,Qwen-Music对Suno V5的胜率为55.4%,与Suno V5.5基本持平(50.3%对49.7%)。在客观指标方面,Qwen-Music在16个评测维度中的13个取得第一,尤其在旋律、编排、音乐性等维度领先。不过Suno V5.5在歌词清晰度上仍然保持优势,两个系统各有所长。
Q2:Melody-CoT旋律思维链机制具体是怎么工作的?
A:Melody-CoT是一种"先画草图再落笔"的机制。模型在生成完整音乐符号序列之前,会先生成一段旋律令牌序列作为草稿,描述人声旋律的大致走向。旋律令牌用相对MIDI音高表示,抹去了绝对音域信息,只保留旋律形状。这份草稿起到"打底稿"的作用,帮助模型先确定音乐结构,再填充完整细节,从而提升生成歌曲的连贯性和旋律质量。翻唱时,这份草稿直接从参考歌曲中提取。
Q3:Qwen-Music翻唱生成时如何平衡旋律保留和风格自由度?
A:Qwen-Music提供两种翻唱模式。段落级旋律模式为每个有歌词的段落都提供旋律令牌条件,旋律保留更精准(Melody MAE 1.48,低于竞品),但对目标风格的遵循相对弱一些。独特段落级旋律模式每种段落类型(如副歌)只提供一段代表旋律,条件更宽松,旋律保留略低(Melody MAE 1.80),但风格标签遵循大幅改善。用户可以根据需要选择更贴近参考旋律还是更自由地演绎目标风格。
热门跟贴