你最近打开音乐软件,有没有发现AI生成的歌单已经多到让人犯密集恐惧症了?随便一刷,全是AI写的,旋律激昂、配器华丽,第一耳朵下去好像很唬人。可你试着完整听几首,大概率会皱眉头:为什么每一首都像在赶场子,从头到尾喘不上一口气?为什么歌手的声音就像被压路机碾过的野草,想冒出来,伴奏死活不让?为什么明明前一段还在走心,后一段却像换了个灵魂,情绪说崩就崩,根本接不上?
这不是谁家产品的孤例,整个行业差不多都掉进同一个坑里。太多人潜意识里把“堆满编配”当成了“完成度高”,管它什么情绪要不要留白,先码上七八轨再说。听个响确实热闹,可热闹底下,你什么都记不住。这种AI味儿冲天的音乐,别说打动人了,连拿去做个背景音,都嫌它往你耳朵里使劲塞废话。
7月19日,昆仑万维天工AI在2026世界人工智能大会上甩出了一记重锤——新一代音乐生成底座Mureka V9.5,同步推了一个叫O3的反思式音乐推理方案,外加一个把定稿改成了版本化管理的创作Agent。翻完V9.5的样带,有个感觉越来越清晰:它要做的,就是把AI音乐里那股挥之不去的“塑料感”和“过度表现欲”一刀刀砍掉。
V9.5一上来就亮明了态度:不追求一耳朵让你觉得“哇好牛”,而是要在一个真实的音乐框架里,把Prompt控制、人声表现、音质和情绪表达做踏实。它最核心的转变,其实是学会了一件事——给音乐留出呼吸的空间。
过去AI音乐的习惯操作,是默认叠多层乐器、持续填充旋律,仿佛只要把五线谱塞得越满,就越有诚意。Mureka V9.5直接把这套配器逻辑翻了个面。声部什么时候进、什么时候退,乐器哪一秒强、哪一秒撤,强弱动态怎么推动情绪,全部交给提示词里藏着的情绪和曲风去定。它开始主动砍掉那些不起实际作用的无效声部,把主旋律的轨道让出来,给人声腾出站立的位置,给情绪转折留出缓冲的空隙。它在模仿真人编曲那种轻重交替、张弛有度的呼吸节奏。
同批100首样本的盲测数据,把这种克制感直接翻译成了数字。V9.5在旋律、人声、音质和编配四个维度上全部爬坡,指令精准度从6.92硬生生提到了7.62。别小看这小数点后的跳跃,这意味着它更听得懂你想要的画面,而不是自行脑补一堆你压根没写的华丽桥段。
拆开四个评测维度,每一刀都砍在AI音乐的老毛病上。第一,编配上它学会了克制,不再把配器密度等同于音乐质量,主动给主旋律、人声和情绪变化留出了透气口。第二,音乐框架更真实了,声部进入、段落推进与动态关系开始贴近真实创作的逻辑,那种模板化的死板和复杂堆砌的笨重感,明显淡了。第三,人声表现的良品率直接顶到了61.0%,情绪、唱腔和伴奏之间的关系终于不再像陌生人假客气,听起来自然度上了一个台阶。第四,也是最狠的一点,意图优先于炫技——97.0%的控制良品率和95.7%的曲风完全体现比例,揭示出一个残酷真相:之前那么多复杂的计算,大部分可能都用来掩盖音乐判断的苍白。V9.5把算力花在“听懂你的话”上,而不是花在“显得自己很忙”上。
我们拿它实际跑了两组风格,那种克制感和风格捕捉力,更加一目了然。第一组是中文流行,对标国内主流市场,提示词构建的是雨夜未说出口的告别感:柔和钢琴打底,氛围合成器铺情绪,渐进式弦乐做电影感推进,男声贴近演唱,从低声诉说渐渐走到情感释放。生成的样带一出来,没有一处抢话的乐器,没有一声多余的炫技,整首歌就像在潮湿的夜里走一条很长的巷子,忧伤但温柔,不煽情但充满力量。人声稳稳地站在前面,合唱和配器退在后面当背景板,该弱的地方弱,该起来的时候绝不出戏。
第二组直接拉到了西海岸G-Funk,这简直是对AI风格理解力的极限测试。提示词里全是细颗粒度的音乐密码:迷幻合成器低音、Moog哨音、Talkbox的朦胧感、温暖的Rhodes、哇音吉他,配上松弛靠后的鼓点和沙哑男声,要的是低底盘巡游车在夜晚街头滑过的迷幻氛围。结果呢?生成的段落里,没有一丝Trap的影子,没有EDM的突兀砸场,合成器音色选得极有年代感,编曲层层递进,甚至那个被刻意要求的懒散律动都踩得恰到好处。它不但听懂了曲风的风格表达,还把合成器和地域文化那种微妙的呼应给抠了出来。
如果说V9.5负责让音乐听起来像人写的,那么搭在上面的O3反思式推理方案,做的就是让音乐“想”得足够深。O3跑在V9.5之上,用test-time scaling把MusiCoT的推理链条拉长了。别以为这就等于多烧点显卡多等几秒,它真正的底层逻辑是让模型在生成的路上持续追问自己:这一段旋律还在为整首歌的目标服务吗?编配是不是又把主唱压哑了?情绪是不是提前透支了,后面没东西可给了?结构有没有不知不觉拐进死胡同?多出来的算力,全部用在回头审视和主动修正上,让音乐思维一步步收敛,而不是一次猛子扎下去就赌命。
Mureka的技术底座叫MusiCoT,思路从一开始就迥异于“逐帧瞎蒙”的同行。它要求模型在产出音频之前,先形成一套完整的音乐思维,从全曲结构到局部细节,由粗到细地组织创作。O3在此基础上做实了四个联动的反思能力。第一,全曲目标从第一秒到最后绝不丢掉,MusiCoT先把结构、情绪和表达方向定死,后续每一步判断都重新回望这个全局坐标,不存在走一步看一步的侥幸。第二,生成过程中持续审视,模型不光判断当前段落好不好听,还检查这个决定有没有破坏整首歌的一致性,就像创作者写完一段后,会下意识琢磨前面是不是还能接得更顺。第三,发现偏差后自己动手改,旋律、编配、人声或情绪只要一跑偏,后续决策会重新校准资源,这种感觉像极了音乐人写完一段回头听,皱眉头按下删除键重来。第四,所有的推理成本,换的不是算力炫耀,而是一遍遍审视、修正和收敛的空间。
这套机制能跑得通,前提是底座本身已经有了真实感。V9.5提供了一个克制、自然的基底,O3不需要从一个充满AI堆叠感的坍塌结果开始做抢救性手术,而是在一个已经不错的底子上做精细打磨。打个比方,V9.5先把毛坯房建成能住人的格局,O3再走进去测照度、调混响、改角落的瑕疵。
我们抓了一首Minimal Electronic/Cosmic Pop的风格测试样带,来感受这种打磨的刻度。提示词想做一座漂浮在沉睡星球轨道上的空间站,晶莹合成器脉冲、低频氛围、极简电子纹理,整体像隔着舷窗凝望深空,冰冷、空旷、遥远,满屏的失重感与未知感。实际生成的段落里,音色拟真度让人头皮发麻,编曲没有一丝多余的填充,低频像在真空中缓慢推进,每个音头都带着克制的余韵。它没有因为“太空感”就往死里堆科幻音效,反而用大量的留白,把那份缓慢、宁静和沉思感撑得严严实实。这就是反思式推理的价值:它不是让你听到更多,而是让你听到更对的东西。
还有那个全新的创作Agent体验,也把一锤子买卖的定稿逻辑彻底终结了。它把歌曲创作变成了版本化管理,生成一次就是打一个草稿,不满意就回退、对比、拣选,创作不再是从零到一抢跑冲刺,而是一步步长出来的。这意味着创作者拿到的不再是一段赌运气的音频,而是一个可以反复推敲、来回批改的活的工程。
盘完V9.5和O3的整套方案,其实能摸到一条越来越清晰的产品路线:当行业还在比拼谁生成的歌单更长、谁的编配更花哨时,Mureka选择往回退一步,去还原一首歌到底该怎么成立——不是编配要拉满,而是该空的时候要敢空;不是人声要配,而是人声要站C位;不是情绪要满,而是情绪要有起承转合。它把那些花在无用声部上的算力,全部收回来,用在更准确地听懂你的提示词、更真实地模仿人的创作直觉上。
而测试数据也在冷冰冰地印证这个判断:61.0%的人声良品率、97.0%的控制良品率、95.7%的曲风完全体现率,以及从6.92跳到7.62的指令精准度。这些数字背后藏着一个朴素的道理——AI音乐想要被真正接纳,不能靠堆更多的元素把自己武装成模糊的好听,而是必须学会做减法,找到那些让人的耳朵觉得“对,就是这种感觉”的准确瞬间。Mureka V9.5交出的这张答卷,看起来比很多人预想的,更接近那个被反复期待的“
热门跟贴