"AI音乐开始'找实体'了"
作者|家昌
出品|极新
8月第一周的AI音乐圈,发生了几件看上去没什么关系、其实串在同一条线上的事。
Suno宣布要把AI生成的歌曲压制成实体黑胶,45美元一张;声音克隆功能Voices全面登陆手机端,录一分钟自己的声音,就能让"你"唱任何歌;Spotify联合独立音乐版权机构Merlin做合法AI二创,收益分给原创作者;华纳音乐在财报会上说,和Suno、Udio等公司的AI授权合作,2027财年就能开始赚钱。几乎同时,Suno发了一份很长的合规声明,从提示词过滤到隐形水印再到下载限制,搭了一套完整的版权治理框架。
1
AI音乐为什么做黑胶?
Suno做黑胶,是这周最让人意外的事。
AI音乐本来应该是最"虚"的东西——它是算法在服务器上生成的一串数字,没有实体,没有演奏现场,甚至连"原版"都不存在(同一个提示词每次生成的结果都不一样)。它天生就属于云端、属于流媒体、属于无限复制的数字世界。
但Suno偏偏要把它压成黑胶。12英寸的唱片,能放46分钟,还能定制封面,45美元一张——这是最"实在"、最有收藏感的音乐载体。黑胶这种东西,你得拿在手里,得翻面,得小心翼翼地放,它甚至会磨损。
这应该不只是想多赚一份钱。更像是一个信号:AI音乐在主动寻找"实体感"。
为什么需要实体感?因为AI生成的音乐太"飘"了。一段存在服务器上的MP3,你甚至说不清它到底"在哪里"。它没有创作的现场,没有演奏的人,没有一个可以被指认的"原作"。当所有东西都是数字的、随便复制的、长得都差不多的时候,"能拿在手里"反而成了稀缺品。
这里可以对照一下本雅明在《机械复制时代的艺术作品》里说的"光晕"。本雅明说,机械复制让艺术品的"独一无二性"消失了,原作的光晕被稀释了。但AI音乐走得更远——它连"原作"这个概念都没有了,每一次生成都是新的。在这种彻底的"无原作"状态下,人反而更想要一个实实在在的东西来确认:这首歌是真的存在过的。
黑胶不是AI音乐的周边,它更像AI音乐的"出生证明"——通过被压成一张物理唱片,这段算法生成的声音才真正"成为"了一首作品。
往深了说,这其实提醒了我们一件被忽略的事:音乐从来都不只是声音,它总是和某种"东西"绑在一起的。从乐谱到唱片到磁带到CD再到流媒体,每一次音乐载体的变化,都在重新定义"一首音乐作品到底是什么"。AI音乐的黑胶化说明,哪怕到了最虚拟的生成时代,人对音乐的"实体感"需求,还是丢不掉。
2
用自己的声音唱AI写的歌,是什么体验?
如果说黑胶解决的是AI音乐"有没有实体"的问题,那Suno Voices解决的就是"有没有人"的问题。
我们听音乐的时候,其实一直在听"人"。一段现场演奏能把人听哭,MIDI做出来的完美演奏却让人没感觉,区别就在于前者有"人"——有演奏者的呼吸,有手指触键的微妙差别,有那一刻的情绪。AI音乐最大的短板就在这里:它生成的声音结构上可以挑不出毛病,但总是少了点"活着的感觉",因为它背后没有一个真正的人。
Suno Voices的办法很巧妙:把你的声音"借"给AI。你录一分钟自己的声音,AI就能用你的嗓子唱任何风格的歌。这听上去只是个声音克隆功能,但体验其实很奇特——你听到"自己"在唱一首你从来没写过、也从来没唱过的歌。你既是提供声音的人,又是听歌的人,但唱歌的那个"你"又不是真的你。
这种感觉,用普通的音乐理论很难解释。从理论上来讲,创作一首音乐的链条很清楚:创作者写歌,到表演者演唱或演奏,再到听众欣赏,三个角色是分开的。但在Suno Voices这里,三个角色绕成了一个圈:你提供了声音(表演者的一部分),AI生成了歌曲(创作者的一部分),你又作为听众去听。主体不再是一个固定的点,而是一个循环。
日本有音乐学者在今年初提出了一个概念叫"被委托的生命力"(Delegated Vitality),说的就是这个事:音乐里那种"活着的感觉",其实不一定来自创作者或表演者,而是在听众听的那一刻,由听众自己的感知"赋予"上去的。我们听到一段AI生成的旋律,会自动觉得它"有感情",哪怕我们明知道它是机器做的。当这段旋律用的还是你自己的声音时,这种"赋予"就更强烈了。
这可能就是AI音乐时代最核心的变化:音乐的"主角"不再是创作者,而是感知者。创作者的意图、演奏者的身体,都不再是必须的;只要声音能在听者心里唤起感觉,它就是"活"的音乐。
3
AI音乐的赚钱规则,正在重新定
将周的几条产业新闻:Spotify做合法二创、华纳说AI授权2027年能赚钱、Suno发合规声明——放在一起看,AI音乐的"游戏规则"正在从混乱走向定型。
传统音乐行业的规则很清楚:写歌的人拿词曲版权,唱歌的人拿录音版权,平台按播放量分钱。每个环节谁该拿多少钱,都有成熟的体系。AI音乐把这套全打乱了:模型替代了写歌的人,合成替代了唱歌的人,平台同时手握模型和分发。原来的版权规则,在AI面前几乎不好使了。
但这周的几件事说明,新的规则正在长出来,而且和旧规则很不一样,大概是三个方向。
第一个方向是"训练数据收费"。华纳和Suno、Udio这些公司签的授权协议,本质上是把自己的曲库当成AI的"教材"来卖。以前唱片公司靠卖歌、卖流媒体赚钱,现在发现曲库还能用来"喂"AI,这是一种全新的收入。
第二个方向是"二创分润"。Spotify和Merlin的合作,让用户可以基于已经授权的歌做AI翻唱和重混,赚的钱按比例分给原作者。AI从"侵权工具"变成了"粉丝玩音乐的工具",版权方从反对者变成了分钱的人。
第三个方向是"AI内容的身份证"。Suno搞的隐形水印、提示词过滤、下载限制,本质上是给每首AI生成的歌办个"身份证"——能追溯、能识别、能管。没有这个东西,AI音乐就没法合法地大规模商业化,因为平台分不清哪些是人做的、哪些是AI做的,也就没法分钱。
这个新规则的核心逻辑是:AI不是来砸音乐行业饭碗的,是来重新分蛋糕的。以前蛋糕主要分给写歌的和唱歌的,现在开始有一部分流向"有数据的人"和"能管平台的人"。唱片公司最值钱的东西,从"旗下有多少大牌歌手"慢慢变成了"手里有多少曲库可以用来训练AI"。
当然,新规则远没到公平的地步。美国音乐家工会(AFM)已经起诉了华纳和环球,说唱片公司拿了AI授权费,却没分给真正录音乐的底层乐手。AI音乐的钱怎么分才合理,还得吵很久。
4
AI音乐的瓶颈,可能不是模型不够大?
最值得拿出来说的还有一篇称为Agogic的研究。
这篇论文做了一个实验:同样的数据、同样的训练方法,只换"音乐怎么切成Token"的方式,看生成质量差多少。结果很反直觉:把模型参数从0.8B扩大到27B(大了34倍),生成质量几乎没提升;但换一种更精细的Token化方式(特别是把演奏的力度、时间细节都编码进去),质量直接提升了一倍。0.8B的小模型用对了方法,比27B的大模型效果还好。
这个结果,其实是大家心里都会有的猜想。因为它用工程的方式证明了一件搞音乐的人早就知道的事:音乐好不好听,关键不在大结构,在细节。 五线谱记录的是"纸面上”的的音乐——哪个音、多长、大概多响。但真正让音乐"活"起来的,是谱子记不下来的那些东西:这个音比标准时长稍微拖了一点点,那个音力度稍微重了一点,两个音之间有个极短的停顿,揉弦的速度快了还是慢了。伟大的演奏家和普通演奏家的区别,从来不是弹对了音符,而是这些音符之间的"缝隙"里发生了什么。
AI音乐早期走的路子是"先搞定大结构"——先学会写旋律、写和声、写曲式,细节以后再说。但Agogic这篇研究等于在说:这条路可能从一开始就搞反了。AI音乐听起来"完美但无聊",不是因为它写不出复杂的旋律,而是因为它的细节太机械、太平均、太准了——准到不像人。
这其实是AI音乐的一个美学回归。当技术已经能轻松写出像样的旋律之后,它终于开始面对那些真正难的、真正属于音乐本质的东西了。而那些东西,恰恰是人类演奏家们研究了几百年的东西。
把这一周的事串起来看,AI音乐正在从一个"技术概念",变成一个"完整的东西"。它有了实体(黑胶),有了"人"的感觉,有了赚钱的规则,甚至开始重新发现音乐最核心的美学问题。
很多人怕AI毁了音乐,怕创作者失业,怕音乐变得廉价。但从这一周的发展来看,AI更像是一面镜子——它把我们对音乐的所有默认假设都照了出来,然后一个个打破。而打破之后,我们可能会看到一个更宽的音乐世界:写歌不再是少数人的专利,声音不再只属于特定的人,虚拟和实体可以同时存在。
从比特到黑胶,AI音乐走了一大圈,最后撞上的还是那些老问题:一首歌到底算不算作品,谁有资格被称为创作者,音乐的价值由谁来定。这些问题没有标准答案,也不会因为换了一种技术就消失。AI能做的,是逼着我们做自我思考。
更多干货分享敬请注我们的公众号与视频号~超多精彩对话内容等待您的解锁!
热门跟贴