做AI音乐的那家公司,现在想让AI开口说话了。Suno最近上线了一个叫Speech的新功能,输入一段想法或写好的文字,再描述你想要的嗓音和音乐风格,模型会把朗读声和配乐一起生成出来,合成同一条音轨。
产品负责人Jack Brody说,这个功能已经在一小群人里测试了一个月。官方给出的适用场景包括诗歌、冥想引导和睡前故事——都是那种需要人声陪伴、又需要背景音乐托底的内容。
打开网易新闻 查看精彩图片
它到底怎么用
流程不复杂,两步:
- 输入内容——可以是一个想法,也可以是一段写好的文本;
- 描述声音和音乐——想要什么样的嗓音、什么样的配乐风格,都由用户指定。
模型负责把这两件事同时做出来,而不是先录人声再配乐。对做冥想音频、有声诗集的创作者来说,这种"一次成型"的方式省掉了后期对齐的麻烦。
不过目前还是测试版,毛病不少。Suno自己承认,英国口音有时候会念成澳大利亚口音——这个bug对做本地化内容的用户来说挺要命,毕竟口音一跑偏,整段音频的气质就变了。
训练方式没说,麻烦却不少
Suno没有公布这个模型是怎么训练的。这个沉默放在当下的语境里并不意外——AI音乐生成器正面临版权侵权的质疑。几家主要唱片公司已经起诉了Suno,慕尼黑一家法院最近也做出了不利于这家初创公司的裁决,否定了"合理使用"作为使用受版权保护数据理由的辩护。
一边是功能往前推,一边是法律上的压力没解除。Speech这个新功能能不能顺利铺开,可能不取决于它念诗好不好听,而取决于那些还没打完的官司。
热门跟贴