打开网易新闻 查看精彩图片

大家好,我是橘子。今天我体验到一个全新的声音模型,跟以前所有的声音模型都不一样。

「等了这么久,终于来了。」

这是我测试的时候,内心的真实想法。

以前的声音模型一般叫 TTS(文本转语音),它们只能根据你给的文本来合成语音,它更像是一个朗读机器,而非智能声音模型。

但这个新模型,可以根据你的想象,生成一切你所需要的声音,包括人声、音乐、音效、环境音,以及这些声音里所富含的那些不可言说的微妙细节。

它的名字名字叫:豆包音频生成模型 Seed Audio 1.0。

在我看来,这就是声音模型的 Seedance 时刻。

就像香蕉是人类第一次将智能赋予图像,Seed Audio 是人类第一次将智能赋予声音。

接下来,就让我们一起听听它到底有何特别。

首先是这篇文章的开场白,这个音色是参考我的某次播客录制生成的。

大家可以记一下我的音色,因为这个模型很强的一点就是它的声音参考功能,除了做文章配音,还能用我的音色去演绎各类场景。

比如这个冥想的引导,你可以听到我的声音从头到尾越来越慢,越来越轻。还配上了轻柔的音乐

再比如这个脱口秀,完全就是我说话的样子,真实得无法想象,模型还配上了现场的笑声作为环境音。

这是声音模型第一次可以把同一个音色泛化到各种不同的场景,它的想象空间非常大。

这个声音参考,不仅是能支持音色的参考,还支持环境氛围音、音乐作为参考,毕竟很多声音是很抽象的,很难用语言描述,声音参考的意义就像视频模型里的图像参考。听说这个模型甚至也支持图像参考,只是目前还没上线。

我测试了这个模型在不同场景下的表现。

我特别喜欢这个鬼故事场景。你可以听一下,是不是那个感觉。

模型还具备一定的唱歌能力,我让它清唱一下,让朋友们去听,大家都觉得非常真实,甚至那种跑调都很真实。

模型不仅支持单人说话,还支持多人复杂场景的表演,比如短剧配音或者广播剧场景,可以听一下这个场景的表演,画面感是不是一下就出来了。

除了多人场景演绎,模型也支持复杂的环境音生成,这是一个人从甲板上走到船舱里,点了一杯威士忌的场景。

听到这里,现在你应该明白为什么我说这是声音模型的 Seedance 时刻了,有了这样的模型,你真的可以自由创作一切声音内容。(当然是在不侵权的前提之下)

这个模型单次可以生成长达 2 分钟的音频,还能以此为参考继续延长,保持音色和风格的一致性,最长能延续到几十分钟。

有了这个模型,我们终于可以创造属于自己的 AI 声音伙伴了。比如一个跟你聊天、给你讲故事、给你唱歌、逗你开心的 Cola,可以挑一个你最喜欢的音色作为参考。

不过 Seed Audio 作为一个版本号 1.0 的新模型,还有很多不完美的地方。现在同一个参考声音在不同场景下的泛化性还有提升空间,比如我讲冥想那段可以更慢一点,比如在唱歌的时候跑调有点严重,比如有时候人声说话依然带有电音感。

期待在未来的升级中这些问题都能被解决。

我们去年做 ListenHub 的时候,最想要的就是这样一个模型,可以把用声音智能创造有趣且有用的内容。

等了这么久,终于来了。

接下来我们会把 Seed Audio 接入 ListenHub ,到时候大家在制作音频内容的时候,一定会有全新的体验。