字节跳动旗下的研究团队Seed近日发布了Seed Audio 1.0音频创作模型。这款模型不再局限于让机器“开口说话”,而是将能力拓展到声音的创造层面。
该模型的核心特点是在一个统一的框架下,实现了对人声、音效以及环境声的联合建模。这意味着它不仅可以生成语音,还能同时处理和创作多种类型的声音元素。
打开网易新闻 查看精彩图片
在可控性上,Seed Audio 1.0支持细粒度的时间控制。用户可以更精准地指定声音在何时出现、持续多久。此外,模型还实现了音色一致性,确保生成的同一人物或同一场景的音频特征保持稳定连贯。
值得注意的是,这套模型还具备多语言生成能力,进一步扩展了它的应用范围和创作可能。
热门跟贴