一条指令就能控制对白、音效、环境声在时间线上的精准进出。字节跳动Seed团队今天发布了音频创作模型Seed Audio 1.0,把影视级音频创作塞进了统一框架里。

官方给出的定位很明确:声音不是画面的附庸,而是叙事本身。“听见”即“看见”——这个模型要做的,是让音频直接在听者脑子里形成画面感。

打开网易新闻 查看精彩图片

具体能力分成三块来看。第一块是多要素统一编排,支持精细时间控制。你在prompt里就能安排好带特定情绪的对白、关键音效和环境声,按时间线精准控制每个声音什么时候进场。第二块是音色风格可控,长时稳定。支持文本和参考音频两种输入方式,在长音频和多次延长场景下,角色声音不会跑偏,同一音色也能自然切换不同语气和情绪。第三块是多语种自然生成,覆盖20多种语言,同一个角色的声音能根据各语种特点,呈现出更自然的发音、节奏和表达方式。

字节放出了几组评测数据。在文本生成音色的AB主观评测里,Seed Audio 1.0表现出显著优势,可用率和优良率都有明显提升。多场景覆盖能力上,团队评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧、语音合成这些典型场景,结果多数场景的音频可用率已经达到90%以上。

多语言这块也有量化指标。音频自然度上,大部分语言的MOS分超过4分,音质达到优秀水准。复杂音频生成的指令遵循能力上,除越南语外其余语言的MOS都高于3.5分,说明模型的多语言指令遵循已经相当能打。

目前Seed Audio 1.0已在火山方舟体验中心上线。