语音生成领域过去有个老问题:克隆音色、设计新声音、编辑已有语音,这三件事往往要分开建模,各搞一套系统。小红书 FireRed 团队开源的 FireRedTTS3 想把这堵墙拆掉——一个模型,统一搞定三件事。
具体来说,FireRedTTS3 支持三类任务:多语言、多方言的零样本音色克隆,基于自然语言描述的声音设计,以及针对指定区域的精准语音编辑。给一段参考音频,就能克隆 24 种语言和 21 种中文方言的音色;给一句自然语言描述,就能设计出新的声音;给一段现有语音,就能精准编辑其中指定区域。
核心创新:RedAE 连续语音 tokenizer
这套统一框架的关键,是 RedAE 连续语音 tokenizer。它的做法是在 tokenizer 训练阶段引入语义教师模型,把语义信息直接注入连续语音表示。这样一来,就不需要额外的语义模块、多阶段训练或复杂架构,同时缓解了连续语音生成中常见的误差累积问题,对提升音色相似度帮助明显。
生成框架:LLM-DiT 继承指令跟随能力
生成侧用的是 LLM-DiT 框架,由 Aggregator、Backbone Transformer 与 DiT 模块组成。其中 Backbone 从 Qwen3 文本大模型初始化,直接继承了指令跟随能力;DiT 模块负责 patch 级去噪,维持时间连贯性。
团队发布了两个版本:
- FireRedTTS3-Base:面向多语言、多方言克隆
- FireRedTTS3-Instruct:统一克隆 / 设计 / 编辑,采用「先规划、再合成」设计,先把用户指令翻译成结构化文本方案(比如 12 维声学属性序列),再合成语音,降低指令歧义
四个公开评测集均取最优
在 Seed-TTS-Eval(字错率 3.04% / 说话人相似度 78.8%)、MiniMax-MLS-Test(3.75% / 84.8%)、InstructTTSEval 与 Ming-Freeform-Audio-Edit 四个公开评测集上,FireRedTTS3 均取得最优性能,包括最低字错率、最高说话人相似度与编辑准确率。
文章还提供了本地部署与快速体验的详细代码示例,支持零样本克隆、声音设计、语义编辑与声学编辑等功能。对语音生成和编辑感兴趣的开发者,可以直接上手试。
热门跟贴