来源:市场资讯

(来源:机器之心)

小红书 FireRed 团队发布新一代语音生成与编辑模型 FireRedTTS3。它用同一个模型打通了语音的三大能力——多语言、多方言的零样本音色克隆,用自然语言「描述」就能定制的声音设计,以及「哪里不满意改哪里」的精准语音编辑,并在四大公开评测集上全面达到行业领先水平。

  • 论文标题:FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations

  • 技术报告:https://arxiv.org/abs/2608.17492

  • Demo 链接:https://fireredteam.github.io/demos/firered_tts_3/

  • 代码链接:https://github.com/FireRedTeam/FireRedTTS3

给它几秒钟你的声音,它就能用「你」说 24 种语言、21 种中文方言;给它一句话描述,它能凭空「捏」出一个从不存在的声音;给它一段现成的语音,它能像改文档一样,只动你圈出来的那一处,其余分毫不改、音色不飘。克隆、设计、编辑——过去得靠三套系统才能干的事,现在一个模型全包了。

秘密藏在一个叫 RedAE 的语音表示里:它请了一位「语义老师」,在源头就把语义「教」进声音的表示中。于是不堆模块、不搞多阶段训练、不叠复杂架构,就稳稳压住了连续语音生成最头疼的老毛病——「越说越跑偏」。

成绩也够硬:音色克隆的准确率和相似度双料第一(Seed-TTS-Eval 3.04% / 78.8%),24 种语言的克隆同样双料第一(3.75% / 84.8%),声音设计和语音编辑两个榜单也一并领先。

先上耳朵:这几段声音,你能分清真假吗?

继 FireRedTTS-2 把长对话与播客生成做到工业级之后,FireRedTTS3 这次把能力从「把一句话说好」,一路推到了「克隆、设计、编辑一手包办」。道理讲一万句,不如亲耳听一段。先来听四段——留个心眼:哪句是 AI,哪句又被悄悄「动过刀」?

先听听世界各地的朋友怎么聊世界杯。趁着世界杯的余热,不同语言、不同口音轮番上阵;但你可能想不到,这些声音其实出自同一套模型之口。

接下来,我们来听下各地区的网友们用亲切的方言向大师提问。你觉得他们的口音正宗不正宗呢?

如果说「说好各类语言」拼的是广度,那下面这个,拼的是「无中生有」。这一次,我们不给模型提供参考音频,只甩过去一句「需求描述」——想要什么样的声儿,说一句话就行。

能凭空造声,那能不能在一段已经录好的声音上「做手术」?最后这个有点像变魔术:一段现成的话,我们只想改其中一个词,或调一点语速,其他地方一个字都不许动。来看看它是不是做到了「指哪改哪、改完还听不出痕迹」。

四段听下来,克隆、设计、编辑,它一个没落。那么问题来了:一个模型,凭什么能同时把这三件事都干好?

要讲清这一点,得先回到一个更根本的问题——我们为什么需要这样一个模型。

过去两年,TTS 在零样本音色克隆上已经相当成熟。但用户的诉求正在快速升级——不再满足于「复刻一个声音」,而是希望:

  • 能用自然语言描述来设计声音(我说「我要一个什么样的声音」,模型就给我什么样的声音);

  • 能对已有语音做精准的局部修改(只改我指定的字 / 语速等,别的地方不要动)。

一句话概括,需求正在从「克隆」走向「控制」。而「控制」二字,恰恰是最难啃的骨头。

想让机器「听话」,到底卡在哪?

要做到「控制」,模型必须闯过三关:听懂自然语言指令 → 把指令精确落到某个语音属性或某个片段上 → 且不破坏未指定的部分。而这一切的地基,是语音表示必须同时编码好两类信息:语义(内容 / 风格 / 意图)与声学细节(音色 / 气声 / 音高的细微起伏)。

偏偏现有三条技术路线,在「语义 + 声学 + 可控」上都各有短板:

  • 非自回归 Flow Matching:架构决定了难以借力文本大模型的指令跟随能力;

  • 离散 Token(VQ / RVQ):量化会抹掉细粒度声学细节,在语音编辑这类声学敏感任务上易失真;

  • 连续自回归(LLM-DiT):连续空间无界,微小误差在自回归中不断累积,导致音色漂移、韵律崩溃。

连续自回归目前是最有希望的一条路,但「误差累积」是它绕不开的坎。此前学界主要从两个方向补救:一是给连续表示补语义(如 Ming-UniAudio 额外加模块抽语义、VibeVoice 用单独的语义 VAE、dots.tts 在 VAE 训练里加 ASR 目标);二是在自回归阶段正则化特征空间(如 VoxCPM 引入 FSQ 瓶颈)。但方向一往往要额外挂语义模块,或搞多阶段 tokenizer 训练;方向二则会让架构变复杂。

于是 FireRedTTS3 换了个思路发问:能不能在「表示」这一层就把误差累积缓解掉,且系统依然简单?我们的答案,就从最底层的「表示」动起。

破局第一步:让「表示」自己就带语义——RedAE

FireRedTTS3 的第一块基石,是连续语音 tokenizer RedAE。它的核心思路可以一句话概括:不额外加语义模块、不搞多阶段训练,而是请一位「语义老师」,在 tokenizer 训练时就把语义「教」进连续表示里。

图 1|RedAE 结构示意图
打开网易新闻 查看精彩图片
图 1|RedAE 结构示意图

语义老师从哪来。团队先训练了一个音频理解模型 FireRedAudio,让它在 ASR、说话人验证等多种语音理解任务上学习——这样它的 Audio Encoder 天然同时懂「内容语义」和「说话人声学线索」。

老师怎么教。训练 RedAE 时,把这个 Audio Encoder 冻结当作语义教师,让 RedAE 输出的连续表示去对齐老师的特征(最小化两者的 MSE,即语义蒸馏损失)。训练完成后,这位老师功成身退——下游生成阶段完全不再需要它,因此不增加任何推理成本。

为什么保真度不打折。RedAE 刻意省去了常见的 KL 正则,避免声学信息被过度压缩,从而把音色里那些「容易被量化抹掉」的细节完整留下——这正是它在音色相似度上领先的关键。

架构与训练细节。输入 24 kHz 波形被切成不重叠的 480 采样点帧(得到 50 Hz 序列),经两个级联的 Qwen3 风格 Transformer 处理:第一个在 50 Hz 做上下文建模,第二个通过基于注意力的池化下采样到 25 Hz(每两帧合成一个 patch)。

整体在 GAN 框架下训练,生成器损失包含对抗、多尺度 Mel 重建、特征匹配、语义蒸馏四项。RedAE 的 Encoder 与 Decoder 在单一阶段联合训练,没有额外语义分支、没有多阶段流水线;训练用了 50 万小时多样音频(干净语音 50% / 带噪 25% / 音效 10% / 音乐 15%),在 32 张 H800 上跑 55 万步。

破局第二步:一套轻框架,一口气干三件事

有了会「自带语义」的好表示,下一步就是造一个会用它的生成框架。在 RedAE 之上,FireRedTTS3 用一个轻量的 LLM-DiT 框架做生成,由三个组件组成:

打开网易新闻 查看精彩图片

  • Aggregator:把 25 Hz 的 RedAE 表示进一步压成 6.25 Hz 的 latent patch,缩短序列、降低建模难度;

  • Backbone Transformer:从 Qwen3 文本大模型初始化,以继承文本理解与指令跟随能力,负责自回归地建模「文本 token + latent patch」;

  • DiT 模块:一个全注意力 Transformer,在 Backbone 的条件下做 patch 级去噪——每一步的输入是「一个带噪的当前 patch(4 帧)+ 12 帧干净的历史 latent」,历史 latent 始终保留,以维持时间连贯性;训练时以 0.1 概率随机丢弃条件做 CFG。

同样一套框架,团队按「专精」与「全能」分出两个版本:

FireRedTTS3-Base(面向多语言、多方言克隆)

  • Backbone 从 Qwen3-1.7B-Base 初始化;用 CAM++ 提取说话人嵌入,既拼进 Backbone 输入,又作为 DiT 的说话人条件,以强化音色一致性;文本前加语言标签指示目标语种。

  • 两阶段训练:第一阶段用 260 万小时中英文语音(17 万步)打好零样本克隆底子;第二阶段在 56 万小时、覆盖 24 种语言 + 21 种中文方言的数据上继续训练,扩展到多语言、多方言。

FireRedTTS3-Instruct(统一克隆 / 设计 / 编辑)

  • Backbone 从带指令能力的 Qwen3-1.7B 初始化,采用 ChatML 格式,用不同的 system prompt 区分任务。

  • 关键设计是「先规划、再合成」:模型先把用户指令翻译成一份结构化文本方案——声音设计时,把自由描述拆解成 12 个具体声学属性的序列;语音编辑时,把指令展开成目标转录 + 编辑区域掩码,从而只改指定区域、保留其余部分。

  • 保留 Qwen3 的文本头以支持这个中间规划过程;与 Base 不同,Instruct 不使用显式说话人嵌入和语言标签。第二阶段在 33 万小时声音设计与语音编辑数据上训练 4 万步。

是骡子是马,拉到四个榜单上遛一遛

方法讲得再漂亮,也得拿成绩说话。我们把 FireRedTTS3 拉到四个公开评测集上,和业界最强的一批模型正面掰手腕。

在评估中英文零样本音色克隆的 Seed-TTS-Eval 上,FireRedTTS3-Base 取得了最低的平均错误率与最高的平均说话人相似度——Test-EN 与 Test-ZH 的相似度均为最优。这印证了「语义化的连续表示」能为 LLM-DiT 提供稳定的建模目标,带来更鲁棒的文本—语音对齐;而由于避免了量化带来的声学信息损失,它在音色相似度上的优势尤为明显。

打开网易新闻 查看精彩图片

一个模型说好中英文不难,难的是「通吃」几十种语言。当把范围扩展到 24 种语言的 MiniMax-MLS-Test 时,FireRedTTS3-Base 依然拿到了全部语言中最低的平均错误率(3.75%)与最高的平均相似度(84.8%),并在 22 / 24 种语言的相似度上位列第一或第二。

尤其值得一提的是,葡萄牙语与乌克兰语并不在 RedAE 的训练数据里,模型仍给出了有竞争力的结果,体现出 RedAE 表示对未见语言的泛化能力。

打开网易新闻 查看精彩图片

克隆能力见了真章,接下来看「听指令办事」的本事。在考察声音设计能力的 InstructTTSEval 上(评测集共 6000 条样本,中英文子集各 3000 条),FireRedTTS3-Instruct 于中、英文的三类指令——声学参数指定(APS)、风格描述(DSD)、角色扮演(RP)——上均取得最佳成绩。

这得益于它「先把指令解析成 12 维结构化文本方案、再合成」的设计,有效降低了自然语言指令的歧义,实现了对指令的解耦。

具体而言:对于 APS 任务,它从复杂的声学参数化指令中提取显式属性;对于 DSD 和 RP 任务,它将抽象的风格描述或角色画像转化为具体的声学方案,从而提高对用户指令的遵循度。

除了对指令解耦,FireRedTTS3-Instruct 还学习到了从这些规划好的声学属性序列到 RedAE 语音表示之间的稳定映射,从而能够有效控制目标音色合成。

打开网易新闻 查看精彩图片

最考验功力的,是「动刀」而不留痕。最后,在评估语音编辑的 Ming-Freeform-Audio-Edit 榜单上,无论是声学编辑(语速、音高、音量),还是语义编辑(插入、删除、替换),FireRedTTS3-Instruct 大多都处于领先地位,且在自由指令的 open 设定下表现同样稳定。

从核心评测指标来看:更低的 WER(字错率)与 NoEdit WER(未编辑区字错率),配合极高的 ACC(编辑准确率),共同确保了内容修改准确无误;大幅领先的 SIM(说话人相似度)保证了音色稳定不漂移;而极低的 RDE / RAE(声学误差率)则证明了它能精准修改到目标的音量与时长。模型真正实现了我们期望的「改得准、其余不变、音色不漂」。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

写在最后:让声音,像文字一样自由

四个榜单的第一背后,其实是一个朴素的判断。FireRedTTS3 的关键,是把「抑制误差累积」这件事下沉到了表示层:用一位冻结的语义教师,把语义在 tokenizer 阶段就注入连续表示(RedAE),让稳定性成为表示与生俱来的属性。

由此,音色克隆、声音设计、语音编辑第一次被统一进同一套简单的 LLM-DiT 框架——tokenizer 单阶段训练、无额外语义模块、无复杂结构,却在四个公开评测集上同时领先。简单,在这里不是妥协,而是让它有资格成为可持续生长的「基座」。

而从 FireRedTTS、FireRedTTS-1S、FireRedTTS-2 到今天的 FireRedTTS3,小红书 FireRed 团队始终在做同一件事:构建一套可生长的语音生成基础设施。

当「生成」与「修改」都能用一句话完成,声音创作的门槛将被大幅拉平——让不懂声学参数的普通人,也能像编辑文字一样编辑语音。未来,团队将继续拓展语种与方言、丰富指令控制与编辑的边界,让声音真正成为一种人人可写、可改、可创作的表达介质。

这条以「表示」为起点的路,才刚刚展开。