作者|林易
编辑|重点君
在全球AI语音竞技最激烈的两座最高峰上,中国初创团队刷爆了纪录。
一个是Hugging Face上的TTS Arena V2,登上Rating总榜第一,与ElevenLabs、Cartesia、Hume等主流语音模型同场竞技。
另一个是全球TTS权威榜单ArtificialAnalysis,以1220的Elo位列全球第三,超越谷歌!
不过你可能意想不到的是,能够在这两个榜单上分别拿下第一、击败谷歌这样的强敌的选手,是一支来自上海交通大学的学术与产业硬核跨界的初创团队——宇生月伴(VUI Labs)。他们凭借自研的Luna-TTS大模型,在自然度、极速响应与超强稳定性上展现了较好的成绩。
而且这两张榜单还有一个共同点——最后说了算的是人耳。
TTS Arena会把同一段文字交给两个匿名模型生成,用户盲听之后选择自己更喜欢的一段;Artificial Analysis同样根据真实用户的成对盲听结果计算Elo。换句话说,比的就是哪段声音听起来更自然。
两张真人盲听榜单同时冲到前列,相当于把一家年轻中国公司的语音能力,直接放进全球用户的耳朵里做了一次公开考试。
而这家公司背后,还有一层很容易让人记住的标签:上交系。
先别看参数,听听它怎么说
榜单数据固然亮眼,但TTS毕竟还是一门“耳听为实”的技术。
因此,接下来,我们就先来听听Luna-TTS在把话说准这方面的效果。
虽然这段仅仅9秒,内容也看起来并不难,但其实机场广播很适合测试TTS。
因为数字、字母和专有信息不能错,停顿和语速也要接近真实播报。一旦某个词的发音、断句或者节奏突然异常,整段声音的机械感会立刻冒出来。
Luna-TTS这段比较明显的一点,是信息密度虽然高,但整段没有被念成一串彼此孤立的单词。数字、地点和普通文本之间的衔接比较顺,语速也没有因为遇到特殊信息突然改变。
话说准了之后,我们继续看下模型能不能理解一句话应该怎么说
在这一段15秒左右的英文文本中,前半段写海面平静、微风掠过小船,后半段转到海豚跃出水面、在浪间飞驰。
同一段话里,叙事状态从舒缓转向动态。如果每个词都用同样的速度和力度念过去,内容虽然准确,听感还是很容易落回机器朗读。
这类case考验的是语义和韵律能否同步变化:哪里该慢、哪里该提速、哪个词该被强调。语音生成的核心,正在从“怎么发音”转向“先理解,再表达”。
而在说得准确、理解到位之后,情绪,则会让AI语音的难度更上一层楼。
同一个音色、同一句中文台词,分别换成neutral(平静)、sad(伤心)和surprised(惊讶)之后,可以听到三个版本的表达状态已经明显拉开。
而且情绪变化并不只是简单地把音调调高或者调低。人在惊讶时,语速、音高、力度和句尾通常会一起发生变化;到了悲伤状态,节奏又会慢下来,整体表达更加收敛。
对于TTS来说,这其实比单纯生成几个不同音色更难。因为模型既要改变表达,又不能因为情绪幅度变大,把原本的人声特征一并带跑。
除此之外,还有一些声音信息,甚至是没有直接写在文字里的。
比如轻微的呼吸、犹豫,带着回忆感的停顿,或者一句“Thank you, really”前后非常细小的情绪变化。
这些细节很难简单归进“开心”、“悲伤”这样的情绪标签里,却恰恰决定了一句话听起来像不像真人。
但真人说话时,我们几乎不会把所有句子干干净净地首尾相接。一次吸气、一小段停顿,甚至一句话快说完时力度慢慢收下来,都会传递额外的信息。
这也是为什么有些AI声音明明音质很好,却还是会让人觉得塑料——它把字都保留下来了,却把人说话时那些看似多余的东西删掉了。
Luna-TTS这里展示的能力,恰恰是在尝试把这些文字之外的信息重新放回声音里。
当然,上面展示的效果都比较简短,这次我们再来把文本拉长一下。
这段约33秒的英文叙事,从雨停后的山谷、窗外陆续亮起的灯光,一路讲到主人公背上未寄出的信,沿河出发。
相比短句,长文本更容易暴露音色漂移、节奏越来越僵、句间衔接不稳等问题,也更接近有声书、播客等真实应用。
除了听觉上的体感之外,在Luna-TTS的技术报告中,宇生月伴也给出了另一组交叉验证。
在Seed-TTS-Eval的结果中,Luna-TTS在中英文CER/WER以及说话人相似度四项指标上,都取得了参与对比系统中的最佳成绩。其中中文CER为0.73、SIM为79.7,英文WER为1.49、SIM为76.8。
到了更难、更接近真实世界文本的CV3-Eval,Luna-TTS在报告对比中的中文、英文错误率同样处在领先位置。
除此之外,在技术报告给出的情绪控制测试中,Luna-TTS拿到了最高的整体E-Sim、Expression Quality和人类E-MOS;副语言控制中,它的Recall和F1最高,整体自然度、质量和表达力评分也处于对比模型前列。
那么接下来的问题是,它是怎么让声音变“活”的?
一条全新的TTS生成路线
目前大量LLM式TTS采用的技术路线是自回归生成。
简单理解,就是先把语音离散成Token,再像语言模型写字一样,一个接一个往后生成。
这个范式很成熟,但语音和文字并不完全一样。尤其是RVQ编码后的语音,本质上是一张沿时间和码本深度展开的二维Token网格。强行给它规定唯一的从左到右顺序,会带来串行解码、误差沿前缀累积,以及前面生成后难以根据后文重新修正等问题。
Luna-TTS则是直接换了一条路线:Masked Diffusion,掩码扩散。它把整段语音的Token网格当成一个整体,在多轮迭代里并行预测被遮住的位置。
技术报告中,Luna-TTS完整语句默认经过32轮并行refinement。每一轮,模型可以优先确定更有把握的位置,再继续补全剩下的部分。于是生成顺序由模型在迭代过程中动态决定,对RVQ这种本来就没有天然“从左到右”顺序的结构更加贴合。
这套架构还有一处比较关键的设计。Luna-TTS Family使用自研的Luna-Codec,把24kHz语音编码成25Hz、8个码本的离散Token网格;主干模型从Qwen3-0.6B继续训练而来,直接对完整的多码本声学Token进行建模。
除此之外,在数据规模和质量方面,整个Luna-TTS Family在中文、英文、日文、韩文四种语言上进行了约100万小时语音预训练,随后又经过约10万小时高质量语音退火训练(annealing),再加入带有情绪和副语言标注的数据继续训练。
这也解释了前面效果展示里的“会表达”的部分能力是怎么来的。情绪和笑声、叹气、呼吸等非语言声音,在训练阶段就被作为可控制信息加入;之后团队又把GRPO式强化学习迁移到masked diffusion的去噪轨迹上,把内容正确性和说话人一致性纳入奖励优化。
当然,扩散模型常被问到的另一个问题是速度
VUI Labs又从Luna-TTS继续训练出了Luna-TTS Realtime,把整段并行生成改成1.28秒一个block的块级生成。block之间保持因果关系,block内部继续并行去噪,同时配合KV Cache做流式输出。按照技术报告的本地预热测试,在2张H20、8步并行CFG配置下,首个1.28秒音频block在41.6ms提交,端到端RTF为0.0240。
由此,再回头看两张Arena榜单,逻辑也就串起来了。Luna-TTS想解决的范围已经超过单一的“声音好听”。它试图同时把内容准确、韵律、情绪控制、声学细节和生成效率塞进一条统一的模型路线里。
榜单,则成了最终听感的一次外部验收。
一支上交系团队,押注声音成为Agent入口
除了产品和技术,Luna-TTS背后的这支黑马团队,也是这次成绩之外值得关注的一点。
VUI Labs宇生月伴的创始人、董事长钱彦旻,上海交通大学特聘教授。
根据上海交大AudioCC Lab公开资料显示,钱彦旻2012年博士毕业于清华大学电子工程系,2015年至2016年曾在剑桥大学工程系语音组担任访问研究员,同时也是Kaldi语音识别工具包的创始成员之一。
其长期从事语音与语言处理研究,公开资料显示已发表论文300余篇,总引用超过2万次,并拥有120余项中美专利授权,还曾带队六次获得国际挑战赛冠军。
公司另一位创始人、CEO梅杰,负责方向则更偏商业化一侧。
他毕业于浙江大学,曾任Aircourse/爱课COO,负责过业务增长、团队管理和商业化。在VUI Labs,他主要负责公司战略、商业化、融资和组织建设。
目前,VUI Labs科研团队超过40人,博士占比约50%,覆盖语音与音频、多模态大模型、训练推理系统、产品工程以及商业化。
一边是长期语音研究,一边是产品与商业化经验,这构成了VUI Labs的团队底色。
当然,资本市场的表现也是对一家公司实力的侧面印证。
今年2月,投中网报道VUI Labs完成数千万元天使+轮融资,由同创伟业领投,靖亚资本和小苗朗程继续加注;报道同时称,公司半年累计获得近亿元投资,资金将继续用于核心模型迭代、产品商业化以及Voice Agent平台建设。
如果说TTS曾经更像一项后台能力,可以给导航配音、给有声书念稿、给视频生成旁白。那么到了Agent时代,声音正在逐渐往交互入口移动。
一个语音Agent要进入电话、App、汽车、耳机或者各种智能硬件,既要听得懂,也要足够快地回应,还要在长时间交流里保持自然、可控和稳定。单纯“能合成语音”已经不够用了。
VUI Labs给自己的长期方向,同样放在Voice Agent和多模态交互上。公司资料显示,团队希望把语音理解、生成、实时对话以及工具调用等能力接进真实业务流程,目前覆盖客服、会议、教育、同传、内容生成、智能硬件和车载等方向。
从这个角度看,Luna-TTS更像其中负责“把AI说出来”的一块关键拼图。所以,这次全球第一和全球第三当然值得写,但更值得关注的,是它们背后的评价标准已经变了。
当TTS进入Agent,用户对声音的要求会从“听得清”,一路抬高到“听着像人、表达准确、反应还得足够快”。
榜单也会随着新模型和新投票持续变化。今天的第一、第三未必永远固定,但两张由真实用户盲听驱动的榜单,至少给了这家中国初创一次很清楚的外部坐标——
在全球TTS最卷的一批玩家里,它已经坐上了牌桌,而且位置相当靠前。
接下来真正要看的,是这种“会说话”的能力,能不能继续变成“会交流”的产品能力。
热门跟贴