打开网易新闻 查看精彩图片

作者 | Arwen

大模型的更新,已经从聊天框一路卷到了耳机里。

9 月 23 日, 2026 云栖大会上,阿里发布的 Qwen-Audio-3.1 系列语音大模型,语音转写、语音合成和实时语音交互权限升级。其中,一款号称音频创作的模型 Qwen-Audio-3.1-TTS-Next 引起了我们的好奇心。

按过去的流程,做一段有声书成片,得四个工种接力。主播录对白,音效师找素材,混音师调层次,剪辑师最后拼成完整场景。就算 AI 已经能把对白生成得像模像样,后面那串活儿一样都省不掉。而这款模型把这些环节放进同一次生成。输入一段脚本,人声、音效、环境声一起出来,连各类声音出场的先后顺序都能编排。

一个模型,干完了过去一条流水线的活儿。

打开网易新闻 查看精彩图片

反观创作者需求,也的确越来越高。光把一句话念好听已经不够,还得把整个场景演出来。人物的表演、声音的出场顺序、对白和背景声的关系,都成了模型要交的作业。

声音好听,能不能接住一个梗?情绪到位,换个人物会不会串音?雨声、脚步声都有了,它们是在配合剧情,还是各响各的?

带着这些问题,我们给这款音频创作模型准备了一场“声音试镜”。漫剧的反差桥段、播客里的互相拆台以及 AI 短片里靠声音撑起来的氛围。

我们就来真实测测,千问语音模型距离一个人就能开工的音频工作室,究竟还有多远。

声音试镜 Round 1 :都元婴期了,怎么还得上交手机?

第一道题,给千问语音模型安排一段修仙喜剧。灵感来自最近很火的漫剧《我都元婴期了,你跟我说开学》。满级大佬重回新手村,充满了荒诞和无奈感。主角在修仙界苦修两千年,成就元婴期修为,结果一回到地球,发现时间才过去一个暑假,自己还得像个普通大一新生一样去开学。

修仙、互怼、演志怪: 千问语音模型真实测评
打开网易新闻 查看更多视频
修仙、互怼、演志怪: 千问语音模型真实测评

原剧视频节选

我们沿着这种反差,另写了一段测试小剧场(原创台词,非原剧节选)。

【修士】:闭关三百年,今日,本座终于—— 【老师】:手机交一下。 【修士】:此乃传音法器。 【老师】:法器也不能带进考场。 【修士】:本座渡过九重雷劫。 【老师】:那正好,这张卷子也是九道大题。 【修士】:……能补考吗?

境界很高,考场地位很低。

这段戏的包袱不复杂,但要单靠声音把它演好,很有难度。修士出场时得有一股“终于轮到本座了”的气势,老师则最好平静到连眼皮都懒得抬。

为了保留原角色的感觉,我们上传了原角色的 30 秒音频作为声音参考,再把新台词、表演要求和声音设计一起交给 Qwen-Audio-3.1-TTS-Next 。不到一分钟,一段约 27 秒的音频就生成了。

Qwen-Audio-3.1-TTS-Next 生成

完了,听进去了!有点想继续听,怎么回事?

这次生成最出彩的是角色熟悉的音色与新台词里的表演能同时保留下来。

人物音色的还原度很高,音效、背景音和语气词也融合得自然。即使只有不到 30 秒,但是听感上已经具备了漫剧片段的完整性,人物在前面演,其他声音跟着共同营造气氛,融合的刚刚好。

对创作者而言,这种设计的直接价值,是能围绕同一段剧情组织声音,减少分别配音、寻找音效、再逐项拼接的操作。当然,这次完成的是音频,配进视频后的镜头节奏仍需检查。但作为一段新剧情的声音初稿,它已经足够惊艳了。

声音试镜 Round 2:让 AI 聊“活人感”,谁先绷不住?

修仙漫剧可以靠鲜明的角色和音效撑起戏剧感,换到播客,没有音效替人物造势,几个人坐在麦克风前是否还能聊得自然呢?

最新一期《没理想编辑部》的播客聊的是这样一个话题:活人感是新的伪人感。我们觉得很有意思。

打开网易新闻 查看精彩图片

虽然,让 AI 唠出活人感,有点强“模型”所难,但是本着高低得给千问语音模型上点强度的心态,我们还是决定试试!

下面这段音频,大家猜猜谁是 AI?

上一题考的是把戏演足,这一段考的是把表演痕迹收起来。我们给三个人分配了不同的声音和表达方式:A 认真解释,B 一本正经地拆台,C 在旁边听着,冷不丁补上一句。背景只留轻微的声响,把注意力放在人声上。这次我们没有给 AI 任何角色参考音频。

从技术能力看,这组测试同时考察了多人声音的一致性和上下文中的表达控制。角色每次开口都要保持可辨认的音色,情绪和停顿又要随着对话变化。

不得不说,这三个“人” 听起来真有点“熟”。有人话还没说利索,旁边就接上了;有人忍着笑解释,另一个人顺嘴拆台。句尾轻重收放自然,连带笑说话时那点含混,确实像几个朋友聊到兴头上。

就连提示词中,我们要求 AI 加入轻微的方言感,模型也处理的恰到好处。

所以,答案是:三个“人”的声音都是 Qwen-Audio-3.1-TTS-Next 生成的!

怎么样?AI “演”出来的“活人感”有没有骗过你的耳朵呢?

声音试镜 Round 3:AI 志怪短片的悬疑感,能从声音里单独成立吗?

最后一轮,我们把难度再往上提了提。这一轮,我们想听听,声音能否独自撑起一个悬疑场景。

我们为测试写了一段原创志怪短剧:深夜,一个年轻人搭上末班渡船。船夫告诉他,离岸之后,无论听见谁叫名字,都不要答应。偏偏这时,岸上传来了母亲的声音。

不用先解释谁是妖、谁是鬼。一个熟悉的声音,出现在不该出现的地方,故事就开始了。

【船夫】坐稳。离了岸,谁叫你,都别应。 【年轻人】要是家里人呢? 【船夫】尤其是家里人。 【岸上女人】小远——饭都凉了,怎么还不回来? 【年轻人】妈?她怎么找到这儿了…… 【船夫】别回头。你听,她在岸上走。 【年轻人】那怎么了? 【船夫】船都划出去这么远了,脚步声怎么还在你耳边? 【女人,近处】问你话呢,怎么不应啊?

这段戏把最难的任务交给了母亲。她的声音首先得让人想答应,要像日常生活里听过的那一句。等她再次开口,音色仍然熟悉,距离却近得不对劲。老船夫则承担着另一层变化。苍老、略沙哑的声音,要展现出该有的阅历感,话少,却笃定。

来听听 Qwen-Audio-3.1-TTS-Next 生成的音频,是不是能做到上述几点。

这段测试给模型出了一道更细的题:同一个母亲,从岸边喊人,到站在身旁说话,声音该变什么,又不能变什么?不能变的是人物身份。听众需要立刻认出。要变的则是发声方式和距离感。这就把考题从生成一个像母亲的声音,推进到了同时改变她的表达和所处空间。

另一层难度在于,几种声音需要建立一致的空间关系。水声说明船还在移动,脚步却持续靠近,两者放在一起,才构成故事里的异常。脚步单独听有多逼真,并不足以决定这段戏是否成立;它必须出现在合适的时机,并与其他声音形成对照。

对创作者而言,能实现这一点,就意味着可以围绕剧情安排声音,让环境声承担线索,而不只是铺一层气氛。

能听懂、能创作、能聊天之后,语音还能做什么?

回头看这三轮声音试镜,考察的其实是 Qwen-Audio-3.1-TTS-Next 的三种能力。修仙漫剧要求复刻角色音色与情绪转折;三人播客考验角色区分和对话的自然感;志怪短剧则进一步考验人声与环境声的时序、距离和叙事配合。

从这次样本看,千问语音模型在角色音色、口语表达和场景融合上都有不俗表现,几项能力已经能够共同支撑一段完整的声音作品。它们共同指向一种变化:创作者可以直接描述想要的场景,让模型先把它变成听得见的版本。

这并不意味着创作已经可以一键完成。播客的接话间隔、人物的情绪层次,都经历过调整。但对个人和中小团队而言,能够更快听见初稿,再判断哪里不对、如何修改,本身就降低了尝试的门槛。过去需要先找声音、凑素材、做拼接才能验证的想法,现在可以更早进入试听和打磨。

如果把视野放到整个 Qwen-Audio-3.1 系列,这种变化还有更大的延伸空间。

按照此次发布的信息,ASR 语音转写、TTS 语音合成和 Realtime 实时交互三条线都在同步升级:转写端增强上下文理解,并支持去除语气词、重复表达等润色处理;创作端让同一音色在跨语言合成时依然能保持自然感;实时交互端则支持边听边说、随时打断,以及调用工具执行任务。

当这些能力接进同一个应用,一个创作者可以口述故事,让 AI 整理成脚本,生成一版声音小样,听到不满意的地方直接说“这里先别急着接话”。犹豫、改口、补充条件,本来就是人说话的方式,机器迁就人的节奏,比人迁就机器舒服得多。具体体验取决于产品怎么串联,但技术拼图已经基本备齐。

从这个角度看,阿里 Qwen-Audio-3.1 的意义已经超出声音更像真人。能听懂、能创作、能聊天,正在让语音成为连接人、内容与 AI 的自然入口。

当一句话既能表达需求,也能开启创作、推动事情往下走,语音才真正从一种输入方式,变成了与 AI 协作的方式。

会议推荐

QCon 全球软件开发大会·2026(上海站)将于10 月 22 日—24 日举办。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。查看更多详情可扫码或联系票务经理 18514549229 进行咨询。

今日荐文

你也「在看」吗?