打开网易新闻 查看精彩图片

新智元报道

打开网易新闻 查看精彩图片

在语音助手、多用户共享的家庭助理等长期对话场景中,模型需要跨越多次会话记住用户的信息,但现有评测常遭遇两大难题:

一是语音中的关键信息不止于文字,说话人身份、语气和背景声只存在于音频信号里,转写后即丢失,而现有基准大多只考词汇内容;

二是真实交互分布在相隔一段时间的多个会话中,现有基准却局限于单段录音或单段连续对话,且在不同长度下使用不同题目,无法分离历史长度本身的影响。

为突破这两道关卡,墨尔本大学与新南威尔士大学联合团队提出多会话语音记忆基准VoxMem,以「声学证据×记忆操作」的二维分类法覆盖15种考察组合,并让每道题在8K到64K token的历史长度下保持不变。VoxMem包含3,196个评测实例、34,743个语音会话(约177小时)。对15个音频大模型的评测显示,32K下无一整体准确率超过40%,追踪语气变化和背景声变化的平均准确率仅为3.4%与1.2%。

打开网易新闻 查看精彩图片

论文链接:https://arxiv.org/abs/2609.32607

代码链接:https://github.com/swagshaw/voxmem

一句话里

藏着三种文字记不下的信息

设想家里有一台语音助手,同时为一家人服务。某天你随口问它:「我之前说灯具更换那件事,后来怎么样了?」

要答对这个问题,助手得先做一件文字处理不了的事:听出提问的人是你。因为就在几天前,家里另一个人也跟它聊过灯具更换,说的是「已经批准了」;而你当时说的是「先暂停」。

打开网易新闻 查看精彩图片

这正是语音和文字最大的不同。会议纪要能记下每个人说了什么,却记不下说话时的犹豫、惊讶,也记不下窗外的施工声。语音转写也是如此:一句话转成文字后,说话人是谁、用什么语气说的、背景里能听到什么,都随之消失。

而这些信息,恰恰可能是之后某个问题的答案。「上次聊入住的时候,我听起来是不是有点不情愿?」「那两次聊喂猫计划的对话,背景里是不是同一台洗衣机的声音?」这类问题,在文字记录里找不到答案。

上下文越来越长

记忆未必跟得上

如今的音频大模型(Large Audio Language Model,LALM)上下文窗口越拉越长,一次能装下几十分钟的音频。直觉上,把所有历史对话都塞进去,模型就能「记住」一切。

但书架变大,不等于能找到那本书。能装下历史,和能在需要时准确取回、正确使用其中的信息,是两回事。

要回答「模型到底记住了多少」,首先需要一把合适的尺子。研究团队梳理了现有的长音频理解基准和语音对话基准,发现它们在三方面都不够用。

第一,考的大多是「说了什么」,只零星涉及少数声学线索,很少系统地考察谁在说、怎么说、周围能听到什么。

第二,记忆操作是临时挑选的。有的基准只考检索,有的考整合,没有统一的框架。于是当模型答错时,很难判断问题出在某类信息、某种操作,还是两者的组合。

第三,它们都建立在一段长录音或一段连续对话之上。真实的语音交互却分布在相隔数天的多次会话中:同一个人反复出现,话题来回切换,早先的计划会被更新。

此外,分析历史长度影响的基准,往往在不同长度档里放的是不同的题。这就像用两套不同的试卷比较成绩,分数下降究竟是因为「内容变多」还是「题变难」,说不清楚。

把「记住什么」和「怎么用」拆开

VoxMem的第一步,是给语音记忆画一张完整的地图。它用两个维度刻画每一道题。

第一个维度是声学证据,即要从过去的语音里记住什么:

  • 语音语义:说了什么,比如计划、数量、偏好;

  • 说话人身份:谁说的,需要把内容和声音对应起来;

  • 副语言线索:怎么说的,比如犹豫、惊讶、强调、语速、笑声;

  • 环境声:说话时周围能听到什么,比如交通声、警报声、家电声。

其中语音语义从文字就能恢复,作为参照;后三类是「音频原生」的,答案不在转写里。

第二个维度是记忆操作,即要怎么使用这些记忆:

  • 信息抽取(IE):从某一次过去的会话中取回信息;

  • 多会话推理(MSR):把几次会话的证据结合起来,比如计数、匹配、比较;

  • 时序演变追踪(TET):追踪某个状态如何随会话变化,比如最近一次是什么语气;

  • 拒答(AR):当历史不足以给出唯一答案时,要能说「无法确定」。

两个维度交叉,得到一张4×4的表。其中「语义×信息抽取」被刻意去掉:如果检索线索和答案都是文字,题目就退化成了纯文本检索,测不出声音与内容之间的关联。剩下的15个格子,就是VoxMem的全部考点。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

同一道题

只让历史变长

有了地图,下一步是出题。研究团队在设计上花了很多心思,确保题目「必须用耳朵答」,而且分数的变化能被准确归因。

在海里放假针。每段对话历史由三类会话组成:含有答案的证据会话;话题相近、但不给答案或给出不同取值的干扰会话;以及与问题无关的日常填充会话。

这有点像「大海捞针」的升级版:针不再是一句话,而是一个声音、一种语气或一段背景声,海里还放了长得很像的假针。研究团队专门检验过干扰会话的难度:一个只看文本的分类器区分证据会话和干扰会话,准确率只有51%–56%,与打乱标签时的47%–49%相差无几。

同一句话,录两个版本。用户语音由TTS合成:每位用户在所有会话中固定使用同一个音色,语气通过风格控制注入,环境声按固定信噪比混入。每个带有声学线索的轮次,都会同时保留一个「配对版本」:文字相同、音色相同,只去掉那条线索。这相当于为每条线索准备了一组对照实验,质检时用来确认答案确实由线索决定,而不是由文字决定。

卷子不变,只加页数。每道题都被放进8K、16K、32K、64K四种长度的历史中,大约相当于2.5到20分钟的音频。长历史严格包含短历史的全部会话,只往里增加干扰和填充会话。问题、答案和证据在四个长度下完全相同,分数下降只能归因于历史变长。证据会话和干扰会话在历史中均匀分布,位置和时间戳都不会透露答案在哪里。

打开网易新闻 查看精彩图片

为了确认「音频原生题」名副其实,研究团队还做了一个直接的检验:把每个用户轮次换成它的精确文字,其余不变,再让模型作答。结果,音频原生题的准确率从46.2%骤降到4.4%,而语音语义题只从75.9%降到71.0%。也就是说,即使给出完美的转写,这些题也基本答不出来。

此外,每道题还要经过两级质量控制:会话级检查转写是否准确、说话人是否一致、线索能否被听出;题目级检查答案是否唯一、是否真的需要相应的记忆操作和声音信息、整段历史中有没有泄露答案。最终,VoxMem包含799道题、3,196个评测实例、34,743个语音会话,约177小时音频,覆盖20类日常话题。

15个模型

没有一个超过40%

研究团队评测了15个音频大模型,其中5个闭源(3个Gemini、2个Qwen),10个开源,覆盖音频专用和全模态两类架构。所有模型使用相同的输入和指令,回答由LLM裁判按答案类型判分,换用另一个模型复判的一致性κ达到0.95。

打开网易新闻 查看精彩图片

第一个结论很直接:在32K长度下,没有一个模型的整体准确率超过40%。排名第一的Qwen3.8-Omni-Flash为38.5%,闭源模型平均33.0%,开源模型平均21.9%。低分并不集中在少数模型上,而是普遍现象。

按证据类型拆开看,差距更加明显。32K下,闭源模型在语音语义上平均55.6%,在说话人身份、副语言、环境声上则分别只有32.7%、20.0%和21.9%。开源模型对应为31.6%、26.7%、14.5%和15.5%。

换句话说,模型在「说了什么」上的成绩,掩盖了它们在声音本身上的大量失败。

说出口的变化记得住

没说出口的几乎全忘

把四种操作和四类证据交叉起来,能看到更细的结构。

打开网易新闻 查看精彩图片

一个反直觉的发现是:跨多次会话做推理,并不一定比从单次会话中找信息更难。多会话推理在语义和说话人身份上分别达到41.8%和43.1%,在副语言和环境声上也有26.7%和25.2%,明显高于对应的信息抽取(8.8%和13.5%)。

反差最大的是时序追踪。如果状态的变化是说出口的,比如「入住改到周二了」,15个模型平均能追到44.5%;在说话人身份上降至20.0%;而当变化只体现在声音里,比如这次语气变了、背景声换了,准确率几乎归零:语气变化3.4%,背景声变化1.2%。

论文认为,问题不在于模型不会做时间推理,而在于它们很难维护和更新由语气或环境声承载的「状态」,这可能反映了当前音频大模型在状态建模上的不足。

拒答率更高

不等于更「谨慎」

VoxMem还专门设计了「证据不足、应该拒答」的题。这些题由可答题派生而来,比如删掉关键的证据会话,或者保留文字、只去掉能锁定答案的那条声学线索。

有意思的是,模型在副语言和环境声题上的拒答准确率(34.3%和34.2%),反而高于语义和说话人题(19.9%和16.2%),与可答题的规律正好相反。

这并不说明模型在声学问题上更「谨慎」。论文的解读是:模型拒答往往不是因为判断出证据缺失,而是因为即使证据就在那里,它也难以识别和使用声学信息。

越聊越忘

但忘的方式不一样

由于题目和证据固定不变,VoxMem可以干净地观察「历史变长」这一个因素的影响。

打开网易新闻 查看精彩图片

从8K到32K,闭源模型平均准确率从40.1%降到33.0%,开源模型从26.6%降到21.9%。在能处理完整64K历史的10个模型上,四类证据都在持续下降。到64K时,模型在语义上保留了8K时70.3%的准确率,副语言为69.8%,说话人为66.5%,环境声只有63.2%。

值得注意的是,副语言的绝对准确率最低,衰减速度却和语义差不多;说话人和环境声则衰减得最快。这说明「基线低」和「对长度敏感」是两种不同的失败:模型在任何长度下都很难处理语气信息,而说话人和环境声的记忆,则是随着历史增长被逐渐侵蚀。

错在哪一步?

多数在「听进去」之前

准确率告诉我们模型错了,错误分析则试图回答错在哪里。研究团队按一次记忆查询可能失败的先后顺序,把64K下的错误回答分成几类:没找到证据(识别或定位失败);找到了,但挂错了人或会话(绑定错误);找到也挂对了,但操作做错了(操作执行错误);以及答出了历史里根本没有的内容(无依据答案)。

打开网易新闻 查看精彩图片

结果显示,三类声学信息的「病因」各不相同。说话人题的错误有48%是绑定错误:内容记对了,却记到了别人头上,或挂错了会话。副语言题的错误有63%是定位失败:答案所需的语气线索根本没被找回来。环境声题的错误则分布在定位失败(41%)和无依据答案(39%)之间。

论文附录记录了几个典型案例。一道说话人计数题的正确答案是2,某开源模型却回答10:历史里有10次会话聊过这个话题,但只有2次满足题目要求的说话人条件,模型数的是话题,不是说话人。另一道环境声题中,证据会话的背景声是引擎声和母鸡叫,某闭源模型却编出了「厨房清洁声」的分组和计数。

从操作看,时序追踪的错误有55%是定位失败,操作执行错误只占5%。在全部被归因的错误中,「证据找到了、也绑定对了、只是操作出错」的情况仅占8.4%。这意味着,当前音频大模型在语音记忆上的瓶颈,大多不在「想」,而在「听进去并记住」。

结语

过去几年,音频大模型的进步有目共睹:能听懂指令、能流畅对话、能处理越来越长的音频。但当语音助手从一问一答走向长期陪伴,它面对的不再是一段孤立的录音,而是跨越数天乃至数周的交互历史。

VoxMem的结果表明,只把上下文窗口拉长,并不足以带来真正的长期记忆。模型对「说了什么」的记忆远好于对「谁说的、怎么说的、听到了什么」的记忆;只有当变化被说出口时,它们才能较可靠地追踪;历史越长,已有的证据越难取回。

论文指出,未来的系统需要保留文字之外的声学信息,并在时间上维护它与说话人、事件和会话之间的关联。VoxMem希望为衡量和推动这一方向的进展,提供一个系统化的基础。

参考资料:

https://arxiv.org/abs/2609.32607

编辑:LRST