科大讯飞上线了一款语音基座大模型,名字叫 Spark-Audio-1.0-Preview。它最特别的地方不在参数,而在训练方式——基于纯国产算力集群训练完成。
过去大模型处理音频,走的是一条"绕路":先把语音转成文字,再交给大模型去理解。这条路有两个绕不开的坑。
绕路方案的两个坑
第一个坑是信息丢失。文字只能记录"说了什么",语音里自带的语气、情绪、背景环境音,在转写这一步就被丢掉了。模型拿到的是一份残缺的输入,对场景的判断自然不完整,最后的结果也会受影响。
第二个坑是链路割裂。语音转写、声纹识别、语音翻译这些能力被拆成独立模块串联运行,模块之间存在断点。断点不仅容易累积错误,用起来还会出现延迟、卡顿。
语音基座大模型的思路是换一条路:不再只做语音转文字,而是直接理解语音。人声、环境音、音乐一次性听懂,声音里的语义、情绪和场景也一并理解。
0.65B编码器配30B-A3B大模型
这次首发的 Spark-Audio-1.0-Preview,结构上是两段式组合:音频编码器采用 0.65B 的 Dense 结构,搭配 30B-A3B 的 MoE 结构大语言模型。
训练数据用了 1300 万小时音频,外加大量文本数据,基于纯国产算力集群训练完成。同一个模型里可以输入文本和语音两个模态,支持的任务包括:
- 语音转写
- 多语言翻译
- 多方言识别
- 环境音识别
- 说话人识别
- 情感分析
- 复杂音频问答
官方给这组能力的定位是:让机器从"听清"走向"听懂"。
99种语言、202种方言,复杂场景是强项
Spark-Audio-1.0-Preview 支持 99 种语言及 202 种方言的识别。官方称,它在各项语音评测任务上效果整体相当、部分超过,尤其在复杂场景高噪声、小声说这类偏真实应用的任务上明显领先;与尺寸更大的闭源语音基座模型相比,表现也十分接近。
具体到对比数据:与同尺寸的 Qwen3.5-omni-flash(35B-A3B)相比,它在平均效果上表现出多语言、多方言语音识别上的优势;与尺寸高一个数量级的 Qwen3.5-omni-plus 效果接近。
在 Fleurs、Kespeech、LibriSpeech 等中英文、多语言、多方言语音识别评测任务中,它的得分高于 Gemini-3.1 Pro;在 Fleurs-中文测试集中取得了 SOTA。
官方同时提到,这款模型在通用知识、数学与代码等任务上没有出现明显降智,但在指令遵循、对话、音频理解等任务上仍有进步追赶空间。
可以微调,也能落地
和讯飞星火的 1+N 体系类似,语音基座大模型上也可以做微调,用来开发语音识别、语音同传、语音交互等专用模型或系统,在相关语音业务中落地。
目前 Spark-Audio-1.0-Preview 已正式开放体验,API 后续将上线讯飞开放平台。
热门跟贴