9月15日消息,阶跃星辰今日发布新一代语音大模型StepAudio 3系列,一次推出StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型,覆盖实时语音交互、语音识别、语音生成、音频生成及音乐创作等场景。目前,五款模型均已上线阶跃星辰开放平台。

其中,StepAudio 3 Realtime主要面向实时语音交互,支持原生全双工对话,可在持续交流中判断回应和等待时机,并处理临时打断及连续反馈。在第三方AI模型评测机构Artificial Analysis的Conversational Dynamics榜单中,该模型综合得分为98.9%。

打开网易新闻 查看精彩图片

除实时对话外,StepAudio 3 Realtime还加入语音推理和任务执行能力,可同时理解语义、语气、情绪及环境声音,并支持推理与语音生成并行。Tool Call和长任务可以异步执行,在任务运行期间继续进行当前对话。据阶跃星辰披露,该模型在Artificial Analysis Speech Reasoning榜单中位列全球第一。

语音识别方面,StepAudio 3 ASR支持中文、英文、方言、中英混说、长音频和专业领域等场景,并针对低声、快速语音、含糊连读及背景音乐等复杂输入进行优化。在Artificial Analysis非流式语音识别准确性榜单中,其WER(词错误率)为1.7%,并列全球第一。

生成能力方面,StepAudio 3 TTS支持音色、语调、节奏、停顿和情绪控制,同时可以生成笑声、迟疑、重复、改口等副语言表现,并采用流式生成架构。StepAudio 3 Gen则将人声、音效、环境声和背景音乐等生成能力整合,用户可通过自然语言描述角色、场景和剧情,生成包含多种声音元素的完整音频。

此外,StepAudio 3 Music面向音乐创作,支持歌曲创作、清唱配乐、歌曲翻唱以及基于ABC记谱法的多轮交互创作,用户可以通过歌词、清唱、参考歌曲等形式进行编曲和作品迭代。(定西)