来源:市场资讯
(来源:IT之家)
IT之家 7 月 15 日消息,阿里巴巴实时语音交互对话模型 Qwen-Audio-3.0-Realtime 今天(15 日)正式发布,在智商、Agent 工具调用、共情对话和双工交互流畅度四条主线上同步升级,力求“又快又聪明”。
模型包括推理更强的 Plus 版本和速度更快的 Flash 版本,适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。官方表示,该模型将让语音交互“懂倾听,更聪明”。
针对自定义音色需求,也提供了音色克隆能力配置用于实际业务应用。在 S2S 语音指令遵循公开 Benchmark VStyle 上取得 SOTA 效果。
打开网易新闻 查看精彩图片
官方公布了该模型的一系列亮点如下:
模型能够根据对话语境动态调整语气、节奏、音调和情感表达,实现真正拟人化的语音交互。
该模型实现生成侧的深度优化。
无论身处何种复杂声场,它都能保持从容:
热门跟贴