千问发布语音合成大模型 Qwen-Audio-3.0-TTS,支持自然语言指令控制,Flash 版首包延时 300 毫秒级别
金融界
·北京
·金融界网站官方账号 优质财经领域创作者
据千问官方消息,千问正式发布语音合成大模型 Qwen-Audio-3.0-TTS。该模型支持 Free-style 自然语言指令控制,用户可通过自然语言描述实现对合成语音效果的定制。
此次发布的模型包含两个版本:Flash 版本与 Plus 版本。Flash 版本面向实时交互场景设计,首包延时达到 300 毫秒级别,可用于对话等低延迟语音合成任务。Plus 版本面向高质量生成需求,提供更优的合成音质表现。
市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。
本文源自:市场资讯
作者:疏桐
热门跟贴