原标题:网易有道Confucius4-TTS再升级:论文发布获AK转发,技术社区反馈积极
Confucius4-TTS 近日迎来一次重要更新,进一步补齐开源模型的高性能推理与服务化能力:新增 vLLM 推理后端,支持流式语音生成,并提供 Web Demo 与 API 接口,让开发者更容易部署和接入实际应用。
相关技术论文《Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder》已上线arXiv,系统介绍了模型在跨语种零样本语音合成与音色克隆方面的技术方案。
论文发布后也获得海外社区关注,官方推文评论区反响热烈,技术开发者对模型的实际效果给予高度评价。知名AI论文博主 AK 对相关内容进行了转发。斯坦福大学博士、硅谷语音AI公司OrukLabs创始人Nathan Roll 在体验后称赞模型表现出色。
斯坦福大学博士、硅谷语音AI公司OrukLabs创始人Nathan Roll 在体验后称赞模型表现出色。
在效果验证上,团队将 Confucius4-TTS 与 ElevenLabs、MiniMax、OmniVoice、Qwen3、VoxCPM 等5款主流开源及闭源 TTS 服务进行了人工主观评测。在中→英、英→中、中→韩、中→日4个跨语种方向中,Confucius4-TTS 斩获3项综合第一、1项综合第二;音色相似度4个方向全部排名第一;16项核心指标中10项排名第一、15项进入前二。
从模型开源、效果验证,到推理加速、流式输出与服务化部署,网易有道正在持续完善Confucius4-TTS从“模型能力”到“开发者可用”的完整链路,为实时翻译、语音助手、数字人及内容创作等场景提供更加易用的多语种语音基础能力。
热门跟贴