智东西8月21日报道,过去一个月,阿里巴巴模型发布全面提速,大语言、图像、语音、视频、音乐五大类模型密集完成重要版本迭代,性能均跻身国际第一梯队。
有业内人士评价,多模态是下一代智能的范式。阿里在多模态上的布局节奏,远比市场感知的要快。
模型密集迭代的另一面,是模型能力开始与云基础设施的增长形成更紧密的联动。2027财年第一季度(对应2026年4月1日-6月30日),阿里云外部商业化收入增速提升至45%,创下22个季度新高。AI云及算力服务收入484.37亿元,经调整EBITA达到56.28亿元,同比暴增133%。AI相关产品收入123.76亿元,连续第12个季度保持三位数同比增长。
在AI进入价值兑现期的当下,多模态也正在从模型榜单上的“能力补齐”,走向更广泛的产业场景,成为观察阿里AI进展的一条重要暗线。
一、阿里AI不只有语言模型,多模态全面开花
刚刚过去的一个月,阿里在模型发布上按下了加速键。
大语言模型方面,8月发布的Qwen3.8-Max总参数达到2.4万亿,在当时编程竞技场CodeArena排名全球第三,在Artificial Analysis Agentic榜单登顶全球第一。Qwen3.8-27B开源仅两天,下载量就突破100万次。截至8月,阿里累计开源模型超过460个,Qwen系列全球下载总量突破30亿次。
芯片厂商和推理框架也在快速跟进。平头哥、英伟达、AMD、沐曦、联发科、摩尔线程等国内外芯片厂商Day0适配Qwen3.8,vLLM、SGlang、Ollama等开源社区第一时间优化推理框架。Qwen已经成为全球AI产业链的基础件之一。
但把时间线拉长到整个季度,会发现更密集的变化其实发生在多模态。
6月22日,视频生成模型HappyHorse 1.1发布,重点升级动态表现力、主体一致性、指令遵循、视觉质感和音频能力。
7月21日,Qwen-Image-3.0发布。它支持最长4.5k Token输入,可生成包含公式、几何图形、逻辑推导的知识图解和复杂UI,同时支持12种语言、20多款字体原生渲染。8月5日,该模型登上Arena.ai文生图榜单国内第一。
语音方向同样连续更新。7月,阿里连续发布实时语音识别模型Fun-ASR-Realtime、实时语音交互对话模型Qwen-Audio-3.0-Realtime,以及语音识别模型Qwen-Audio-3.0-ASR-Flash。Qwen-Audio-3.0系列的ASR、TTS、Realtime三类模型在Artificial Analysis今年7月的相应语音榜单中均拿下全球第一。
8月6日,Wan3.0公测,单次视频生成时长达到30秒,并首次在文本、图片、音频、视频之外支持doc、xls、ppt、pdf、md等文档输入。8月17日,AI音乐模型HappyShrimp上线,可以完成从作词、作曲、编曲到演唱的端到端整曲生成。
甚至在更前沿的世界模型方向,阿里也已经推出HappyOyster 1.0,能够根据一句话或一张图生成可互动、可探索、可实时改变的数字世界。
语言、图像、语音、视频、音乐、世界模型,一张覆盖越来越完整的模型版图已经浮现。
模型能力的扩张,也正在体现在收入端。财报电话会上,阿里透露,本季度,阿里AI相关产品ARR突破495亿元,包括MaaS在内的模型与应用服务收入(ARR)突破160亿元人民币。
至少从财报看,模型已经从技术投入逐渐变成一项规模化收入来源。
二、从榜单到场景,多模态开始走进产业一线
大语言模型的商业化路径正在变得清晰。
Anthropic靠Coding能力打开高价值企业市场,Cowork进一步把模型带入真实工作流。Qwen3.8在编程和专业办公能力上的大幅提升,正是沿着这条被验证的路径推进,从而获得市场的初步认可。
但市场可能忽略了一点,多模态也已经跨过模型炫技阶段,开始进入一线商业化场景。
语音模型正在重新成为AI时代的人机交互入口。Qwen-Audio正进入会议纪要、智能客服、车载助手、智能硬件、教育等高频场景。相比单纯聊天,这些场景拥有更明确的调用频次、付费主体和ROI。Fun-ASR-Realtime支持16种方言和30种语言,首字延迟在百毫秒级别,已经具备大规模商用条件。
图像和视频模型更贴近内容生产产业链。Qwen-Image-3.0已将复杂UI设计、多语言海报制作、知识图解等商业素材作为重点能力,支持12国语言和20多款字体原生渲染。Wan 3.0覆盖广告创意、影视制作、短视频生成、电商素材生产等环节。HappyShrimp则把生成式AI版图进一步推向音乐创作市场。
科技媒体Semafor报道,Pinterest的AI购物助手和聊天机器人采用了阿里Qwen大模型。Pinterest CEO在财报会上表示,使用开源模型的成本不到Anthropic、OpenAI等同类闭源模型的8%。他直言,任何不用开源模型的CEO,几乎都在浪费股东的大量资金。
AI对阿里核心业务的反哺也在加速。千问App深度集成淘宝天猫、淘宝闪购等生态,上线以来已有2.5亿用户通过其智能体功能实现AI驱动的购物体验。AI正在从技术能力转化为真实的商业场景。
三、能力越补越齐,阿里多模态的价值开始显现
AI真正进入产业后,客户需求天然就是多模态的。
布局多模态模型,有望帮助阿里覆盖更多需求,消耗更多云资源,带动更多配套服务。
首先,多一个模态,对应的往往就是一类新的需求和一批新的客户。比如,一家汽车公司既需要语言模型理解指令,也需要实时语音完成交互;影视、游戏、广告行业的需求则天然横跨文字、图片、声音和视频。
其次,多模态任务还会产生更重的计算需求。高清图片、长视频、实时语音等业务,对GPU、存储和网络的要求都会随之提高。阿里财报也提到,AI应用的部署、访问和持续运行,正在直接带动计算、存储、网络等通用云资源需求增长。
此外,当一个客户同时使用文本、图像、视频和语音模型后,需求链条还会继续延伸到数据处理、模型微调、数据库、对象存储、安全等环节。原本的一次模型调用,可能变成一整条AI生产链,也有望进一步提升客户黏性和综合客单价。
而支撑这套模型体系持续向前的,是阿里近几年不断加厚的全栈AI底座。
在组织层面,今年3月,阿里成立Alibaba Token Hub事业群,由吴泳铭直接负责,以“创造Token、输送Token、应用Token”为核心目标重新整合AI业务。
芯片层面,阿里自研真武AI芯片已经通过阿里云服务进入20多个行业、超过650家外部客户,覆盖训练、微调和推理等AI工作负载。吴泳铭在财报会议中提及,阿里正在数据中心大规模部署自研倚天/真武体系芯片,并希望逐步替换外购商业芯片,以提高AI云毛利率。
基础设施层面,阿里云持续扩张全球AI数据中心布局,扩建完成后将覆盖30个地域、104个可用区。其新一代CUBE 5.0架构已将大型AIDC数据中心交付周期压缩至100天,建设成本较上一代降低约10%,今年还计划将模块化数据中心全球产能提升两倍以上。
结语:AI进入兑现期,多模态价值正在被重新认识
过去两年,Qwen的纯文本语言模型几乎是外界观察阿里AI的第一窗口。但这其实只是冰山一角。在大众视线之外,阿里的多模态模型(图像、语音、视频、音乐等)正在密集迭代。阿里的 AI 版图,早已从单一的语言模型,扩展为更完整的多模态智能体系。
随着AI从聊天走向内容生产、办公、电商和真实世界交互,多模态的重要性还会继续上升。对阿里而言,这既是一场模型能力的补齐,也是一条正在进入产业深水区的新主线。被低估的多模态,正在走到台前。
热门跟贴