近日,《阿里云AI十大技术进展》报告(以下简称“报告”)发布,系统呈现出阿里云在基础设施、模型架构、后训练可靠性、多模态以及智能体自主能力等前沿方向的创新成果。

2025年,阿里云有数百篇研究论文发表于 NeurIPS、ACL、CVPR、ICML等全球顶级学术会议及期刊,报告的十大技术进展基于这些研究凝练而来,其中门控注意力机制研究荣获AI顶级会议NeurIPS 2025最佳论文奖,多项研究已应用于通义实验室的模型开发,比如最新发布的Qwen3.5模型。它开始“更专注”、“更实惠”、更懂现实世界,甚至更“有原则”。

打开网易新闻 查看精彩图片

让AI“抓重点”:治好“注意力沉没”,让AI真正读得进长文档

模型架构是AI的“大脑”,决定了信息处理的效率上限。传统Transformer架构在处理长序列时存在“注意力沉没”(Attention Sink)现象——大量注意力被浪费在序列开头,如同花很多时间读一本书的序言却忽略正文。

阿里云提出的门控注意力机制(Gated Attention),将无效注意力从46.7%降至4.8%。该研究已应用最新的Qwen3.5模型,显著提升模型的性能与鲁棒性。

让推理“更经济”:Token粒度调度,资源利用率提升至48%

对大模型而言,基础设施、后训练与推理服务构成了AI的工业化“流水线”。而大模型成本高企,一大症结在于资源调度粗放。为降本增效,阿里云在这三个环节实现了工业化级别的协同。

基础设施层,Aegaeon多模型服务系统实现了Token粒度的自动扩缩容,支持GPU在不同模型请求间毫秒级切换,结合高效的组件复用与内存管理,GPU资源池的利用率提升至48%,让“拼车式”模型部署成为可能,大幅降低企业使用AI的资源消耗。目前,该系统已应用于阿里云大模型服务平台百炼,为全球客户提供高效、经济的模型服务调度支持。

推理服务阶段,AsymKV非对称量化技术精准区分了Key与Value的敏感度,为业界最极致的压缩方案之一,在保证模型不“失忆”、不“变笨”的前提下,大幅降低了长文本推理的显存占用。

后训练连接了基础模型与产业应用,高熵稀疏训练与组序列策略优化(GSPO)等成果构建了高效、稳定、可扩展的后训练技术体系,为企业通过专属数据与强化学习解决商业环境的复杂任务打下坚实基础。

更有原则:不再“一刀切拒绝回答”

AI可用性的最后一公里,取决于其可控性,但安全防护过高,会导致AI采用“一刀切”的拒答策略,过于保守。在模型内生安全方面,阿里云首创神经元级安全调控机制,识别并干预“安全注意力头”,让AI既能守住底线,又避免过度保守,实现“有原则地说话”。

更懂现实世界:图像看得清、视频动得真

在多模态领域,阿里云通过“Thinker-Talker”架构,让模型同时具备深度理解(Thinker)与实时生成(Talker)能力,无需中间的对齐模块。基于此打造的Qwen3-Omni一开源即登顶Hugging Face全球榜单,让AI的“艺术创造力”走向工业化。

更进一步:从被动问答到主动干活

2025年,Agent迎来爆发。阿里云首创ZeroSearch(零资源搜索激励机制),让模型通过自我博弈,在虚拟环境中学习搜索策略,摆脱了对商业搜索API的依赖,大幅降低了训练门槛;在智能体方向,推出WebResearcher等工具,赋予AI深度调研、自我纠错及社会模拟能力。

中国工程院院士潘云鹤对报告给予高度评价:“报告所展现的从数据驱动的基础设施优化、革新模型的注意力架构,到提高可靠性的后训练技术、激发自主能力的智能体框架,勾勒出一条清晰的技术演进路径。”

近年来,AI竞争的核心正从单一模型的性能竞赛,转向覆盖芯片、模型、平台乃至应用的全栈系统工程能力比拼。报告的研究成果显示,阿里云正以“系统工程思维”攻坚。而立足于通义实验室、阿里云和平头哥组成的黄金三角“通云哥”,阿里巴巴正在打造成一台AI超级计算机,通过协同创新,推动AI向更高效更安全更自主的方向进化。