AI 走向现实场景,系统化工程能力,是瓶颈,也是突破口。
作者丨幸丽娟
编辑丨齐铖湧
IJCAI-ECAI 2026 将于 2026 年 8 月 15 日至 21 日在德国不来梅举行。作为 AI 领域的综合性顶级会议,IJCAI 一直是检验各大厂过去一年前沿研究成果的关键考场:谁在哪个方向上有真进展,哪些技术路线正在形成共识,论文是最直接的答案。
大会召开之际,AI科技评论也正在系统扫描本届顶会收录的论文,从中捕捉技术趋势和行业风向。
一个清晰的趋势是:AI 算力成本居高不下,而参数规模扩张带来的边际收益早已追不上边际成本。这个经济学现实正在重塑技术创新逻辑——从"能不能做得更大"转向"能不能用得更省"。
华为被 IJCAI 2026 收录的四篇论文,为这一转向提供了技术路径参考:用更精巧的架构设计和训练策略,来对冲数据稀缺瓶颈,换取单位算力更高的智能产出。
这种技术取向的转变,也呼应了 AI 落地的深层变化:当技术走出实验室,竞争早已不是某一项能力的单点突破,而是准确性、泛化性、数据、算力之间的系统统筹——每一个环节都可能成为瓶颈,也都可能成为突破口。
下面这四篇论文,恰好从这四个方向,展现了华为的系统化工程能力和技术选择。
01
规模破壁:架构+训练,
改写层次化 ViT 的能力上限
视觉基础模型的规模化竞赛中,一直存在一层隐形的"天花板"。
普通ViT的规模化一路高歌猛进,从6B到22B不断刷新上限。但层次化ViT始终卡在2B参数以下。
不是不想做大,是做不大。层级化模型对数据和训练策略的要求比普通ViT高得多,简单套用普通ViT的规模化方案行不通。
这就导致了一个结构性矛盾——层级化ViT天然擅长多尺度表征和密集预测任务(目标检测、分割、视频理解),但规模上不去,能力的上限就被锁死了。
华为团队的这篇《Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters》,把规模上限从 2B 直接推到了 30B。
怎么做到的?答案是对模型结构和训练策略都进行重新设计,两者缺一不可。
结构上的核心设计是 Efficient Hierarchical ViT 架构。它在保证多尺度特征提取能力的同时,兼顾了计算效率。
基于这一架构,团队训练了从 200M 到5B参数的稠密模型,并引入稀疏专家混合(SMoE)变体,将总参数量推到了30B——这是目前层次化ViT领域已公开的最大参数规模。
训练上,团队设计了一套两阶段流程:
第一阶段,在ImageNet-21K上做MAE自监督预训练,让模型学会视觉表征的基本规律;
第二阶段,在2700万图像数据集上,从多个最先进的通用基础模型中蒸馏知识,实现能力跃迁。
实验结果给出了最有力的证明。在ImageNet-1K线性评测中,总参数30B的MoE模型(EHV-5B-MoE)推理时仅激活67亿参数,就以89.0%的准确率,超越了普通ViT路线下、总参数更大的模型EVA-CLIP-18B。
更重要的是,它的性能提升不局限于图像分类——视频分析和密集预测任务上同样表现优异。这说明EHV学到的不只是分类特征,而是真正高质量、可泛化的视觉表征。
华为团队用这项工作,证明了层次化ViT不仅能做大,而且在推理侧,能用更少的激活参数,达到更高的准确性。
架构设计决定了模型的能力上限,而训练策略则决定了这一上限能在多大程度上被释放。
02
输入前置筛选:
可学习帧选择器的范式革新
模型底座的天花板抬高了,但算力的消耗不仅仅在模型本身,喂给模型的数据,同样在大量吞噬计算资源。
视频-大语言模型(Video-LLMs)处理视频时,计算成本主要消耗在帧编码上。为了控制成本,现有模型几乎都采用均匀采样——等间隔抽帧。
然而,视频里的关键事件从来不会均匀分布。一个重要的动作可能只持续一两秒,如果恰好落在两个采样点之间,就被彻底漏掉了。相反,那些冗长的静态画面却被反复编码,浪费了宝贵的计算资源。
另一种思路是查询驱动的方法——根据具体问题去检索相关的帧。这在视频问答场景下确实有效,但详细视频描述是一个“无查询”任务,这种方法在这里派不上用场。
均匀采样太粗糙,查询驱动的方法又用不了。怎么破?
华为 AI 数据团队提出的可学习的帧选择器 LFS(Learnable Frame Selector),试图来解决这个问题。
论文地址:https://arxiv.org/pdf/2601.14594v1
他们的核心想法很直接:与其靠人工规则选帧,不如让模型自己学会“该看什么” 。
这是一种“以终为始”的训练范式,LFS 不再学“选哪些帧在某个中间得分上更高”,它学的是“选哪些帧能让大模型写出更好的描述”。
具体怎么做的?三个关键设计:
第一,训练一个评分网络,给每一帧打一个“事件重要性”分数。
第二,分段选帧而非全局排序。选帧时不用简单的“得分最高的前K个”,而是把整个视频切成多个时间段,在每个时间段里分别挑最重要的帧。这样既抓住了关键事件,又保证了帧在时间轴上分布均匀。
第三,也是最关键的一步——训练方式。LFS选好帧之后,把它们喂给冻结的Video-LLM生成描述,拿生成的描述和人工标注的标准描述做对比,算出损失,再反向传播去更新帧选择器的参数。整个过程中大语言模型本身一动没动,LFS就像一个即插即用的外挂模块。
此外,研究团队还发现了一个问题:现有的详细视频描述基准和人类真正的认知之间有挺大的差距。因此他们自建了一个新基准ICH-CC,视频全部来源于中国非遗烹饪的真实商业场景(如餐厅后厨、烹饪教学等),所有描述和问答均由人工精心撰写,更贴近真实应用场景。
实验结果怎么样?
LFS在不同模型和不同基准上都带来了普遍且稳定的提升。所有模型的 LFS增强版,在所有测试基准上都高于基线模型,这说明LFS 不仅能在单一基准上取得好成绩,具备一定的通用性。
这也回应了论文的核心命题:与其让模型在均匀采样的帧上“硬算”,不如在输入端做一次智能筛选——选对了帧,下游任务的表现也随之有所提升。
通过 LFS 生成的更优描述,视频问答等下游任务效果也得到提升
03
任务适配:
表征模块化干预取代全模型微调
大语言模型的跨任务泛化能力,一直是个“说起来重要、做起来难”的问题。
现有主流方案是per-token动态路由——每个token在处理时,都要在多个LoRA适配器之间做选择,决定走哪条路。这套机制确实有效,但代价也不小:计算量和显存占用都居高不下,模型跑起来又慢又吃显存。
另一种思路——表征微调(ReFT),则不再动模型参数,而是只编辑前缀和后缀token的表征来实现单任务适配,效率比LoRA高不少。
但它有两个短板:一是token本身的语义就有歧义,只改首尾不够精准;二是缺少一种“自引导”机制,模型面对没见过的新任务时,不知道该改哪一层、改哪个表征。
华为云团队与多所高校合作,提出了表征感知的模块化 RaMod(Representation-Aware Modularity) 框架,把 ReFT 的思路成功扩展到了跨任务泛化场景。
核心做法可以拆成两部分来看:
第一部分是双模块表征与参数微调。ReFT只能动首尾,RaMod 精细得多——从中间层的隐藏表征里挑出一个策略筛选过的子集,来做模块化干预。改哪里、怎么改,都是有选择、有策略的。这样能更精准地引导模型去解决没见过的任务。
第二部分是异步调度器。跨任务泛化最怕显存不够,RaMod设计了一套主动调度机制:需要哪些干预就分配显存,用完了就主动释放。这样一来,存储开销被压到了最低。
效果立竿见影。实验表明,RaMod不仅跨任务泛化效果更好,成本也大幅下降:相较于原始 LLMs,该方法额外预填时间减少了83%,生成延迟降低 100%,显存占用少了79%。
换句话说,RaMod把任务适配从"改模型"变成了"调表征"——不动模型主体,只在关键层的隐藏状态上做定点编辑。
这种思路如果成立,大模型部署的经济学可能会被改写:一个底座模型配上若干轻量级干预模块,就能低成本地服务于截然不同的任务场景,而不必为每个场景单独训练或加载完整副本。
不过在“改写”之前,这种表征微调的方法,仍有一些关键问题需要回答,比如在复杂推理等高难度场景中,是否依然能在大幅节省算力成本的同时守住准确性。
04
数据破局:语言专家各司其职,
渐进训练步步为营
前三篇论文都在解决"怎么更高效地用模型"。但很多任务还有一个更根本的现实挑战:如果连训练数据都不够呢?
语码转换(Code-Switching,CS)语音翻译任务,需要将夹杂多种语言的语音翻译成目标语言。这种任务不仅语义建模复杂,CS 数据的稀缺性,更是一个大问题。
以前的研究主要靠两条路走:要么让模型自己去"悟"语义表征,效果不可控;要么花大价钱做人工标注,成本太高,规模也做不大。
华为翻译服务中心团队,与厦门大学、澳门大学合作的这篇论文,提出了一个新思路:与其让模型自己摸索不同语言的语义表征,不如主动把它们对齐好——为每种语言单独建一个"专家团队",让各团队分别负责各自语言的语义建模,最后再统一对齐。
论文地址:https://arxiv.org/pdf/2511.10670
具体实现方式有两个关键设计:
第一个是MoE(混合专家)语音投影器。传统投影器对所有语言一视同仁,效果自然不理想。MoE版本的做法是给每种语言分配一组专门的"专家",每个专家组只负责一种语言的细粒度语音特征建模。路由机制会自动把语音特征送到对应语言的专家组手里。
为了保证路由不跑偏,论文还引入了两个辅助损失:语言特定损失确保每个专家真正学会对应语言的特征,组内负载均衡损失防止所有token都挤到同一个专家。
第二个是多阶段训练范式。数据不够,就用策略来凑。整个训练分四步走:先用自动语音识别(ASR)数据分别预训练每种语言的投影器,打好语音-文本对齐的基础;然后把各语言的投影器组装成MoE结构,用语言特定损失和负载均衡损失联合优化;接着从ASR 数据逐步过渡到单语语音翻译(ST)数据,用过渡损失平滑迁移;最后从 ST 数据适配到CS语音翻译数据。
这套渐进式设计的精妙之处在于——不是让模型直接硬啃稀缺的 CS 数据,而是先用充足的 ASR 和 ST 数据把基础能力打牢,再一步步转向目标任务。
实验对比了Whisper、SeamlessM4T、LLaST等多个强基线模型。在Fisher和NTUML2021的四个测试集上,该方法均超越了其他模型中表现最突出的 SeamlessM4T,BLEU最高达到39.52,COMET最高达到81.33。
这项工作传递的信号很明确:在数据稀缺的跨语言场景下,精细化的架构设计和渐进式的训练策略,也许比单纯堆数据更管用。
需要注意的是,这项工作在语言数量有限、数据质量可控的场景下,是有效的“尖刀方案”,但在需要覆盖数十种语言的通用多语种翻译系统中,是否具备可扩展性,还需要进一步论证。
05
结束语:
以设计密度,换算力成本
30B层次化ViT重构了模型骨架,让67亿激活参数在ImageNet上超越了180亿的对手;
LFS在输入端做了一道减法,把大量无意义的帧编码开销挡在计算之前;
RaMod把全量微调压缩成表征层的定点编辑,跨任务适配的显存和延迟一起降了下来;
语码转换语音翻译则用MoE分工和渐进式训练,在数据最匮乏的赛道上证明了一个道理:架构的智慧,有时候能够弥补数据的贫瘠。
四篇论文,四个方向,都在指向同一个内核:华为正在用“设计密度”取代“规模密度”。四篇论文分别来自基础研究、AI数据、云服务和翻译服务中心,说明效率优先已不仅仅是某个团队的偏好,这个逻辑被写进了各个环节的技术选择里。
如果把过去两年的AI竞赛比作“拼矿”,那2026年正显露出一个拐点:拼“冶炼技术”的时代已经开始了。稀疏激活、智能筛选、模块化适配、渐进式训练——这些路径不依赖更多的芯片和算力,而依赖对问题本身更深刻的理解。
无论大厂还是创业公司,早已走过了参数军备赛,AI 的下半场,对现实落地问题的理解,以及系统化解决这些问题的工程能力,才是真正的决胜点。
IJCAI 2026 要来了,你还在单打独斗?
为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
热门跟贴