打开网易新闻 查看精彩图片

AI 走向现实场景,系统化工程能力,是瓶颈,也是突破口。

作者丨幸丽娟

编辑丨齐铖湧

IJCAI-ECAI 2026 将于 2026 年 8 月 15 日至 21 日在德国不来梅举行。作为 AI 领域的综合性顶级会议,IJCAI 一直是检验各大厂过去一年前沿研究成果的关键考场:谁在哪个方向上有真进展,哪些技术路线正在形成共识,论文是最直接的答案。

大会召开之际,AI科技评论也正在系统扫描本届顶会收录的论文,从中捕捉技术趋势和行业风向。

一个清晰的趋势是:AI 算力成本居高不下,而参数规模扩张带来的边际收益早已追不上边际成本。这个经济学现实正在重塑技术创新逻辑——从"能不能做得更大"转向"能不能用得更省"。

华为被 IJCAI 2026 收录的四篇论文,为这一转向提供了技术路径参考:用更精巧的架构设计和训练策略,来对冲数据稀缺瓶颈,换取单位算力更高的智能产出。

这种技术取向的转变,也呼应了 AI 落地的深层变化:当技术走出实验室,竞争早已不是某一项能力的单点突破,而是准确性、泛化性、数据、算力之间的系统统筹——每一个环节都可能成为瓶颈,也都可能成为突破口。

下面这四篇论文,恰好从这四个方向,展现了华为的系统化工程能力和技术选择。

01

规模破壁:架构+训练,

改写层次化 ViT 的能力上限

视觉基础模型的规模化竞赛中,一直存在一层隐形的"天花板"。

普通ViT的规模化一路高歌猛进,从6B到22B不断刷新上限。但层次化ViT始终卡在2B参数以下。

不是不想做大,是做不大。层级化模型对数据和训练策略的要求比普通ViT高得多,简单套用普通ViT的规模化方案行不通。

这就导致了一个结构性矛盾——层级化ViT天然擅长多尺度表征和密集预测任务(目标检测、分割、视频理解),但规模上不去,能力的上限就被锁死了。

华为团队的这篇《Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters》,把规模上限从 2B 直接推到了 30B。

打开网易新闻 查看精彩图片

怎么做到的?答案是对模型结构和训练策略都进行重新设计,两者缺一不可。

结构上的核心设计是 Efficient Hierarchical ViT 架构。它在保证多尺度特征提取能力的同时,兼顾了计算效率。

基于这一架构,团队训练了从 200M 到5B参数的稠密模型,并引入稀疏专家混合(SMoE)变体,将总参数量推到了30B——这是目前层次化ViT领域已公开的最大参数规模。

训练上,团队设计了一套两阶段流程:

第一阶段,在ImageNet-21K上做MAE自监督预训练,让模型学会视觉表征的基本规律;

第二阶段,在2700万图像数据集上,从多个最先进的通用基础模型中蒸馏知识,实现能力跃迁。

实验结果给出了最有力的证明。在ImageNet-1K线性评测中,总参数30B的MoE模型(EHV-5B-MoE)推理时仅激活67亿参数,就以89.0%的准确率,超越了普通ViT路线下、总参数更大的模型EVA-CLIP-18B。

更重要的是,它的性能提升不局限于图像分类——视频分析和密集预测任务上同样表现优异。这说明EHV学到的不只是分类特征,而是真正高质量、可泛化的视觉表征。

华为团队用这项工作,证明了层次化ViT不仅能做大,而且在推理侧,能用更少的激活参数,达到更高的准确性。

架构设计决定了模型的能力上限,而训练策略则决定了这一上限能在多大程度上被释放。

02

输入前置筛选:

可学习帧选择器的范式革新

模型底座的天花板抬高了,但算力的消耗不仅仅在模型本身,喂给模型的数据,同样在大量吞噬计算资源。

视频-大语言模型(Video-LLMs)处理视频时,计算成本主要消耗在帧编码上。为了控制成本,现有模型几乎都采用均匀采样——等间隔抽帧。

然而,视频里的关键事件从来不会均匀分布。一个重要的动作可能只持续一两秒,如果恰好落在两个采样点之间,就被彻底漏掉了。相反,那些冗长的静态画面却被反复编码,浪费了宝贵的计算资源。

另一种思路是查询驱动的方法——根据具体问题去检索相关的帧。这在视频问答场景下确实有效,但详细视频描述是一个“无查询”任务,这种方法在这里派不上用场。

均匀采样太粗糙,查询驱动的方法又用不了。怎么破?

华为 AI 数据团队提出的可学习的帧选择器 LFS(Learnable Frame Selector),试图来解决这个问题。

打开网易新闻 查看精彩图片

论文地址:https://arxiv.org/pdf/2601.14594v1

他们的核心想法很直接:与其靠人工规则选帧,不如让模型自己学会“该看什么” 。

打开网易新闻 查看精彩图片

这是一种“以终为始”的训练范式,LFS 不再学“选哪些帧在某个中间得分上更高”,它学的是“选哪些帧能让大模型写出更好的描述”。

具体怎么做的?三个关键设计:

第一,训练一个评分网络,给每一帧打一个“事件重要性”分数。

打开网易新闻 查看精彩图片

第二,分段选帧而非全局排序。选帧时不用简单的“得分最高的前K个”,而是把整个视频切成多个时间段,在每个时间段里分别挑最重要的帧。这样既抓住了关键事件,又保证了帧在时间轴上分布均匀。

第三,也是最关键的一步——训练方式。LFS选好帧之后,把它们喂给冻结的Video-LLM生成描述,拿生成的描述和人工标注的标准描述做对比,算出损失,再反向传播去更新帧选择器的参数。整个过程中大语言模型本身一动没动,LFS就像一个即插即用的外挂模块。

此外,研究团队还发现了一个问题:现有的详细视频描述基准和人类真正的认知之间有挺大的差距。因此他们自建了一个新基准ICH-CC,视频全部来源于中国非遗烹饪的真实商业场景(如餐厅后厨、烹饪教学等),所有描述和问答均由人工精心撰写,更贴近真实应用场景。

打开网易新闻 查看精彩图片

实验结果怎么样?

打开网易新闻 查看精彩图片

LFS在不同模型和不同基准上都带来了普遍且稳定的提升。所有模型的 LFS增强版,在所有测试基准上都高于基线模型,这说明LFS 不仅能在单一基准上取得好成绩,具备一定的通用性。

这也回应了论文的核心命题:与其让模型在均匀采样的帧上“硬算”,不如在输入端做一次智能筛选——选对了帧,下游任务的表现也随之有所提升。

打开网易新闻 查看精彩图片

通过 LFS 生成的更优描述,视频问答等下游任务效果也得到提升

03

任务适配:

表征模块化干预取代全模型微调

大语言模型的跨任务泛化能力,一直是个“说起来重要、做起来难”的问题。

现有主流方案是per-token动态路由——每个token在处理时,都要在多个LoRA适配器之间做选择,决定走哪条路。这套机制确实有效,但代价也不小:计算量和显存占用都居高不下,模型跑起来又慢又吃显存。

另一种思路——表征微调(ReFT),则不再动模型参数,而是只编辑前缀和后缀token的表征来实现单任务适配,效率比LoRA高不少。

但它有两个短板:一是token本身的语义就有歧义,只改首尾不够精准;二是缺少一种“自引导”机制,模型面对没见过的新任务时,不知道该改哪一层、改哪个表征。

华为云团队与多所高校合作,提出了表征感知的模块化 RaMod(Representation-Aware Modularity) 框架,把 ReFT 的思路成功扩展到了跨任务泛化场景。

打开网易新闻 查看精彩图片

核心做法可以拆成两部分来看:

第一部分是双模块表征与参数微调。ReFT只能动首尾,RaMod 精细得多——从中间层的隐藏表征里挑出一个策略筛选过的子集,来做模块化干预。改哪里、怎么改,都是有选择、有策略的。这样能更精准地引导模型去解决没见过的任务。

第二部分是异步调度器。跨任务泛化最怕显存不够,RaMod设计了一套主动调度机制:需要哪些干预就分配显存,用完了就主动释放。这样一来,存储开销被压到了最低。

效果立竿见影。实验表明,RaMod不仅跨任务泛化效果更好,成本也大幅下降:相较于原始 LLMs,该方法额外预填时间减少了83%,生成延迟降低 100%,显存占用少了79%。

换句话说,RaMod把任务适配从"改模型"变成了"调表征"——不动模型主体,只在关键层的隐藏状态上做定点编辑。

这种思路如果成立,大模型部署的经济学可能会被改写:一个底座模型配上若干轻量级干预模块,就能低成本地服务于截然不同的任务场景,而不必为每个场景单独训练或加载完整副本。

不过在“改写”之前,这种表征微调的方法,仍有一些关键问题需要回答,比如在复杂推理等高难度场景中,是否依然能在大幅节省算力成本的同时守住准确性。

04

数据破局:语言专家各司其职,

渐进训练步步为营

前三篇论文都在解决"怎么更高效地用模型"。但很多任务还有一个更根本的现实挑战:如果连训练数据都不够呢?

语码转换(Code-Switching,CS)语音翻译任务,需要将夹杂多种语言的语音翻译成目标语言。这种任务不仅语义建模复杂,CS 数据的稀缺性,更是一个大问题。

以前的研究主要靠两条路走:要么让模型自己去"悟"语义表征,效果不可控;要么花大价钱做人工标注,成本太高,规模也做不大。

华为翻译服务中心团队,与厦门大学、澳门大学合作的这篇论文,提出了一个新思路:与其让模型自己摸索不同语言的语义表征,不如主动把它们对齐好——为每种语言单独建一个"专家团队",让各团队分别负责各自语言的语义建模,最后再统一对齐。

打开网易新闻 查看精彩图片

论文地址:https://arxiv.org/pdf/2511.10670

具体实现方式有两个关键设计:

第一个是MoE(混合专家)语音投影器。传统投影器对所有语言一视同仁,效果自然不理想。MoE版本的做法是给每种语言分配一组专门的"专家",每个专家组只负责一种语言的细粒度语音特征建模。路由机制会自动把语音特征送到对应语言的专家组手里。

打开网易新闻 查看精彩图片

为了保证路由不跑偏,论文还引入了两个辅助损失:语言特定损失确保每个专家真正学会对应语言的特征,组内负载均衡损失防止所有token都挤到同一个专家。

第二个是多阶段训练范式。数据不够,就用策略来凑。整个训练分四步走:先用自动语音识别(ASR)数据分别预训练每种语言的投影器,打好语音-文本对齐的基础;然后把各语言的投影器组装成MoE结构,用语言特定损失和负载均衡损失联合优化;接着从ASR 数据逐步过渡到单语语音翻译(ST)数据,用过渡损失平滑迁移;最后从 ST 数据适配到CS语音翻译数据。

这套渐进式设计的精妙之处在于——不是让模型直接硬啃稀缺的 CS 数据,而是先用充足的 ASR 和 ST 数据把基础能力打牢,再一步步转向目标任务。

打开网易新闻 查看精彩图片

实验对比了Whisper、SeamlessM4T、LLaST等多个强基线模型。在Fisher和NTUML2021的四个测试集上,该方法均超越了其他模型中表现最突出的 SeamlessM4T,BLEU最高达到39.52,COMET最高达到81.33。

这项工作传递的信号很明确:在数据稀缺的跨语言场景下,精细化的架构设计和渐进式的训练策略,也许比单纯堆数据更管用。

需要注意的是,这项工作在语言数量有限、数据质量可控的场景下,是有效的“尖刀方案”,但在需要覆盖数十种语言的通用多语种翻译系统中,是否具备可扩展性,还需要进一步论证。

05

结束语:

以设计密度,换算力成本

30B层次化ViT重构了模型骨架,让67亿激活参数在ImageNet上超越了180亿的对手;

LFS在输入端做了一道减法,把大量无意义的帧编码开销挡在计算之前;

RaMod把全量微调压缩成表征层的定点编辑,跨任务适配的显存和延迟一起降了下来;

语码转换语音翻译则用MoE分工和渐进式训练,在数据最匮乏的赛道上证明了一个道理:架构的智慧,有时候能够弥补数据的贫瘠。

四篇论文,四个方向,都在指向同一个内核:华为正在用“设计密度”取代“规模密度”。四篇论文分别来自基础研究、AI数据、云服务和翻译服务中心,说明效率优先已不仅仅是某个团队的偏好,这个逻辑被写进了各个环节的技术选择里。

如果把过去两年的AI竞赛比作“拼矿”,那2026年正显露出一个拐点:拼“冶炼技术”的时代已经开始了。稀疏激活、智能筛选、模块化适配、渐进式训练——这些路径不依赖更多的芯片和算力,而依赖对问题本身更深刻的理解。

无论大厂还是创业公司,早已走过了参数军备赛,AI 的下半场,对现实落地问题的理解,以及系统化解决这些问题的工程能力,才是真正的决胜点。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。