智猩猩AI整理

编辑:知知

打开网易新闻 查看精彩图片

西湖大学启动AI4AI研究,探索高效推理与实时交互世界模型,本方向同时接受:PhD/联培PhD/visitings,欢迎加入。

最近看到一个很有意思的技术进展。

一个 33B 视频生成模型,可以把推理压缩到 4 步;它的 Flash 版本进一步做到 3 步。在单张 H100 上,生成并解码一段 22 帧、540p的视频,热运行时间约为377 ms。

这意味着:视频生成正在第一次接近“比视频本身播放得还快”。

但它离真正的实时交互世界,还有很远。377 ms 依赖 H100、短视频和预热环境。

长时间生成仍然会发生外观、几何和状态漂移;面对不同场景,模型仍使用相对固定的计算路径;蒸馏、稀疏化、量化、缓存和算子优化,也主要依赖研究者手工设计。

所以,我们想进一步回答一个问题:

能不能让 AI 自己研发下一代 AI 的推理算法与架构,让智能体在持续变化的世界中实时观察、想象和行动?

这就是我们正在启动的研究方向:AI4AI × 高效推理 × 实时交互世界

我们关注的不只是“更快生成一段视频”,而是一个持续运行的世界模型:

当前世界状态 + 智能体动作 → 下一个世界状态

它需要在严格的延迟、显存和能耗约束下,持续响应动作、更新状态、保持长期一致性,并为智能体的下一步决策提供反馈。

01

你可能会研究什么

1 、用 AI 自动研发推理算法

让 Agent 自动探索少步生成与蒸馏算法、动态采样与动态计算深度、Token 选择与稀疏路由、量化与缓存策略,以及模型、编译器和硬件的协同架构,真正参与新算法和新架构的发现。

2、面向交互世界的动态计算

真实世界并不是每个区域、每个时刻都同样重要。能否只更新真正发生变化的区域?

能否为关键动作分配更多计算?

能否复用没有变化的世界状态?

能否让模型根据延迟预算,在线选择推理路径?

我们希望把固定成本的生成模型,变成按需计算的交互模型。

3、有界成本的持续世界模型

一个实时世界不能每生成几秒就“失忆”。

我们将研究流式状态表示、长期记忆、latent 与 KV cache、上下文刷新和在线纠错,使模型即使持续运行,计算与显存仍然保持有界,同时减少人物、场景、几何和物理状态漂移。

4、模型、编译与硬件协同架构

把少步生成、Token 稀疏化、混合精度、缓存与融合算子协同起来,不只追求高端 GPU 上的漂亮数字,更要让模型真正跑上消费级显卡和端侧设备。

5、从流式视频生成走向行动反馈闭环

近期工作表明,少量可训练参数即可把大型视频生成器转化为可控制的交互世界模型。

我们更关心下一步:世界模型如何理解动作,而不只是文字提示?智能体如何利用预测未来进行规划?真实反馈如何纠正模型?模型又如何从整条观察、行动与反馈轨迹中持续学习?

02

LINs Lab — 学习与推理系统

实验室

PI:林涛

西湖大学工学院特聘研究员、博士生导师,EPFL 博士,LINs Lab 负责人。

长期研究多模态智能体的高效训练与推理,核心科学问题是:如何将智能体理解和生成世界的计算成本,降低到可被反复调用的水平。

围绕这一主线,研究从优化算法、数据压缩、少步生成与推理系统入手,降低模型的训练和调用成本,进一步构建统一理解与生成的多模态基模,并探索 AI4AI 驱动的智能体自我改进。

近期代表工作包括 RDED、DeFT、TwinFlow、LLaDA-Image、LLaDA2.0-Uni 和 PiEvo。

发表顶会论文 40 余篇,担任 ICLR、NeurIPS 和 ICML 领域主席。入选国家海外高层次青年人才项目,连续两年入选斯坦福/爱思唯尔全球前 2% 科学家榜单。

03

ENCODE Lab—高效智能计算

实验室

PI:王欢

西湖大学工学院特聘研究员、助理教授、博士生导师。浙江大学学士、硕士,美国东北大学计算机工程博士。

专注于Efficient Al、AI Evaluation方向的理论、算法与应用研究,涵盖模型压缩与加速、Token/KVCache压缩、机器学习系统、大模型底层算子优化、记忆设计与自进化学习等技术方向。

主导开发世界上首个端侧运行时间低于2s的高效扩散模型,产出美国专利6项。发表CCF-A类论文40余篇,担任多个AI顶会的领域主席(如AAAI/ICLR/CVPR/NeurIPS 2026,AAAI 2027)。入选国家级青年人才计划、杭州市人才计划等。

我们致力于将上述方向进一步整合:让生成速度达到可反复调用的水平,让世界模型达到可实时交互的水平,再让 AI 参与下一代算法的研发。

04

招收信息

我们希望你:

来自机器学习、计算机视觉、系统、体系结构、控制、机器人或相关专业均可。

你不需要已经同时精通算法和系统,但希望你:

  • 对高效生成、世界模型或多模态智能体有强烈兴趣

  • 既愿意思考算法,也愿意真正把系统跑起来

  • 不满足于调用现成模型,喜欢追问模型为什么慢、应该怎样改

  • 具备良好的数学、编程或系统基础

有以下经验之一会很加分,但不是硬性要求:

  • Diffusion、flow matching、视频生成或世界模型

  • CUDA、Triton、FlashAttention、推理引擎或分布式系统

  • 强化学习、Agent、规划或具身智能

  • 自动化机器学习、代码 Agent 或 AI4AI

  • 开源项目、科研论文或扎实的工程作品

申请方式

请发送以下材料至:

lins-lab.hr@westlake.edu.cn

(抄送lintao@westlake.edu.cn)

encodelab@westlake.edu.cn

(抄送wanghuan@westlake.edu.cn)

邮件标题格式:

AI4AI 申请-姓名-学校-申请类型

申请材料、个人简历、成绩单或代表性项目材料

一段简短说明:如果由你研究"实时交互世界",你最想解决哪个问题?

关注+星标,获取AI前沿进展与开源一线动态