9月20-21日,2026全球AI芯片峰会(GACS 2026)将在上海中星铂尔曼大酒店正式举行。

上海交通大学计算机学院助理教授、博士生导师刘方鑫已确认出席,将在9月21日分会场二下午的大模型KV Cache技术研讨会带来报告,主题为《语义感知的长序列大模型高效推理优化》

Part.1

嘉宾介绍

打开网易新闻 查看精彩图片

刘方鑫,上海交通大学计算机学院助理教授、博士生导师,上海期智研究院研究员。研究方向为计算机体系结构、大模型加速与人工智能编译优化。以第一或通讯作者身份在HPCA、ISCA、MICRO、ASPLOS、PPoPP等国际顶级会议和期刊上发表论文60余篇,其中CCF-A类论文40余篇,体系结构四大顶会论文20余篇,2026年入选MICRO名人堂。主持国家自然科学基金青年项目、上海市自然科学基金面上项目,以及华为、阿里巴巴、蚂蚁集团、中兴、小米、OPPO等企业及学会合作课题十余项。研究成果获华为火花奖(2022)、中国计算机学会容错计算专委40周年代表性成果等,此外,获ISCA 2026最佳论文提名、ACM MM 2025杰出论文奖(System Theme)、DATE 2022最佳论文奖及最佳论文提名、上海市计算机学会优秀博士论文奖、ACM上海优秀博士论文奖、上海市优秀毕业生等荣誉。指导学生获2026 CCF TCArch SRC Top-pick、CCFSys图计算系统设计大赛特等奖、CCFSys 2025最佳项目海报奖及第二届集成芯片与芯粒技术开源社区大赛一等奖等荣誉。

Part.2

报告主题

语义感知的长序列大模型高效推理优化

Part.3

报告概要

当前大模型长序列推理受限于上下文窗口的指数级膨胀与语义信息的冗余累积,导致KV Cache存储爆炸、注意力计算开销激增与访存瓶颈。针对上述问题,本报告提出一套面向长序列大模型推理的语义感知协同优化方案。在数据表征层面,通过跨通道语义聚合与分布感知的自适应精度编码,压缩长序列KV Cache中的冗余语义表征,实现键值缓存的紧凑化与硬件友好型存储;在计算范式层面,基于语义重要性感知重构注意力运算逻辑,在压缩模型基础上引入细粒度稀疏化与自适应层间跳变机制,以稀疏激活和动态层跳过替代冗余注意力计算,有效提升长序列场景下的算力利用率;在数据流层面,通过硬件亲和的稀疏计算模式协同编排长上下文计算与访存数据流,结合算法与硬件的深度协同实现模型有效部署。为构建面向长序列的高效AI算力底座提供了系统性的优化路径。

大会日程

打开网易新闻 查看精彩图片

大模型KV Cache技术研讨会议程

打开网易新闻 查看精彩图片

参会方式

大家可以扫描下方二维码添加小助手“雪梨”进行报名参会。已添加过“雪梨”的老朋友,可以给“雪梨”私信,发送“GACS26”即可报名。