智猩猩AI整理
编辑:知知
随着长上下文、Agent和多轮交互场景不断增加,KV Cache正在从单纯的显存占用问题,逐渐演变为大模型推理系统中的关键基础设施瓶颈。
当 GPU 显存难以容纳不断增长的 KV Cache 时,将其卸载到 DRAM、SSD 甚至远端存储,成为一种重要的扩展思路。但这并没有让问题消失,而是将压力进一步转移到了数据传输和存储访问环节。
为解决大规模KV Cache受限于单机显存容量、难以随计算资源独立扩展的问题,Mooncake团队构建了面向大模型推理的分离式KV Cache基础设施。
针对长序列中大量冗余语义表征同时推高KV Cache存储与Attention计算开销的问题,上海交通大学团队提出语义感知的长序列推理协同优化方案。
在大模型推理系统层面,南京大学的研究团队推出面向大语言模型推理的解码阶段动态重调度技术STAR。
腾讯混元团队将TurboQuant在线向量量化引入推理系统,并在混元模型上落地4bit KV Cache方案。
为了让长上下文推理不再被GPU显存卡住,斯坦福联合Meta、北京大学等研究者们提出HiSparse,重新设计了KV Cache的存储方式。
除了“如何存”和“如何搬”,长上下文推理中的动态工作负载最终还需要高效映射到真实AI芯片上。为此,华为团队联合清华大学等研究团队开源了面向华为昇腾NPU 的生产级推理系统XY-Serve。
在上述背景下,大模型KV Cache技术研讨会将于9月21日在2026全球AI芯片峰会分会场二同期举行。
01
议程出炉:研讨大模型缓存瓶颈
Mooncake项目维护者马腾、腾讯混元高级研发工程师王德君、南京大学软件学院助理教授王智彬、上海交通大学计算机学院助理教授刘方鑫、焱融科技首席架构师彭德跃、华为技术专家宋明聪、北京大学博士生及SAC一作马瑞阳等来自高校、产业界与开源社区的一线研究者将作为报告嘉宾带来分享,其中马瑞阳将担任本场研讨会主持人。
02
嘉宾阵容:七位专家学者将分享
华为技术专家 宋明聪
宋明聪,华为技术专家,主要从事大模型推理系统研发与性能优化。曾在ASPLOS、ISCA、MICRO、HPCA等顶级会议发表多篇论文,相关研究成果引用近千次,并获HPCA最佳论文提名。
腾讯混元高级研发工程师 王德君
王德君,腾讯混元高级研发工程师,北京大学硕士,本科毕业于东北大学。主要研究方向包括大语言模型训推加速、KVCache量化压缩、传输与调度。目前在腾讯混元负责大语言模型推理基础设施研发,主导了TurboQuant算法在Hy相关模型上的应用,并推进完成了研发和生产上线。
上海交通大学计算机学院助理教授、博士生导师 刘方鑫
刘方鑫,上海交通大学计算机学院助理教授、博士生导师,上海期智研究院研究员。研究方向为计算机体系结构、大模型加速与人工智能编译优化。以第一或通讯作者身份在HPCA、ISCA、MICRO、ASPLOS、PPoPP等国际顶级会议和期刊上发表论文60余篇,其中CCF-A类论文40余篇,体系结构四大顶会论文20余篇,2026年入选MICRO名人堂。主持国家自然科学基金青年项目、上海市自然科学基金面上项目,以及华为、阿里巴巴、蚂蚁集团、中兴、小米、OPPO等企业及学会合作课题十余项。研究成果获华为火花奖(2022)、中国计算机学会容错计算专委40周年代表性成果等,此外,获ISCA 2026最佳论文提名、ACM MM 2025杰出论文奖(System Theme)、DATE 2022最佳论文奖及最佳论文提名、上海市计算机学会优秀博士论文奖、ACM上海优秀博士论文奖、上海市优秀毕业生等荣誉。指导学生获2026 CCF TCArch SRC Top-pick、CCFSys图计算系统设计大赛特等奖、CCFSys 2025最佳项目海报奖及第二届集成芯片与芯粒技术开源社区大赛一等奖等荣誉。
Mooncake项目维护者 马腾
马腾博士是大模型KVCache开源项目Mooncake(6.1K Star)的主要维护者,目前Mooncake已经有阿里云/清华/月之暗面/蚂蚁/字节/趋境科技等多方参与,并且成功接入vLLM/SGLang/TRT-LLM/Dynamo等社区,同时他也是SGLang、RBG等社区的Committer。他在SOSP,ASPLOS,ATC,SC,Eurosys,VLDB,TPDS等顶级会议和期刊上发表论文四十余篇,相关成果授权美国/中国专利10项。他曾入选CCF系统软件专委会优秀博士论文激励计划,担任PPoPP,FAST,DASFAA,TPDS,ICME,TC,JSC等国际会议/期刊的程序委员会成员和审稿人。
焱融科技首席架构师 彭德跃
彭德跃,毕业于浙江大学计算机专业硕士,拥有超过 15 年分布式存储、大规模云存储架构及数据基础设施建设经验。曾就职于华为、联想、美团、金山云等企业,长期负责大规模存储系统的架构设计、技术研发与工程落地,参与构建并支撑千节点级公有云存储集群。现任焱融科技首席架构师,负责全栈 AI 存储产品的架构设计与技术演进。长期专注于 AI 数据基础设施与分布式存储技术,围绕大模型训练、推理及智能应用等场景,重点探索高吞吐、低延迟、弹性扩展的存储架构,为 AI 工作负载提供高效的数据基础支撑。
南京大学软件学院助理教授 王智彬
王智彬,南京大学软件学院助理教授,也是NASA实验室和COSEC实验室的成员。2018年至2024年在南京大学计算机科学与技术学院攻读博士学位,导师为田臣教授和仲盛教授。当前主要研究AI Infra,尤其关注大语言模型的高效训练、服务与内核优化。在系统和数据库领域发表CCF A类论文10余篇。作为第一作者发表了南大第一篇SIGMOD、PPoPP和HPDC论文。
北京大学博士生、SAC一作 马瑞阳
马瑞阳,北京大学计算机学院在读博士生,师从罗国杰教授,博士期间研究方向涉及大模型推理软件栈、新型体系结构与互联、电子设计自动化等方向,参与大模型推理引擎SGLang HiCache/HiSparse等开源项目开发。曾在阿里云开展研究型实习,并入选小红书Dots-Ace顶尖实习生计划。在AAAI,ICCAD,DATE,TCAD等顶级会议和期刊上发表一作论文7篇,相关成果获得首届大模型辅助设计研讨会最佳论文提名、华为火花奖等奖项。
03
大会日程及最新嘉宾阵容
除了大模型KV Cache技术研讨会,本届峰会还设置了开幕式以及大模型AI芯片、Agent推理芯片、具身智能芯片三场高峰论坛,还有四场技术研讨会:
超节点技术研讨会(全天)
Token工厂异构混训技术研讨会(半天)
AI芯片架构创新技术研讨会(半天)
新型存储器技术研讨会(半天)
目前50位来自大厂、高校及产业一线的重磅嘉宾将带来主题演讲报告。
大家可以扫描下方二维码添加小助手“雪梨”报名。已添加过“雪梨”的老朋友,可以给“雪梨”私信,发送“GACS26”即可。
热门跟贴