5 月 7 日,第 12 届 ICLR2024 在奥地利维也纳召开。ICLR 全称为国际学习表征会议(International Conference on Learning Representations),是专注深度学习、机器学习以及相关领域的顶级会议。
据悉,ICLR2024 有超过 5400 名嘉宾与观众来到现场,最大展位除硅谷科技巨头微软、谷歌以及 Meta 外,还有国内大模型独角兽智谱的身影,智谱也是唯一一家在主旨演讲环节发言的国内大模型公司
在智谱展位现场,GLM 大模型团队现场分享了《The ChatGLM's Road to AGI》专题演讲,介绍了 GLM 大模型通往 AGI 的三大技术趋势:
1)GLM-4 向 GLM-4.5 迭代:根据 GLM 团队现场分享,GLM-4 后续升级版本,即 GLM-4.5 及其升级模型,将基于超级认知(SuperIntelligence)和超级对齐(SuperAlignment)技术,同时在原生多模态领域和 AI 安全领域有长足进步。
其中,文本是最关键基础,下一步则会将文本、图像、视频、音频等多种模态混合在一起训练,变成一个真正原生的多模态模型。目前,GLM 团队已经在视觉领域推出了 CogVLM,将视觉专家模块与语言模型深度融合,并在 17 项文本、图像、视频任务的公开数据集上取得领先成绩。
2)以大模型为中心的通用计算系统 GLM-OS:GLM-OS 核心是一种基于多模态语言模型的统一架构,从根本上融合视觉、语音、文本等不同模态,在训练过程中赋予模型跨模态的学习与迁移能力。GLM-OS 的实现方式是基于已有的 All-Tools 能力,再加上内存记忆 (Memory )和自我反馈 (Self-reflection) 能力,通过模仿人类 PDCA(Plan-Do-Check-Act)机制,形成自我反馈和自我提升。
3)模仿人类无意识学习机制的 GLM-zero:GLM-zero 是 GLM 团队从 2019 年开始就在内部开始研发的技术,被视为 GLM 大模型通往 AGI 的必经之路。GLM-zero 旨在研究人类的“无意识”学习机制。以人脑为例,人类大脑中存在反馈和决策两个系统,分别对应大模型和内存记忆两部分。
去年以来,GLM 团队就在学术领域相继发表了多篇论文,覆盖了模型涌现能力、 LLM 解决数学问题,以及人类反馈强化学习等多个方向。
自 2022 年以来,GLM 团队相继推出了 GLM-130B 千亿基座模型、ChatGLM 对话模型、CogView 文生图模型、CodeGeeX 代码模型以及 CogVLM 多模态理解模型,构建了完整的大模型产品矩阵,基本上与硅谷科技巨头们保持在同一竞争梯队。
在 Meta 的展位,Meta AI 首席科学家 Yann LeCun 与研究团队在现场分享了发表在 ICLR2024 的四篇论文。
这四篇论文分别是:
ICLR 杰出论文奖《Vision Transformers Need Registers》(https://arxiv.org/abs/2309.16588);
ICLR杰出论文荣誉提名《Flow Matching on General Geometries》(https://arxiv.org/abs/2302.03660);
《Demystifying CLIP Data》(https://arxiv.org/abs/2309.16671);
《Revisiting Feature Prediction for Learning Visual Representations from Video》(https://arxiv.org/abs/2404.08471);
研究的方向侧重于 Meta 在深度学习、视觉变换和视频数据处理的前沿研究,而另一边 Google Research 分享的内容则围绕移动设备上的机器学习模型优化、数据隐私与安全等。
谷歌 DeepMind 团队主要分享下一代 AI 智能体以及基础研究。根据 DeepMind 发表在 ICLR2024 的论文《A Real-World WebAgent with Planning, Long Context Understanding, and Program Synthesis》,DeepMind 研究人员介绍了 WebAgent,一种由 LLM 驱动的智能体,可以从自我经验中学习,以导航和管理现实世界网站上的复杂任务(https://openreview.net/pdf?id=9JQtrumvg8)。
此外,谷歌 DeepMind 还在现场展示了DyST( 动态场景变换器)模型,该模型利用现实世界的单摄像头视频来提取场景中对象及其运动的 3D 表示。此外,DyST 还可以生成同一视频的新颖版本,用户可以控制摄像机角度和内容。
微软团队展会现场主要分享了三篇 ICLR2024 的论文研究(https://www.microsoft.com/en-us/research/event/iclr-2024/oral-presentations)
《LoftQ: LoRA-Fine-Tuning-Aware Quantization for Large Language Models》:介绍了一种名为LoftQ(LoRA-Fine-Tuning-aware Quantization)的新颖量化框架,该框架专为大型语言模型(LLM)设计,能够在应用LoRA(Low-Rank Adaptation,低秩适应)微调时进行有效的量化;
《MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts》:与评估基础模型在视觉上下文中的数学推理能力有关,涉及到计算机视觉和自然语言处理的交叉领域,特别是在理解和推理与数学相关的视觉信息方面;
《Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs》:介绍了一种名为FastGen的自适应 KV 缓存压缩方法,这是一种即插即用的方法,用于减少大型语言模型生成推理的内存占用;
最后,从 ICLR2024 现场四家最大展商 —— 智谱、Meta、谷歌以及微软分享的研究方向与演讲内容来看,中美大模型头部参与者都积极投身大模型、自然语言处理以及计算机视觉等领域的应用研究,相继展示了自身在 ICLR2024 上发表的最新论文成果,但双方研究的侧重点仍有不同。
硅谷科技巨头由于综合资源和技术的领先地位,仍然在基础研究的广度和深度上领先于国内头部企业。
智谱作为 ICLR2024 唯一一家在主旨演讲环节发言的国内大模型公司,虽然与海外科技巨头处于不同的发展阶段以及市场定位,但依靠其在学术和产业领域不断深耕与领先性,正逐步缩小与国际头部大模型玩家的差距,这也是国内众多大模型公司发展的一个缩影。
Reference:
https://www.zhipuai.cn/news
https://twitter.com/AIatMeta/status/1788631179576606733
https://research.google/conferences-and-events/google-at-iclr-2024/
https://deepmind.google/discover/blog/google-deepmind-at-iclr-2024/
https://www.microsoft.com/en-us/research/event/iclr-2024/oral-presentations/
Newin 行业交流群
最新活动
1、 超200位重量级演讲嘉宾将在三天会程中,共同带来高价值、强输出、多干货的深入探讨,超20个分会场、300名投资机构代表和参展商,带你站在生成式AI前沿,不可错过!报名方式请点击下方海报:
2、百度第二届“文心杯”创业大赛已经启动,参与大赛的选手有机会获得最高 5000 万人民币投资,欢迎大家报名:
3、AIEC 联盟在哈佛大学无锡校友会和全球华人常春藤校友联盟理事会的倡议和指导下成立,是直属于哈佛大学无锡校友会的分支机构。
2024 世界 AIEC 峰会即将在 6 月 29 日于无锡举办!首批合作组织已正式揭晓,新会员招募计划已正式启动,详情点击下方海报咨询:
4、如果你是 26 岁及以下具有开发、设计、营销三大核心能力之一的“当代嬉皮土”,这场 AdventureX 组织的线下黑客松活动不容错过!
这场今年最“硬核”的黑客松将在 7月 15~19 日在杭州良渚,你将在 5 天时间内组成2~4 人的小队,并在极限的时间内舍弃睡眠创造出你脑海中最疯狂的产品,或许下一个改变世界的产品就此诞生,访问:https://adventure-x.org 报名!
最新资讯
热门跟贴