智猩猩AI整理
编辑:林夕
据彭博社报道,前字节跳动实习生、北大博士田柯宇,公开披露了自己的世界模型创业计划,正在筹建一家专注世界模型的隐秘AI初创公司。
公司目前没有公开名称,也没有公布具体产品,团队规模大约10人,其中包括一些前字节员工。
这家公司已经获得了包括五源资本(5Y Capital)和IDG Capital在内的投资机构支持,融资接近3000万美元,投后估值约2亿美元。
目前披露出来的技术方向,是一款面向视频的世界模型。
按照目前公布的计划,田柯宇现在瞄准的是视频世界模型。团队计划使用约1亿小时的视频数据训练模型,同时希望将视频生成成本降低一个数量级。
团队还在尝试构建一套约20万个视觉符号组成的系统。
田柯宇曾表示,人类语言无法完美描述一段视频,因此他们希望先为AI创造一种语言,再向其中输入1亿小时的视频。
完整模型计划在2027年发布。在此之前,团队会通过公开活动展示技术进展。
目前外界能看到的,主要是这几个数字:20万个视觉符号、1亿小时视频,以及2027年。
相比传统的视频生成模型,这套方案更强调让模型从大规模视频中学习视觉世界本身,包括其中的变化、运动以及不同元素之间的关系。
田柯宇目前是北京大学博士研究生,师从王立威教授。
此前,他已经发表4篇顶会论文,其中2篇NeurIPS论文为第一作者,GitHub上的相关项目累计获得4400+ Star。
其中,他最受关注的工作之一是VAR(Visual Autoregressive Modeling)。
这项工作以第一作者发表于NeurIPS 2024,并获得NeurIPS 2024 Best Paper。
VAR提出了一种基于下一尺度预测的视觉生成方法,也成为田柯宇后来继续探索视觉生成与世界模型的重要研究积累。
论文还报告称,视觉自回归模型能够呈现出类似语言模型的Scaling Law。
如今,田柯宇把研究方向从图像生成继续往视频推进,而视频世界模型,也是当前世界模型竞争中的一条路线。
李飞飞创办的World Labs长期研究空间智能和世界模型,重点放在让模型理解三维空间以及现实世界中的环境。
田柯宇的方向则更偏视频,从视觉符号和大规模视频数据入手。
两家公司目前公开的信息并不意味着采用相同的技术方案,但田柯宇已经进入了李飞飞所在的世界模型赛道。
这个方向目前仍处于早期阶段。
模型究竟能够从1亿小时视频中学到什么,20万个视觉符号具体如何工作,以及最终能否把视频生成成本降到现有水平的十分之一,都要等产品公开后才能验证。
而田柯宇本人,也有一段颇受关注的经历。
2024年,他在字节跳动实习期间曾因模型训练资源问题卷入争议。
田柯宇后来承认,自己曾关闭另一名实习生运行的程序,希望为其他研究人员腾出计算资源,并将当时的行为形容为“替天行道”。
根据彭博社查阅的一份裁决书,在字节跳动提起的一起民事诉讼中,法院认定田柯宇违反合同,判令其赔偿50万元人民币,并没收其全部工资。
两年后,田柯宇重新回到AI行业。
此次披露,主要让外界首次看到这支团队的技术方向:
以视频为核心训练数据,以视觉符号作为模型理解视频的基础,并尝试进一步降低视频世界模型的生成成本。
关注+星标,获取AI前沿进展与开源一线动态
热门跟贴