两年前,田柯宇因篡改代码、干扰模型训练被字节跳动辞退,并被起诉索赔800万元。近日,他创办的世界模型公司已完成近3000万美元融资,投后估值达2亿美元——要知道,这家公司目前既没有正式名称,也没有产品发布,团队仅约10人。

打开网易新闻 查看精彩图片

田柯宇瞄准了世界模型这一赛道,与李飞飞等AI先驱直接对垒。他表示,完整模型计划于2027年正式发布,现阶段将集中完成技术开发。

从被辞退的实习生到2亿美元估值的创始人,田柯宇为什么还能得到资本的力挺?

有能力,也有“污点”

能获得资本青睐,绕不开田柯宇本人的能力。在被辞退当年,田柯宇就以第一作者身份获得NeurIPS 2024最佳论文奖,提出了视觉自回归建模方法VAR,在图像生成效率上显著超越了扩散模型。参与投资田柯宇公司的五源资本和IDG资本,也曾投过月之暗面,它们看准了田柯宇的技术判断力。

打开网易新闻 查看精彩图片

至于和字节的纠纷,田柯宇事后解释:关闭另一名实习生的程序是为了腾出计算资源,供其他研究人员使用,并承认这样“以暴制暴”的做法不妥。字节事后也澄清,网传“涉及8000多卡、损失上千万美元”不符合事实,涉事行为并未影响正式业务。

客观地说,田柯宇的技术能力绝对过硬,但他的“案底”放在各互联网及AI大厂面前,也是一道绕不过去的坎。不过,投资机构似乎对这个年轻气盛的实习生引发的争议并不太在意。一边是“污点”,一边是真实存在的潜力——从利益角度,资本固然会选择更稀缺的后者。

让AI发明自己的语言

与大语言模型的主流范式相比,田柯宇确实在走着一条不一样的技术路线。

他的观点是,人类语言无法高效描述视频中每个物体的精确位置、动态轨迹和物理碰撞。既然如此,不如让AI放弃人类的表达体系,直接发明一门自己的语言。当下,团队已经开发出一套包含约20万个人类无法识读的符号的“词典”,用于帮助模型处理视频,未来也将向模型输入约1亿小时的视频进行训练。

打开网易新闻 查看精彩图片

这个思路正来自于他的NeurIPS获奖论文VAR——让模型像大语言模型预测下一个词一样,通过预测下一组像素块来生成图像。世界模型要做的,是把这套逻辑从静态图像扩展到动态视频,让AI理解空间、运动、重力与惯性。田柯宇称,这种方法可以把生成1秒视频的成本至少降至原来的十分之一。

这是一个远大的愿景,但也是个极具风险的探索。一套人类无法理解的符号系统伴随的是极高的验证门槛,如果符号系统无法应用到外部生态,它就只是一个实验室里的自洽循环。但田柯宇的底气来自VAR论文——它已经验证过“用非人类语言处理视觉信息”的可行性,至少在小规模上。

投产品不如投“人”? 资本押注的逻辑变了

速途网认为,透过田柯宇“争议人物翻身”的事迹,资本行为的变化也被揭示。

李飞飞创办的World Labs上月被AMD以数十亿美元收购,AMD CEO苏姿丰称核心目的是“获得世界一流人才”。田柯宇的实验室同样在“没有产品”的阶段就获得了2亿美元估值。这其中买的不是产品,是人的判断力。

大模型创业早期,月之暗面、智谱那一批公司的融资,至少伴随着产品发布或明确的技术路线图。而田柯宇的案例更接近一种“人才期权”——资本在赌,这个人未来几年会做出正确的技术判断。这直接引发了AI创业定价逻辑的转移。

当模型能力越来越依赖顶尖研究员的判断力,资本开始从“为产品买单”转向“为人的认知买单”。如果你的技术判断被验证是对的,过去的污点也会被重新定义为“成长经历”。

世界模型赛道目前仍处于“有方向、无共识”的阶段,没有人能证明哪条路径最终会胜出。田柯宇的20万个符号,既是一个足够大胆的赌注,也是资本开始为人才可能性买单的逻辑所在。

(文/言飞)