作者 | 大鹏
来源 | 具身之家Robots(ID:zscy006)
世界模型这门生意有多热,看看极佳视界(GigaAI)的融资节奏就知道了。
2025年8月Pre-A轮,还是数亿元的盘子;到2026年6月B2轮,投后估值已经到了200亿。最近「IPO早知道」又爆出消息:Pre-IPO轮即将交割,下一步就是港交所。
按照披露的说法,交割完成后公司会尽快向港交所秘密递表,顺利的话2027年上半年挂牌,成为全球“世界模型第一股”。但这事不能只当成“又一家AI独角兽去港股”来看。背后是一条还没定型的技术路线,一位首席科学家反复追问的“世界模型的Codex时刻”,以及两个创始人攒了十几年的技术底子。
两个“逆行者”
故事要从2023年夏天说起。那会儿大模型赛道疯狂内卷,创业者们挤破了头要教AI“能说会道”。而在海淀清华科技园,两个年轻人做了个反着来的决定,即教AI看懂世界。
这两人,一个叫黄冠,一个叫朱政,都出自中科院自动化研究所,黄冠是师兄。
黄冠是典型的武汉学霸。2009年进华中科技大学读自动化,以专业课第一的成绩保送中科院自动化所读研,最后拿下清华自动化系博士,博士期间还在微软亚洲研究院实习过。
他的职业轨迹,几乎踩着过去十年物理AI的每一波浪:2016年进地平线做视觉感知技术负责人,牵头建了WebFace260M人脸识别数据集,带队拿下2020年ECCV COCO挑战赛冠军、2021年NIST-FRVT人脸识别评测世界第一;后来又以合伙人身份参与创立鉴智机器人,担任算法副总裁,团队做了BEV系列模型。
用媒体的话说,每一步都在点上。
朱政是另一种类型的技术领袖。2019年从中科院自动化所博士毕业,之后在清华自动化系做博士后。TPAMI、CVPR、ICCV、ECCV、NeurIPS上发论文70多篇,引用近2万次,连续4年入选全球前2%顶尖科学家榜单,2025年拿了吴文俊人工智能自然科学一等奖。
谈起当初为什么创业,朱政说得很直白:“大语言模型当时已经比较卷了。大厂都在跟进,创业公司没有雄厚资金根本没什么机会。我们是做计算机视觉出身,对视觉的理解非常深刻,而且我们意识到,只预测未来的动作是不够的,还需要像人一样,预测未来世界会变成什么样子。”
2023年6月,极佳视界在海淀成立。
三个多月融了35亿
时间拉到2026年3月,这家公司的融资开始加速。值得留意的是,华为哈勃还是极佳视界重要股东,其2025年11月A1轮联合投资,并在Pre-B轮继续加注。
3月,近10亿元Pre-B轮;4月,近15亿元B1轮,估值破百亿;6月,10亿元B2轮,投后约200亿,狮城资本、中比基金、建投投资、万向钱潮、复星锐正都进来了。三个多月,35亿元。到9月Pre-IPO轮,投前估值稳在200亿量级。
更耐人寻味的是黄冠7月在WAIC期间对彭博说的那句话:“在全球范围内,我们将成为世界模型初创公司中首家上市的企业。”他还透露新一轮融资即将完成,估值30亿美元(约200亿元人民币),这将让极佳视界成为中国估值最高的世界模型初创公司。
不过彭博报道发出后,极佳视界很快回应,称报道“是对创始人采访内容的误读”,公司“不存在任何应披露而未披露的事项”。截至发稿,港交所也查不到极佳视界的公开申请。所谓“2027年上半年挂牌”,目前仍只是市场预期。
估值涨得有多快?12个月的时间,估值涨了50倍。朱政8月在WRC主论坛上自己说了:“去年的这个时候我来参加WRC,公司的估值只有现在的1/50。”
世界模型的“Codex时刻”在哪?
如果只盯着融资数字,会错过这场狂欢里最有意思的部分——技术路线根本还没收敛。“世界模型”到底是什么、怎么度量、往哪走,行业内吵得厉害。
7月19日WAIC“世界模型六小龙”论坛上,朱政抛出一个被媒体反复引用的问题。他拿OpenAI在Codex出现前的探索做类比:“我非常想知道,对于世界模型而言,我们的Codex产品究竟是什么。”
这话的意思不难懂:Codex让语言模型找到了“编程”这个杀手级应用,整个行业的技术路线随之收敛。而世界模型至今还在“Demo繁荣”里打转,没有一个能定义产品形态的核心应用。
朱政对行业“做错的事”也不遮掩:“做不足的,是在模型之外有太多事情分散了大家的精力……在模型尚未收敛时就去探索了非常多的商业化场景,当然大部分可能不成立。”
更坦诚的是他关于自己公司走弯路的反思。在《白鲸实验室》的对话里,朱政承认极佳视界早期战略摇摆过:“我们一开始采用‘一脑多型’的战术,即用一个大脑去适配所有的本体。一开始,我们几乎尝试了市面上的所有机器人本体,采集数据,训练模型,后来我发现这个战术实在太激进了,纯粹是给自己添堵。”
后来公司收敛到“一脑一型”:自研本体Maker H01,用自研本体采数据,训出来的模型再部署回自研本体。这个教训,他在WRC论坛上换了个说法又讲了一遍:“当前市场落地受限的根本仍是模型能力上限不足。”
VLA的Scaling失灵了?
撑起200亿估值的技术判断,说白了就一句:VLA(视觉-语言-动作模型)的Scaling Law失效了,世界模型才是具身智能的GPT时刻。
朱政在《白鲸实验室》的对话里表示:“到2026年春节,模型测试结果中浮现出新范式:在完成多任务或few shot训练上,VLA更像是大语言模型早期的BERT模型,无法Scaling,世界模型才是下一代的’ChatGPT。’”
朱政进一步解释了两代架构的区别:“VLA的基模是VLM,本质上是它更倾向于看见画面,理解成语言然后映射动作。而世界模型的基模是视频生成模型,是基于一段视频或者状态,预测和推演下一个画面。”至于语言的作用,他的判断很激进:“语言对动作帮助不大。一个最直接的例子是许多动物也没有自己的语言系统,但也不妨碍它的运动能力。”
技术路线上,极佳视界选了“像素生成派”,直接生成视频帧。在WAIC六小龙论坛上,这条路被归为三大路线之一,另外两派是隐空间JEPA派和融合派。朱政承认,当前的多模态和视频生成基模本质上是给数字世界设计的,而且开源的越来越少,所以“我们必须做好思想准备,尽早开始训练具身世界模型的基模”。
Maker H01
产品上,公司是双模型体系:GigaWorld系列管世界生成,GigaBrain系列管动作执行,也就是所谓的“具身大脑”。商业化三条线:自动驾驶是基本盘,客户有一汽、京东、EMS;工业制造方面,和隆盛科技规划三年部署千台Maker H01;家庭场景做了子品牌“拾光SeeLight”,S1已经拿了百台订单。
黄冠对这套体系的说法是:“具身基模就像是机器人的‘大脑’,而‘世界模型’则是这个大脑的‘想象力’。”这也是公司对外讲得最多的一个比喻。
结语
回到Pre-IPO本身。极佳视界冲“世界模型第一股”,手里确实有两张牌:一是这条赛道目前没有任何上市公司,先发优势摆在明面上;二是200亿估值已经进了国内未上市机器人公司的第一梯队,和银河通用、智元机器人一个级别,比宇树科技IPO前约127亿元的市场化估值还高出一截。
问题在于,大规模商业化还早。朱政7月在“全球数字经济大会”上给的路线图是:2026年下半年发GigaBrain-2,2027年上半年发GigaBrain-3——他希望能达到GPT-3时刻——2028年让机器人大规模进普通家庭。换句话说,真正能撑起200亿估值的那块收入,最早也要等到2028年。
所以这家公司能不能兑现,就看2027到2028这两份答卷:GigaBrain-3能不能真到“具身智能的GPT-3时刻”;拾光S1的家庭百台订单、Maker H01的工业千台规划,能不能从POC变成真金白银。
朱政在WRC论坛上说过一句话:“我们希望在未来几年,可以快速地从当前垂类场景的世界模型,走向真正的通用的世界模型。”
这话说出来是宣言,也是倒计时。
热门跟贴