8月26日,由深圳市互联网信息办公室、深圳市宝安区人民政府与网易传媒联合主办的"2026新一代人工智能(深圳)创业创新大赛"总决赛暨颁奖典礼,在深圳市宝安区"湾区之眼·万有空间"圆满落幕。

大赛聚焦"AI大模型和智能体"、"AI硬件和具身智能"、"AI基础设施(AI Infra)"、"AI+文化"四大前沿赛道,旨在发掘具有核心技术壁垒与产业化潜力的优秀创业团队。下午的颁奖典礼暨AI论坛,从具身智能的机遇与挑战,到全球AI投资趋势,再到视频生成模型向世界模型的演进,层层递进,集中探讨了AI如何从模型与算法走向物理世界和规模化商业落地。

阿尔法公社创始合伙人许四清在《一个天使投资人眼中的下一个十年》主题演讲中指出,基础模型能力已得到验证,但AI产业的价值分配远未完成。除了芯片率先获得巨额收益,能源、基础设施、模型和应用等多数环节仍处在形成期。"从经济学的角度来看,人工智能这场比赛才刚刚拉开帷幕。"

打开网易新闻 查看精彩图片

许四清将AI产业分为能源、芯片、配套基础设施、模型和应用五层。中国的电力供给和完整制造体系是长期优势,但在先进芯片和大规模AI算力工厂方面,与美国仍有差距。模型层的竞争逻辑也在变化,行业关注点不再只是模型"够不够聪明",而是算力成本、推理效率、数据闭环和Agent执行能力。他以WorkBuddy、Claude Code等产品为例指出,AI应用正从提供答案,走向调用工具、完成任务并交付结果的闭环模式。这也是AI与以往技术革命的重要区别:过去的机器主要提高人的效率,今天的AI则开始直接替人完成工作。"人工智能第一次开始替人工作,人工智能自身成了巨大的生产力。"

许四清认为,AI下一阶段的重要变量,是从数字世界进入物理世界。具身智能目前尚未实现真正的智能突破,但局部智能的涌现,以及物理世界数据的持续积累,可能孕育未来十年的关键机会。他特别强调,具身智能数据不能只看采集了多少小时,而应同时考察数量、质量和丰富表征三个指标。高质量数据不仅要记录动作,还要描述动作所作用的对象、所处环境和交互条件,只有这样,机器人才能从"复现动作"走向理解物理世界。

在应用端,许四清重点谈到穿戴式AI和软硬一体产品,中国创业团队可以依托深圳宝安等地的工业配套,快速完成硬件开发、供应链组织和产品迭代。在他看来,这类机会未必来自大厂业务延伸,创业团队决策链条短、迭代速度快,反而可能率先定义新的产品形态。"创业者会'踩踏'大厂,因为创业者的步伐非常快。"他以清智元视的高速摄像机Spark为例:国内团队已能做出每秒1000帧、4K分辨率的产品,价格明显低于美国同类产品;相关高速摄影样片在网络上的广泛传播也说明,AI与制造能力结合后,不只是降低成本,还可能催生新的消费场景和需求。

从模型、Agent到具身智能,再到AI原生硬件,许四清的判断可以归结为一句话:基础模型只是序幕,真正的产业竞争才刚刚开始。未来十年,胜出的未必是最大的模型,而是那些能把智能真正落到实际任务、物理产品和商业闭环中的团队。

以下是许四清的演讲,由网易科技整理:

特别荣幸参加在宝安这块宝地上举办的 “2026新一代人工智能(深圳)创业创新大赛”。今天听了很多创业者的创业想法,很受鼓舞。我就给大家分享我们投资人的困惑。

实际上,我们的困惑是驱动我们前进的力量。和大家探讨一下,在我们眼中,下一代人工智能应该做什么。

首先,大语言模型取得一定突破之后,第一阶段大家现在有一个幻觉,就是大语言模型能做很多东西。其实不是,我们现在这个阶段,只是基础模型的能力得到了验证。产业价值如何分配,除了芯片厂商已经开始参与其中,其他环节的价值分配还没有真正展开。

换句话说,从经济学的角度来看,人工智能这场比赛才刚刚拉开帷幕。

而且,行业现在的竞争焦点,虽然依旧围绕大语言模型,但是它已经开始从单一模型能力,转向算力成本、推理效率、数据闭环和Agent执行能力。这几点正在快速发生转化。闭环数据,大家比较有感觉的就是具身智能相关的数据,一会儿我们也会谈到。

这里有一个数据要跟大家分享,这是过去六年中美两个国家在人工智能领域一级市场的投资。这个数据还是挺发人深省的。

我们最近经常能看到某某具身智能公司融了多少的新闻、百亿估值以上的俱乐部有好几个。我们不要被这个现象误导。实际上,我们在人工智能领域的投资是严重欠账的。

欠账多少?中美是世界上唯二在人工智能领域里有话语权的国家。但是我们国家在人工智能领域的投资,和美国的差距差不多是汇率再乘十倍,而且过去两三年一直保持这个差距。这还是挺让人紧张的。

打开网易新闻 查看精彩图片

坏消息是我们欠账;好消息是,大规模的基础设施投资还没有形成产业划分,实际上意味着产业结构正在快速构建。

下面我们分五个层面看一看,人工智能在投资人和做行业探索的人眼里,有哪些主要构成。

首先,第一层是能源。兵马未动,粮草先行。这方面我们国家的粮草真的先行了,我们是电力大国。到什么程度?去年一年电力生产能力的增量,相当于美国、欧盟和印度增量的总和。我们是电力大国,基础设施建设走在前面,在人工智能长期竞争领域里,给自己打下了非常好的基础。

大家看,埃隆·马斯克正在推动把算力部署到太空。现在很多人关注太空算力,一个很重要的原因就是电力不足,要去太空解决。

能源基础之上是芯片。芯片领域确实是中美竞争,美国远远跑在前面。大家注意到英伟达发布的Vera Rubin NVL72,这是一台机架级的AI超级计算机,把72颗Rubin GPU和36颗 Vera CPU 集成在一个机架里。它做到什么程度?光 HBM4显存就有20.7 TB,总显存带宽达到1580 TB/s,也就是每秒超过1.5 PB,这个数字非常恐怖。

为什么我们觉得Vera Rubin非常领先?它在重新定义各种AI算力工厂的方式,重塑AI经济学。很遗憾,我们在中国的产业里还没有发现这种现象,我们主要停留在单个GPU和小集群上,这方面还有很长的路要走。

很多地方吸引创业团队时,往往都告诉对方“我有多少卡”,甚至不告诉他有多少补贴,而是说有多少卡可以给你用。

再往上一层看是基础设施。在大型AI工厂被定义以后,液冷、高压供电、光互联,就变成基础设施真正比拼、快速发展的工业领域。基础设施构建在以芯片为核心的算力底盘之上。

再往上是模型。很有意思,现在的大语言模型正在从产品向AI系统转变。一个模型就支撑一个产品。像Claude Code,在大语言模型里,是最先形成闭环、递交生产能力的,因为它可以帮你编程,而能编程就可以做很多事。真正具备这个能力的还不多。

目前来看,模型仍在快速进展。我们原来认为,到2026年,所谓Scaling Law、堆算力的范式可能会走到尽头。但是到今年为止,堆算力依旧有效。也有很多学界人士呼吁应该探讨新的方法,但是实际情况是,算力依旧有效,模型本身依旧可以依靠算力大规模进步与发展。

模型之上是应用。真正的应用是什么?我们深圳一家企业给全世界定义了最好的人工智能应用,就是WorkBuddy。它已经可以调用各种不同的语言模型,给人们完成闭环的书面工作。

我们在公司里经常冷不丁地问每个同事:WorkBuddy用了多少?没有用的,就会遇到我的“严重挑战”。

WorkBuddy是全世界范围内少有的伟大产品创新。它利用人工智能的大语言模型能力,实现闭环任务的完成和递交。能够跟它相比的,其实只有Claude Code和Codex,很多产品仍然以对话和完成简单任务为主。

从能源,到芯片,到基础设施,到模型,再到应用,这就是我们看到的五层划分。

下一步,未来十年AI能做什么、能改变什么?

首先我们有一个观点:以前计算机和人类各种科学的进步,都是让人提高效率;人工智能第一次开始替人工作,人工智能自身成了巨大的生产力。

所以,二级市场看待英伟达的每一次进步、埃隆·马斯克的每一次进步,都是从经济学角度、从重新定义人类社会生活的角度来看这个世界。

这也是人工智能与此前产业革命一个很重要的不同。

第2, 人工智能的快速进步,已经开始从数字世界的AI向物理世界的AI发展。具身智能实际上就在做这件事,具身智能的模型还非常早期,还没有实现突破。

打开网易新闻 查看精彩图片

但是有消息称,具身智能已经开始出现局部范围内的智能涌现。比如有一个东西放在那里要倒了,以前只训练过单手去扶,从来没有训练过让机器人两只手去扶,结果两只手就上去了。

所以我们觉得,如果这种现象频繁出现,物理世界的AI就可能开始出现突破的征兆。

最近看北京的具身智能机器人比赛,我们经常说“具身缺智能”,现在的具身确实还没有智能,这也是大量投资往具身智能领域去的原因。因为它还没有,所以在我们投资人眼里,这就是机会。

原因很简单:我们理解物理世界的方式,还远远没有达到理解语言、语料和社会的程度。

具身智能要突破,除了人建立模型的能力之外,数据是关键。如果没有数据,一切就无从谈起。

语言模型应用了人类有史以来所有文明的积累,这些积累变成文字,成为最丰富、最庞大的语料来训练模型。但是今天,具身智能领域的数据存量几乎可以当作零。

这是我们早期投资的一家创业公司——诺亦腾机器人,他们做的具身智能数据集。

这个数据集有一个非常重要的意义。具身智能的数据,我们往往只重视数据的数量,比如有一些创业公司说,我们的数据采集采到了多少小时,这是一个很有偏向性、很误导的东西。

具身智能数据要看三个指标:第一是数量,第二是质量,第三是丰富的表征。

数量容易理解。质量是什么?比如你的定位精度是多少,这就是质量。丰富的表征就更复杂。比如你让一个机器人坐下,在语言模型里这就是两个字。但是你要教会一个机器人坐下,就如同教会人游泳一样。你很难给一个人一套秘籍,说看完这个就会游泳,做不到。这就是物理世界的特征,需要反复训练。

诺亦腾机器人最近开源的一套数据集是HiPHI,把高质量的具身智能动作数据,以高于德国马普所十倍的规模开源出来。开源之外,还有二十倍的数据可以做商业应用。目前,中国大量人工智能、具身智能企业在用他们的数据。

举一个例子,数据不仅要对所有动作进行表征,包括人的动作、机器人的动作,而且还要有客观第三方条件。比如你坐下,要判断你坐的地方是硬板凳还是竹签子。在这个地方,你用什么动作、多少速度去做,不取决于人本身,而取决于对象。

这种数据的丰富性,也就是所谓的丰富表征数据,是人类在具身智能探索中非常重要的一环。我甚至认为,这仍然不够。我们还没有发现更全量的表征数据,仍在探索当中。

刚才讲了很多概念。我们阿尔法公社做了很多探索,也在早期投资了一批具身智能、人工智能和硬件结合的头部创业公司。

光帆科技的产品表面上是一个带摄像头的耳机,我忘了是不是网易写的一篇文章,说光帆科技的“狼子野心”终于暴露了。深圳的韶音用了它的技术,做了下一代产品。

它本质是一个操作系统,是全世界范围内比谷歌还早、面向穿戴式硬件的人工智能原生操作系统。它可以赋能所有耳机、眼镜、挂件,让它们具备各种各样的能力。这个操作系统打通了京东、大众点评、滴滴打车等服务。

这是一个划时代的中国创造的产品,比美国领先。

Looki的产品也是人工智能穿戴硬件。

Looki L1现在已经开始在京东上销售。它可以记录你的生活,主要面向15岁到30岁的人群,特别适合外出游玩的朋友。它可以完整记录生活,自动生成Vlog。

与它同期做的、面向全世界的记录类穿戴式人工智能原生硬件,一共有六个产品。最后,第一个做出来的是它,其他五个都在美国。当它的产品做出来后,其他产品后来都被收购了,有被OpenAI收购的,有被谷歌收购的,最便宜的一笔收购也是20亿美元的交易。

实际上,我们认为,在大语言模型和各种人工智能工具突破之后,中国像这样的硬件会层出不穷,而且创业者会“踩踏”大厂,因为创业者的步伐非常快。

比如宝安有庞大、完善的工业配套体系,结合今天参赛的人工智能高手,我们很快就可以看到:在人工智能硬件领域,中国将在全世界独领风骚。

Spark也是一个很有意思的产品。

这是清华毕业的一个博士团队做的。这个摄影机出现时,美国只有一款非常昂贵的工业专用摄像机,支持每秒1000帧、4K分辨率。他们做出了同样的东西。美国那款产品15万美元起,而这个项目众筹时是8000美元,掀了全世界的桌子。

它的下一个产品也很快出来了,深圳制造,CEO也搬到深圳来了。

这是它拍的片子。熟悉军事的都知道,这是歼-20,世界真正的隐身战机王者。

这个公司叫清智元视,这是用它的摄像机拍的一个作品。

在全世界范围内,拍蜂鸟是一个历史难题。作者拍的内容获得了5000万次播放、500万次点赞。我们看一下这个视频。

这是美好的瞬间。这个事情是由中国的一个创新团队帮助人们实现的。

我的介绍就到这里。人工智能在今天只是刚刚给我们打开序幕,还有无限可能。希望我们能够在人工智能领域里一起探索更多未来的巨大科技和商业突破。

谢谢大家!