来源:市场资讯
2026世界机器人博览会(WRC)于8月19-23日在北京亦创国际会展中心举行。“AI大模型赋能机器人与具身智能产业新范式专题活动”在博览会同期举办。贝塔无限联合创始人兼CTO陶帅出席并演讲。
以下为演讲实录:
陶帅:大家好!我是来自贝塔无限的陶帅,很高兴能有这个机会来分享一下我们在具身技术方面的一些思考。
我今天的主题是“以人为中心-面向人机共融场景的具身技术新范式”。
我们知道AI和大模型下一阶段的繁荣肯定会走出手机、走出屏幕,然后进入到我们真正的物理世界,AI+机器人可能是我们这个时代最大的Beta的增长红利。
2026年,今年大家定义成是具身场景的元年,其实对于具身的落地场景,在千行百业是有非常多的应用场景,包括文娱的表演、进厂的生产力的提升,当然对于贝塔无限来讲的话,我们自己聚焦的场景是在泛消费级场景,我们核心的定位是服务于人的生活而不是替代人,最终想做人有用的机器人伙伴。所以这里面核心两个点,一个点是有用,就是要能做事,第二个就是机器人伙伴,就是你要理解这个场景、理解人。
稍微解释一下,后半句是我们觉得具身整体的场景,它整体呈现的形态还是群山并立的一个形态,它不是一个单方往上攀登的一个阶梯。这个怎么理解呢?我们觉得整个具身不同的场景,其实它的每一个场景都足够复杂,它底层场景的差异性和逻辑对上层技术栈全栈能力的需求也是不一样的,尤其对于泛消费级场景,它是需要一套原生的技术范式,而不是说之前有的时候听到某些场景是另外一个场景的前置训练场,不是说我们攀登到一座高峰之后,另外一座高峰我们就自然达到峰顶了。
对于具身整体的场景,我这边会划分为两大部分:
第一部分,我们整体是围绕“任务”来展开的,是以任务为中心的具身技术的这套范式。在这套范式之下,整体的环境相对来讲还是标准化的,面向的SKU可能也就是几十个,可能多的也就几百个,整体的任务我们是单点,目标就是把任务的准确率、节拍还有可靠性给做上去。
第二部分,是以“人”为中心,也就是说你整个环境是有人生活的,人生活的这种环境它是没有剧本的,没有办法预设,所以你面向的是一个开放型的场景,你真正要在人生活的这个场景里面发挥出机器人的长期价值,你要做的也是这种长程的复杂任务,它不是这种单点的重复。
这里面场景的差异性其实对于具身从上层到底层整个技术栈的要求,也是一套完全不一样需求,它是一套全新的技术栈的重构,举个例子,对于大脑来讲的话,我们任务的这种场景驱动它要求的是强确定性,它可能对泛化能力的要求没有那么高,而且指令的话基本是一些确定性的几套工序的指令。
对于这种以人为中心场景,这种泛消费级场景,我们要求机器人的大脑一定对这个场景、对人有很好的记忆能力,你才能发挥出你整体的作用。比如说你需要适应动态变化的环境,你这个模型需要有强泛化,包括你要考虑到人机交互。人的指令是模糊指令,它不是相当于非常精准的能描述到你中间的每一步,包括长程复杂任务的编排。从大脑到小脑、到操作系统、到数据,也就是说到本体本身,可能都要考虑这种人机的交互、人机的这种友好,以及我们这种开放编排的生态。
对于贝塔无限来讲的话,我们从第一天开始,我们自己的定位就是聚焦在有人生活的泛消费级场景,所以我们整个的技术范式从底层到上层也是圈套原生适配在消费级的这套技术范式,这套技术范式核心有三个关键词:
1、千人千面,我们觉得我们具身的大脑在这个场景里面一定有很好的记忆和世界观。记忆就是说我们需要有全时空多模态的空间记忆、时序记忆以及对人的记忆,世界观就是说我们要对这套动态环境的变化有很好的适应性。
2、自主演进,我们一直在期待具身智能技术ChatGPT的时刻,我们觉得大家靠这种前置的数采或者我们建一些数据的采集场,即便是我们现在分发一些无本体的异构数采,它也仅仅是第一步,它未来如果要达到类似于现在大模型的这种智能能力,整个物理世界所需要的数据量一定是非常非常大的,它可能是几个数量级的提升。这套技术能力我们认为它未来唯一的一条路径一定是来自于部署状态的数据飞轮的自闭环,然后能把整个数据的范式持续地累加起来。另外一方面,我们需要模型在这套数据范式下面能有持续演进的能力、持续学习的能力。所以自主演进是我们从上层技术栈里面非常关注的另外一个核心的体系。
3、人机友好性,我们觉得这套技术体系里面它一定要考虑人机友好性,从你的操作系统、从你底层的本体设计上来讲的话,你一定要考虑到人生活的这个环境,你要去主动的感知、主动的做任务的编排,你的本体设计要考虑人机交互的安全、人机的友好,以及对于消费者极具的性价比。
这三套体系基本上在我们整个技术栈里面,我们觉得要交付一个完整的解决方案,或者说让消费者比较满意一套机器人产品的话,这三者是缺一不可的,它没有办法说独立一个产品我们能够把这个事情给做好。
首先,我们觉得在我们这套技术栈里面,第一个核心的关键基座是记忆,我们觉得记忆是机器人真正的从单一工具能够走向生活、迈向智能伙伴不可或缺的一个关键技术能力。具身的记忆其实跟我们现在常讲的Agent这种记忆还有非常不一样的地方,首先第一点,具身机器人在这个环境里面它是多模态的感知,它整个传感器的维度是非常丰富的,它有自己的视觉、有听觉,当然底层也有你的动作经验、历史的记忆能力,所以它整体的记忆是比较立体,时空关系比较综合,动态变化的一套记忆体系。
从框架上来讲的话,它核心是要解决几个问题,第一个就是你存什么?第二个就是你存下来的这套记忆系统怎么跟你的大脑去做融合?跟你的大脑是做松耦合还是紧耦合?怎么做记忆的演进?第三个就是说这个记忆怎么去评估?你需要有一套反馈系统来调教你的记忆和你的整个网络参数,我们就构造了一套基于真实世界物理反馈的个性化Reward系统,基于强化学习的技术来闭环、来调整我们整体的记忆存储和演进,以及说跟大脑之间的耦合。
这套系统我们之前在真实的环境里面也测试了一些典型的任务,从用户的体验角度来讲的话,它相当于说跟一个精于记忆的机器人增加了海马体。这套记忆加持之下的用户体验是有非常大的提升的,我们有些家庭里面常用的一些任务,包括找东西,包括一些空间记忆的找可乐,包括精细物品的寻找(找钥匙),它能自主通过它获取的记忆能编排到你这个空间里面的位置关系,然后来编排你具身整个任务的盘拟。
这里面(见PPD)第三个我可以解释一下,这里面它也通过视觉的方式,可能完全没有见过这个物品,它结合它的记忆、结合它对这个环境里面过去的认知做实时的(39:02英),然后也能大概推断出来,比如说我看到这个摄像头,我过去没有见过这个摄像头,但是我能大概推断说在这个工作环境之下,你大部分的物料是可能堆放在什么位置,然后它调用它整个导航的技能、调用它整个感知跟抓取的技能,到那个地方跟人一样把你这个事情闭环的完成。
记忆这个事情,对于分钟级或者是小时级的记忆,其实这种任务难度并不高,但核心问题在于我们把这个记忆如果拉长到一个周级、月级、年级的维度,怎么能做精细化的管理?这是一个非常有挑战的工作。我们贝塔这边,目前整体这套记忆管理系统是从周级往月级在推进,我们希望到年底能做到一个年级的维度。
刚刚提到我们想做的是有用的机器伙伴,所以操作对我们来讲是非常关键的一个命题,对于操作智能我们的看法是两点,尤其是面对我们泛消费级场景来讲的话,它的泛化性和长程任务是我们核心关注的两个重要的特点。对于模型的范式来讲,VLA也好或者世界模型也好,其实在未来具身的基座模型里面,我们认为它一定会走向融合,它不是两套独立分离的技术范式,就像过去Transformer集大成的这种模型结构,在此之前其实(40:39英)这种架构,其实已经有很多的研究了。我们相信在未来具身操作智能基模的模型架构里面,语言的这种能力、视觉的理解和预测的能力,一定也是里面非常关键的基座会吸纳进来。
在此之外,我们更加关注的是,这套技术的模型怎么能在这个环境里面适应动态的变化,你怎么能做这种,我们叫测试式的学习或者叫持续演进,所以我们在这种模型里面增加了测试式学习的能力,比如我们更加关注上层这套数据飞轮,这两种能力的叠加,才能真正达到你整体的操作技能对于你没有见过的一些物品,或者是你在预训练和前置阶段没有见过的数据,能做到一个比较好的适应。这种也是真正未来机器能够进入千家万户的一个必备路径,因为北京的家庭跟新疆的家庭,可能大家家庭里面物品的纹理、颜色、形状是完全不一样的,大家靠前置的数采是肯定没有办法覆盖到这么长尾的分布。
我们前段时间刚刚也发了我们0.1版本的模型,我们在一个真实的家庭环境里面做了一个任务的测试,这里面我们单模型可以全自主的完成10分钟以上的长程复杂的移动操作任务,我们知道移动操作任务相对固定台的操作它的难度是成倍增加的,整个模型体现出比较好的精细操作包括泛化以及对空间的理解能力,包括一些失败的自主恢复、动态智脑下的记忆推理跟操作,就是它在收拾地面物品的过程中,可能有人用一个绘本把其中一个乐高块给挡住之后,它结合过去的画面之后,推理到下面还有一个遗漏的乐高块,动态的把它移开,然后完成整个主线任务。包括这种全身空间位置的精细调整,这里面都是我们单一模型端到端完成的。
对于未来来讲,我们觉得在操作系统层面,我们未来比拼的一定不是一个单一模型或者单一一套神经网络,如果大家真的做过复杂系统的交互或者场景落地的话,未来一定比拼的是复杂的系统架构跟集成能力。具身,尤其是面向跟人生活的具身场景的落地,它需要的一定是一套开放式的AgenticOS,所以我们在系统框架的构建上面,其实构建的就是一套面向开放世界的物理的Agent,从底层机器人硬件的分装到中间层(43:49英)。这套系统的话,我们首先会在自己的产品上面做出比较好的体验,当然,我们觉得这套系统一定是套开放的系统,未来也会开放出来,跟大家一起来建设这个比较繁荣的生态。
好,我的分享大概就到这里,谢谢大家!
热门跟贴