身体已能跑进8秒64,大脑仍卡在GPT-2,人形机器人如何对齐?
科技棱镜
人形机器人正在经历一场能力上的“分裂”。
一方面,身体的运动能力已进入爆发期。2026年世界人形机器人运动会上,全尺寸机器人百米成绩跑到了8.64秒,比去年的21.50秒缩短了整整12.86秒。
人形机器人在赛事现场展示运动性能
头部企业出货量也在以每年翻倍的速度狂飙,2026年上半年全球出货超22000台,同比增长近300%,中国厂商拿下全球97%的份额。
另一方面,大脑的泛化能力却严重拖了后腿。宇树科技创始人王兴兴在2026世界机器人大会上直言,目前全球最大的瓶颈是具身智能的泛化能力不足——在固定场景充分训练后,任务成功率能接近100%,但只要操作物品或环境稍微变化,成功率就断崖式下跌。
这就是2026年的真实处境:机器人能跑赢博尔特,但换个房间就不知道该怎么干活了。
行业把2028至2030年定为身体与大脑能力对齐的关键交汇点,这个判断对不对,取决于接下来几年几个核心变量如何演变。这件事还在演变中,但我们可以把可能性看清楚。
身体运动能力为何能跑这么快
身体能力的爆发不是偶然,背后是硬件成本下降、技术路径收敛、量产体系打通三重因素的叠加。
核心零部件国产化率在持续攀升。以优必选Walker系列为例,整机成本较2024年下降了约25%,这背后是行星滚柱丝杠、谐波减速器等核心部件的国产替代加速推进。六维力传感器进口单价曾高达10万元,国产自研产品价格已降至5000元以内,降幅超90%。
技术路径也在2025年完成了统一。开源证券分析指出,2025年行业完成从“0-1”到“1-10”的跨越,核心驱动力就是“技术收敛”——核心关节的准直驱关节、谐波减速器方案不再碎片化,供应链开始能规模化响应。
更关键的是制造体系的打通。2026年4月,全球首条万台级人形机器人自动化产线在广东启用,实现“30分钟下线一台”的车规级交付标准。领益智造的北京超级工厂规划2026年实现年产1万台,2030年目标50万台。
人形机器人智能自动化产线车间实景
从作坊式手搓样机到标准化产线,这一步让身体能力有了规模化复制的底座。
大脑泛化,卡在“数据死锁”上
大脑的问题比身体棘手得多。
银河通用创始人兼CTO王鹤给出了一个坐标系式的判断:如果把具身智能放到大语言模型的发展历程中,当前基础模型的能力大约只相当于GPT-2阶段。他的预期是,到2028年前后行业才有望达到类似GPT-3.5至GPT-4之间的水平。
这意味着,今天的人形机器人虽然能完成不少复杂任务,但还远没有到“拿来就用”的阶段——从家庭搬运切换到商超,再进入工厂,每一步都要重新投入大量工程训练资源。
卡住大脑泛化的核心瓶颈是数据。当前全行业累计真实场景有效物理交互数据仅十几万到50万小时,而实现商业化落地需要千万小时级别,缺口超过99%。
科沃斯董事长钱东奇在WRC期间点出了一个更底层的问题:大语言模型的Scaling Law建立在人类数千年文字积累的基础上,但“没有人证明Scaling Law可以泛化到物理AI”。这不仅是数据量不够的问题,而是这条路本身还没有被验证过一定能走通。
更头疼的是行业陷入了一个“先有鸡还是先有蛋”的死锁:需要部署机器人才能采集物理交互数据,但没有足够数据又无法实现智能泛化。数据采集标准也不统一,不同厂商硬件采集的数据,视场角、帧率、精度各不相同,无法跨平台复用。
走向A:2028年初步对齐,技术突破准时兑现
走向A的核心假设是:具身大模型在2027-2028年取得类似GPT-3.5级别的突破,数据飞轮开始转动。
触发条件:北京人形机器人创新中心发布的Pelican-Unify 1.0统一模型,已在WorldArena全球评测中登顶,在理解、推理、想象、行动四个维度同时达到顶尖水平。
人形具身大一统模型获全球评测榜首
如果这类统一模型能在2027年实现跨场景的“拿来就用”——即一台机器人不用重新训练就能在不同场景间切换——就说明大脑泛化开始突破瓶颈。
可观察信号:王兴兴给出了一个具体的“两个80%”标准——在80%的陌生场景中,通过语音或文字指令,机器人能够顺利完成约80%的任务。他认为“快的话两到三年,慢的话五年或者十年”。如果2027-2028年出现接近这个标准的产品,走向A就在实现。
产业链信号:京东计划两年内建成全球最大的真实场景数据集,累计采集超1000万小时真实场景数据。如果这个目标在2028年前后兑现,数据饥渴问题将大幅缓解。
概率判断:身体能力和大脑泛化完全对齐(即两个80%全面实现)在2028年出现的概率较低,但部分场景(如物流分拣、仓储搬运)率先实现初步对齐的可能性较高。星动纪元已在物流领域实现常态化运营,与顺丰、中国邮政合作,在全国5省市10余个物流中心部署。
物流场景有清晰的效率标尺,是人形机器人率先跑通PMF(产品市场匹配)的突破口。
走向B:大脑突破延迟,2028年出现“身智错配”
走向B的核心假设是:具身大模型进展慢于预期,Scaling Law在物理AI领域确实无法直接迁移,行业需要更长时间探索新范式。
触发条件:如果到2028年,具身智能基础模型能力仍停留在GPT-2阶段,跨场景切换仍需重新投入大量工程训练资源,无法实现“拿来就用”。
更具体的证伪信号:盘和林指出,当前行业渗透率不足2.5%,存在研发多年最终被证实为无效赛道的可能性。
如果到2028年,人形机器人仍无法在主流工业场景中实现对比传统机械臂的效率/成本替代优势,营收仍集中在展演、科研采购等小众场景,这就是走向B正在发生的信号。
可观察信号:注意出货结构的变化。当前全球出货中,文娱商演和科教数采合计占比仍在六成以上,智能制造仅占13%,仓储物流仅5%。宇树科技2025年前九个月超过70%的人形机器人收入来自科研教育,真正的工业应用仅占约9%。
如果到2028年这个结构没有显著改善,说明大脑泛化仍未突破。
概率判断:我认为走向B中“大脑彻底停滞”的极端情况概率较低,但“2028年只完成部分场景对齐、全面泛化推迟到2030年以后”的概率较高。王鹤的判断是具身智能到2028年达到GPT-3.5至GPT-4水平,但GPT-4到真正“ChatGPT时刻”还有一段距离。
这意味着大脑泛化会有显著进步,但离“拿来就用”仍有差距。
走向C:不靠等大脑,身体先抢占“不需要太聪明”的场景
走向C的核心假设是:行业不会坐等大脑突破,而是绕开泛化难题,先在不依赖高级认知的场景里实现规模化。
已经发生的信号:众擎机器人与多伦科技合作推出的“智慧交管机器人”,已在交通管理一线部署,可精准复现交警标准指挥手势、违法行为识别劝导。
时耘科技首批15台特种工业人形机器人在2026年8月下线,专为消防巡检、矿山井下、电力园区等高危场景设计,单价超20万元,已达成意向采购订单。这些场景的共同特点是任务相对固定、环境可控,对泛化能力要求不高,但能创造真实商业价值。
工业人形机器人展示抓取作业功能
可观察信号:关注2027-2028年特种作业、巡检、物流等垂直场景的订单放量节奏。如果这些场景的出货占比从目前不到两成提升到四成以上,就说明走向C正在成为主流路径。
我的判断:走向C最可能成为现实。行业不会等到大脑完全成熟才行动,而是会先让身体在能干活的地方开始创造价值。这与新能源汽车的发展路径相似——先在有政策支持和补贴的B端市场跑通,再逐步向C端渗透。
但最终要实现2028-2030年身体与大脑真正对齐,仍然需要走向A中的技术突破来配合。
三个可追踪的路标
如果你想自己判断这个对齐过程走到了哪一步,三个信号值得持续关注:
第一,看具身智能统一模型在WorldArena等权威评测中的进度。北京人形机器人创新中心的Pelican-Unify 1.0已登顶该榜单,在3D准确率上接近满分。如果2027-2028年出现能力明显跃升的新版本,就说明大脑泛化在加速。
第二,看世界人形机器人运动会中真实应用类项目的占比。2026年,真实应用类项目从去年的6项猛增至21项,占全部赛事的比例从23%升至41%。如果2028年这个比例超过60%,且全自主操作成为主流,就说明行业重心已从“能跑会跳”转向“会干活”。
第三,看头部厂商出货结构的变化。如果智元、宇树、优必选等头部企业到2028年工业应用场景的收入占比突破30%,就说明商业化闭环正在形成。但请注意,宇树科技2026年上半年扣非净利润同比下滑19.34%,价格战已经开始挤压利润空间。
营收增长的同时能否保持盈利质量,是判断行业健康度的重要指标。
最后说一句,2028至2030年身体与大脑对齐这个判断,是目前行业共识的预判,不是既定事实。宇树科技创始人王兴兴自己给出的时间表是“快的话两到三年,慢的话五年或者十年”。这个判断能否成立,取决于上面说的那些信号是否出现,而不是靠一厢情愿的乐观。
热门跟贴