最近很多朋友都在说,在使用心得ChatGPT6 Astra之后 tokens的额度直接不够用了,即使是 plus版本的ChatGPT用户,5分钟就没有额度了。

尤其是在操作blender的时候,在制造相关游戏的时候,我尝试过,也是反复等待额度恢复之后才完成的这个对波游戏使用。

普通的付费plus用户几乎不够用

我在知乎上,还用户将其制造了红警2,也有制造了其他的普通平面游戏,或者第一视角的CS。

可是在利用blender做真人游戏的时候,仍然还是有差距,比如有一点涉及到使用blender做威尔斯史密斯吃面,就发现和之前做AI动画的还原度效果差距巨大。

其实这就是因为astra本质上是大语言模型,并且缺乏世界数据。

现在ChatGPT的数据仍然来源于语言文本以及传统平面视频,虽然大家都在用普通摄像头在做数据更新以及标注,但和物理世界的触碰、深度等数据还是远远不够,相较于MR设备每天睁开眼睛都是在采集空间计算数据,而现在这些手机就则是效率非常慢了。

数据源不一样,标注的方式也不一样

相较于文本标注,世界模型的标注要求在有时间、距离、接触、以及面积

打开网易新闻 查看精彩图片

vision Pro这些空间计算设备和普通的AI眼镜或传感器区别巨大

vision Pro不仅知道几何数据、还有深度、位姿、手部关键、场景网格,这些数据如果开发者获得了后,可以重建3D世界并且度量第一视野下人在3D世界的变化。

现在世界模型是吃RGB视频,可以做预测下一帧画面的模型,比如洗碗的动作看起来是在洗碗,但是真实提及、水会不会泼、以及手和碗接触的面基对不对,他并不知道。

普通眼镜是没有标签的,比如指尖相差了几毫米、以及握力大概多少,物体6DOF怎么变,是成功接触还是插肩而过,是传统RGB摄像头并不知道的。

举个例子,在同一段家务工作里, MR眼镜与普通RGB摄像头数据差异在下面这里

在空间计算头显,开发者可以得到:

  • 水槽、水龙头、沥水架的度量网格

  • 碗的大致尺寸和台面高度

  • 双手 25 个关节左右的时间序列

  • 头和眼先看碗还是先看空位

  • 遮挡发生时仍可用网格补几何

  • 全程在同一个世界坐标系里

而在普通眼镜 / 传感器大致得到:

  • 第一人称 RGB

  • 水声、碗碰撞声

  • 头部加速度

  • 事后估一个大概手部框或 2D 关键点

比如现在京东正在宿迁的joyegocam数据采集活动,这些设备数据集并不包含手指、网格数据,只能建设视觉世界模型,而不是建设空间世界模型。虽然也是作为机器人建设的数据中心,但是我认为只是杯水车薪。

因为MR的眼镜出货量会接下来逐步上亿,并且会成为机器人数据的标准采集,直接会解决掉所有现场的数据采集线下实验区域。

也就是这个原因,导致现在这些凡是有接触物理、以及头是扫描、接触面的时刻,同时也没有办法让LLM没有的标注。

打开网易新闻 查看精彩图片

所以MR眼镜普及之后,才会有这些数据完成标注,才能够真的自动化操作这部分动作达到与3D世界一样的效果

今天的分享就在这里。

找我交流与合作 空间计算与脑机接口系统开发

题图来自 Unsplash ,基于 CC0 协议, 如有侵权,请联系pmtalk123删除

“分享产品经理改变世界的点滴”

产品顾问| 产品咨询|培训合作

请添加微信PMxiaowanzi

最近我的原创

每日案例拆解库,AI等产品打卡群

我创建的产品设计打卡社群,加入后365天,每天体验一款APP。提升产品设计能力, 同时有1300份体验报告帮助你找到竞品

在这里你可以随时查询到你想找的各类竞品行业APP,无须自己亲自下载就可以马上得到APP的一手产品优化、交互设计、功能描述信息。

从优化&建议、商业模式、运营、功能描述、交互设计、产品定位至少6个维度,体验一款应用。

平均1天1块钱,扫码购买即可加入

连续体验48款应用,通过后原路退回

报名后添加星球助理

PMTalk123