抓住风口,看懂趋势
本期要点:别只记录结果,更要留下认知的过程!
你好,我是王煜全,这里是王煜全要闻评论。
未来,AI的瓶颈是什么?
可能并不是AI掌握的知识不够多,而是人们错误地理解“认知”。这也导致了,AI虽然“知道”了关于世界的一切,却没有真正“懂得”这个世界。
明白了这一点,才能明白每个人、团队乃至企业该怎么和AI共存。
7月16日,顶流科技杂志《Wired》(《连线》)报道了一项有意思的研究。
Meta、斯坦福等机构的研究人员用EgoBabyVLM这个评估基准,测试现有VLM(视觉语言模型)能不能从约800小时的婴儿第一视角视频里,学会理解世界。
按理说,AI知道的事情可比婴儿多得多,应该比婴儿更懂这个世界。
但测试结果恰恰相反,面对婴儿日常生活中那种杂乱、连续、且语言和画面并不严格对应的自然信息流,主流VLM模型很难建立语言和现实之间的关联,表现甚至接近随机水平。
可是,人类婴儿恰恰就是在这种混乱的环境中,逐步学会语言、因果关系和社会互动。
《Wired》因此下结论说,AI还没有婴儿聪明。
不过,我们认为,这不是技术不够强,更准确的说,是AI虽然掌握了关于婴儿的所有信息,但它从来没有作为一个婴儿而存在过。
一个几个月大的婴儿,看到一个滚动的球,不仅会把“球”这个概念和“滚动”这个动作联系在一起,他还在学习“重力”、“距离”、“自己能不能抓到”等一系列从来没有被语言描述过的东西。
摄像机记录了婴儿看到的世界,却没有记录婴儿用什么结构理解这个世界。因此,AI知道婴儿会看哪里、看到了什么,但它无法像婴儿那样理解这些信息,也不知道婴儿为什么这样看。
AI会有这样的问题,是因为此前大家可能没有认真区分两个概念:知识和认知。
知识只是人类认知活动留下的结果,而认知是我们在具体环境中产生的、带有主观性、有具体位置和立场的思考、判断和表达。
没有理解这一点,我们就很难理解AI到底缺什么,也就很难谈怎么和 AI 协作。
重要的是“认知”
知识和认知,这两个概念看起来像,但不是同一件事。
在当前大语言模型(LLM)架构下,AI知道很多知识,却没有真正的认知。
打个比方,AI大模型就像一个看过所有菜谱的人,知道所有菜名、所有调料搭配和制作流程、甚至知道把握火候的口诀,但它从来没进过厨房。
那么,它只能总结知识,能告诉你怎么做,但它对于炒菜没有认知。
因为一个好厨师,有的不只是知识,还有几百次失败之后形成的对火候、对油温、对食材关系的判断力,以及基于自己的审美和顾客反馈而对烹饪方法随时进行修正的能力。
我们曾借用过《道德经》的“道可道,非常道;名可名,非常名”来解释这个道理:可以言说的,就不是真正的道;给事物命的名,也不是真正的名。
文字和语言都是认知被压缩以后留下的痕迹,AI如果只是学这些痕迹,自然就只能掌握一个失真的世界,无法真正理解真实的世界。
理解这一点有什么用?
就比如,最近物理 AI 和世界模型比较火。
Figure靠着VLA模型(即Vision-Language-Action,视觉-语言-动作模型),再叠加强化学习的方式,让机器人能模仿人的一些举止。
前几天,在深圳,中国的两个机器人还在铁笼里格斗,打得非常精彩。
看上去机器人好像已经可以自主完成一些高难度、长流程的复杂任务了。
但其实,这仍然是个错觉。
Figure能做出一些动作,不代表它知道为什么这个时候要这么做;机器人能打出一套连招,但不代表它懂得为什么要格斗,如何才能打赢。
这就像是,AI有海量视频记录人类怎么切菜、炒菜,但厨师为什么做出这些决策和判断,很少被系统地记录过。
只记录动作,AI只能模仿姿势;记录决策,甚至记录思考过程,AI才能学会其中的逻辑。
还有,当前很多企业在AI落地的时候,出现了不理想的状况,却归因于“知识不够多”,并没有认识到,其实是“认知错位”。
以为只要把更多员工的工作成果、文档、邮件、聊天记录都喂 AI,AI就能学会员工的判断。但事实是,最容易蒸馏的是答案,最难蒸馏的是生成答案的过程,而企业需要的恰恰是过程。
人机融合
所以,说了这么多,究竟该怎么办?
我们曾说,在AI的辅助下,人类正在开启第三次进化。而这个进化,更多是在认知层面,也就是说,人机融合,不是AI替代人,是AI进入人的认知过程。
认知科学里有个老概念,situated knowledges,即立场性知识。
它由思想家Donna Haraway(唐娜·哈拉维)在1980年代提出,指的是,知识不是凭空存在的,它永远产生于某个具体位置、具体视角和具体的社会关系中。
Donna Haraway(唐娜·哈拉维)
说白了,人类的智能本身就不是一个“输入-分析-输出”的线性过程。人类认知、也就是我们的理解、判断和表达,始终与具体的立场、背景、环境和社会关系深度绑定。
这并不是一个多么高深的概念,因为每一句话、每个动作背后都携带着说话人的身份、地位、经历、情感、意图以及当时当地的具体情境。
这些要素构成了信息背后的那些没有被明说、但却深刻影响意义传递的背景信息。只有理解这些隐性知识,我们才能够真正理解一段话、一个行为背后的真实含义。
然而,当前主流的大语言模型在处理信息时,恰恰做了相反的事情。
它把所有的文本从原始语境中剥离出来,并没有重视说话人的立场、背景和情感色彩,只留下看似客观、中立、普适的文字符号。它无法理解一个人为什么会这样说、这样做,也无法感知语言背后鲜活的生命体验。
李飞飞就曾指出,世界并非由文字构成。
文字只是世界的映射,而映射本身已经丢失了大量真实维度。
当我们把无数文本汇聚到一起训练模型时,得到的并不是一个完整的、真实的世界,只是一个失真的、扁平化的、符号化的世界。
这使得,大语言模型虽然能生成流畅的文本、逼真的图片和视频,却缺乏对真实世界的深层理解。
所以,最后,我们觉得,未来AI的真正方向,不能只是把所有知识汇聚成一个具有上帝视角的模型,还应该要重视每一个个体、公司、群体甚至地区或国家的立场性和过程性信息。
AI进入得越深,它就越能理解其中的独特视角,不会用去立场化的全知视角取代一切。
这同时也表明,AI时代,真正的资产不是人类的工作成果,而是人类的认知过程。
就像是,在企业落地AI的过程中,要做的不是把员工的答案数字化,是要把判断过程数字化。比如要让员工在做事的时候自然留下决策痕迹;只在事后留下答案,意义并不是太大。
自然,谁能持续产出高质量的决策过程记录,谁就应该在绩效评估和资源分配中得到倾斜。
类似的,大家要看到,人机融合的关键,不是AI替代人,是AI进入每一个具体的认知过程。
未来最强的智能,也未必是一个全知模型,更可能是一张由无数有立场的AI和人的混合体组成的认知网络。
每个节点都有自己的视角、自己的隐性知识、自己的决策习惯,彼此交叉验证,互相补充。
而这,才能形成第三次进化的原始动力,也是第三次进化将会空前繁荣的原因。
以前,一个国家、一个城邦、一个地区往往只有一个试错的方向,社会迭代自然缓慢。
未来,一个公司、一个小团队、甚至一个人都可以成为一个独立的试错单元,能通过AI Agent,加上自己的立场、判断过程、隐性知识,让自己成为一个微小但真实的进化方向。
当亿万这样的分支同时展开,人类整体的试错效率将远远超过历史上任何一个时期。
我们既兴奋于这种创新爆发的未来,也紧张于其中伴随而来的不确定性。也许,如何筛选有效的分支、如何防止错误方向被放大,将成为这场进化走向何处的核心机制。
那么,你觉得,你有哪些隐性判断是值得被记录下来、并且能被AI理解和放大的?欢迎在评论区留下你的分享。
以上就是今天的内容,更多科技产业前沿分析和洞察,欢迎加入科技特训营学习,和我一起,先人一步,领先一路!
再做个提醒,新一期前哨AI夏令营又开始报名了,科技特训营或AI小课历届会员还有优惠价,为保证教学质量,夏令营名额有限,先到先得!
王煜全要闻评论,我们明天见。
↓长按图片扫码报名,先人一步,领先一路
↓点击报名前哨AI夏令营,带孩子赶上Agent浪潮!科技特训营或AI小课历届会员还有优惠价
最后, 鉴于公众 号推送机制的改变,你未来刷 到要闻评论的机会可能没那么多了,建议你加入粉丝群,第一时间 得到我的独家前沿分析 ,快快扫码加入吧!
热门跟贴