两岁的孩子坐在公园长椅上,你指着一只路过的金毛说,狗。他盯着看了一会儿,没说话。三天后,邻居牵出一条吉娃娃,他伸出手指说,狗。
没有人教过他,狗是什么意思,他都不知道。他听过的次数,一只手数得过来。
你试着把这套规则讲清楚,会发现自己也讲不清:一只大狗和一只小狗,凭什么共用同一个词。但孩子就是会了。更奇怪的是,如果下次他指着一只猫说「狗」,你纠正一次,他大概也就记住了。有些规则,一条经验就装了进去。
每个带过孩子的人都被这一幕震惊过,然后很快忘了。它太日常了,日常到没人去想它有多不寻常。
但是,现在我们看看另外一端。你刷过一万条短视频,合上手机,什么也没留下。ChatGPT 读完了整个互联网,让它数一段恰好 29 个字母的句子,它容易数错;换成 30 个,反而数对。原因很怪:30 这个数字在文本里比 29 常见,它训练出来的“数字直觉”,悄悄替它做了主。
学习到底靠什么?
为什么有时候一条经验就够,有时候一万条都不够?为什么有人比别人学得快?这个问题不是我发明的。十九世纪的英国哲学家约翰·斯图亚特·密尔(John Stuart Mill)就问过。
最近,我跟会员推荐了普林斯顿大学认知科学家汤姆·格里菲思(Tom Griffiths)的一本新书,书里也探讨了这个问题。 格里菲斯之前出版过一本书《算法之美》。
据说,密尔曾经读完了他那个时代出版的所有的书籍。显然,今天已经不可能了。密尔问那个问题的时候,世界上还没有互联网,没有一万条短视频,也没有能读完整个互联网的机器。所以,他的这个问题提前了一百多年,等在了那里。
格里菲思在书里给的答案,和我们从小被教的那一套,恰好方向相反。而这背后的思路,在今天的ai时代,特别值得拿出来讲一下。因为AI只会放大这种差距。
一、你不是缺经验,是缺先验
先说普通人默认的一套认知:学习等于积累经验。经验越多,学得越多;一万条永远比一条强。学校按这个逻辑教,家长按这个逻辑卷,大部分人也是按这个逻辑囤积各种教程、文章和书籍。
格里菲思的答案,先把这个想象拆了。
一条经验能带来多少学习,取决于两件事。第一,它作为证据有多强。第二,在它到来之前,你给那个假设多大的信任。第二件,他叫先验(prior)。先验就是经验落地之前,你心里已经标好的价。
可以看两个例子。
你在实验室里看到一块铜导电,立刻相信所有铜都导电,包括你从没见过的任何一块,你甚至不会想去找第二块来验证。可你在家庭聚会上,发现房间里坐着一个排行第三的儿子,你不会因此推断全屋都是第三子。
美国哲学家纳尔逊·古德曼(Nelson Goodman)一辈子研究一个刁钻的问题:哪些规律值得从经验里推广。他举的正是这对例子:同样是「看到一个正例」,一个让你放心推广到全宇宙的铜,一个连下一位客人都推不过去。
差别不在于经验本身。两次观察在形式上几乎一样。差别在于,经验落地之前,你给两个假设标了不同的价:同类物质共享性质,你早就信;房间按出生排行聚集,你从来没信过。经验只是落下来,砸中哪个价签,就按哪个价签成交。
先验听上去很学术,但我们每天都在用。同一块灰色,放在阴影里你觉得浅,拿出来你觉得深,眼睛给你的信号其实一样,剩下的全是你自己补的。一句没听清的歌词,你会自动听成一句熟悉的话。我们的感官给的信息永远不足够,缺口往往都是靠先验来填。
还有一条规律:经验的力量会随着相似度衰减。吃过一种蘑菇没事,面对另一种,你还是会小心;只不过长得越像的,你才越敢下口。一条经验画不出全有全无的边界,它画出的是一圈一圈往外淡出去的光晕。
这也能解释一种日常的不公平:同样勤奋的两个人,一个读十本书像读了十本,另一个读一本顶十本。差别不在书,在读书之前各自是什么人。
另外一个例子有点抽象。
爱伦·坡笔下的侦探杜宾,经常靠现场的几条线索破案。格里菲思借它讲概率推理:假设凶手是一只猩猩,先验概率是 0.15。线索是「凶手爬得上去」。如果只有猩猩能解释这条线索,其他生物不匹配场景,凶手是猩猩的概率从 0.15 冲到 0.75。如果人通常也能爬,同样的线索只把概率推到 0.158。
算法很简单:能爬上去的可能世界合起来占两成,猩猩占其中的一成半,一成半除以两成,就是 0.75。同一条经验,两种命运。它的力量不取决于它自己,取决于它有没有竞争对手。
侦探和普通人的差距,从来不在于看见多少,而在于给每条线索标多少对价。
一条经验值多少钱,往往不在于它是怎么得来的,而是由它能不能被别的解释顺手消化掉决定。
被一个人骗过一次,从此对整类人设防;被市场教训过一次,胜过读完十本投资书。你以为是那一次太痛,其实是那条经验找到了你身上早就备好的价签。
密尔那个问题,到这里可以回答一半。一万条经验可以一条都不起作用,因为每条都落在你没标过价的假设上,落下来就被滑走了。一条经验可以顶一万条,因为它正好落在一个你早就准备好的价签上,当场就可能成交。
所以,经验是钥匙,先验是锁孔。一万把钥匙开不了的锁,一把对的就开了。
二、偏见不是学习的敌人,是学习的前提
你可能已经觉得,先验听起来像「偏见」的体面说法。格里菲思的结论比这个更反直觉:没有偏置的学习者,什么也学不会。
他举了一个小算式:x 加 y 等于 5。数学给不出唯一答案,3 和 2 可以,负 1 和 6 可以,3.1 和 1.9 也可以。要给出一个具体答案,你必须自带倾向。这就是说,一个对所有解释一视同仁的学习者,面对任何一份经验,都无从下手。
他管这叫「学习守恒」:你能考虑多少种假设,学会每一种就需要多少证据。信任是一种有限的资源,你能考虑的假设越多,分给每一个的就越薄,数据就得更有力,才能把某个假设重新垫起来。可能性越开放,经验越廉价。
这也顺手解释了一件事:为什么大模型要吞下整个互联网。它的起点几乎无限灵活,几乎不预装任何倾向,每一份数据都要从零开始教。而孩子不用。孩子的起点被漫长的进化预先裁剪过,他来到这个世界的时候,已经带着一整套倾向:什么东西值得注意,什么规律值得推广。
孩子接触的经验还比机器吃的文本值钱,一句话连着手势、眼神和眼前的物体,同样一个词,对他来说是几条线索捆在一起。没人给他列过「哪些句子不能说」的清单,他照样把边界划得清清楚楚。这个能力,跟记性无关,跟起点有关。
当然,低先验也不是不能翻身。一屋子人,你看到第一个人是家里的第三子,你不会当回事;第二个,只当是巧合;第三个,开始好奇;第五个,你会怀疑自己闯进了一场第三子聚会。证据一直在累积,只是起点太低,需要更多条,才能把你垫起来。
一万条经验并非全无用处,它能补起点低的账。
有个实验可以看得更清楚。语言学家查尔斯·杨(Charles Yang)和认知科学家史蒂文·皮安塔多西(Steven Piantadosi)给一个系统装上结构化的先验,让它学一种人工语言:大约十个合法例子,就达到了普通神经网络要几百个例子才有的表现。这是特定任务,不能夸张成十句话学会一门真语言。但方向是硬的:同样的数据,起点不同,产出天差地别。
起点很重要,而且也有代价。如果真实规律不在你的假设空间里,再强的先验也只会把人带向错误的方向。固执的人学不会新东西。因为他们的价签早就贴死了,新经验砸上去,连个响都没有。所以年纪越大越难学新东西,未必是脑子慢了,是价签贴得太满。
所以「偏见」这个词,被我们用坏了。日常语境里它是毛病,在认知上它恰恰是引擎。
对世界对路的偏见,我们叫它直觉,叫眼光,叫洞察。跟世界一直拧着的,才叫偏执。
三、GPT 读完了整个互联网,学习能力还比不上一个两岁孩子
再说现在的 ai,已经能解决百年难题,但还会数错字母。一个读完整互联网的系统,数 29 个字母会错,数 30 个反而对。这件事很有意思。
它会错,是因为为「预测下一个词」练出来的倾向,在需要精确计算的场合,就变成了干扰。它见过的文本里,30 比 29 常见,这个概率直觉在语言任务里是天赋,在计数任务里是残疾。格里菲思和同事用 GPT-4 做过一个研究,想说的正是这一点。
同一个倾向,在一个任务里是天赋,在另一个任务里可能是残疾。
所以大模型的流畅,和它的正确,是两笔账。流畅来自先验,正确来自任务。先验错了,流畅就是帮凶。
你见过的那种说得头头是道、查无实据的 AI 回答,就是这个机制的另一面。你不是 GPT,但同一个机制天天在你身上运行:做熟的事又快又好,做生的事错得离谱,因为你把老任务里练出来的倾向,带进了新任务。
人们以为 AI 公司的钱都花在数据上。其实,最前沿的活儿,越来越像是「给机器装先验」。卷积网络假设同一个图案在图片任何位置意义相同,这是把一种倾向焊进架构;元学习让网络先学会「怎么开始学」,再去学具体任务。外层循环像进化,花漫长的时间选出好起点;内层循环像是个体的一生,用眼前的经验做调整。
机器现在做的,是把进化那一步,用算力重跑一遍。
这些看着是工程细节,做的其实是同一件事:把人类进化了几百万年才攒下的起点,一点一点搬进机器。
打个比方,有人从农村到了陌生的城市,几天就摸清哪条路堵、哪家店好吃。他学到的,与其说是城市本身,不如说是一套怎么摸清城市的方法。
这背后的变化,比技术更大。数据已经便宜到接近免费,起点却越来越贵。人人都在囤,囤课程,囤文章,囤一切长得像知识的东西,可囤进来的绝大多数,连你现有的价签都碰不到,进来就滑走了。你刷到的内容越多,越难说清自己相信什么。这是结构问题,跟自律无关。
信息越过剩,起点越值钱。
这句话换个说法,就是我以前写过的:知识套利已死,叙事者永生;信息差的本质,根本不在于信息。今天这篇文章可以补上它的认知学底座:学习这件事,本来就不靠信息量。
四、白纸是学不会任何东西的
「清零」「空杯心态」这套话,在中文互联网流传了很多年。作为一种心灵鸡汤,听过就算了。但如果从认知和学习的角度,它正好把话说反了。没有先验的学习者面对世界无从下手,这是前面讲过的机制,跟姿态无关。
你真正要做的,不是清零,不是放空,是换起点,检查你的先验。
你应该读那些能改写你「预先相信什么」的书,靠近那些能给你新假设空间的人。一条好经验落在你身上,当场改变你;一万条平庸的经验,只会被旧框架当噪音消化掉。
囤积也有囤积的好处:它让你觉得自己在学,又不用真的改变什么。算法喜欢这样的你,停留时长在涨。两边都满意,只有起点原地不动。换起点比囤材料难,所以少有人做。囤是往购物车里加东西,换起点是要换掉那个正在往购物车里加东西的人。
怎么换起点,没法列清单,但有一个简单测试:读完一篇文章,如果你只觉得「说得好」,“我也是这么想的”,“这话我爱听”,那它就顺着你的框架滑过去了;但如果你读到一半,心里咯噔一下,发现自己之前想错了,那才是一条新经验落了地。那种时刻,一条就顶一万条。
我在《战略性无知》里写过,真正有判断力的人已经不看信息了。那篇讲的是从信息市场里退出来。这篇想讲的是退出来之后的事:装什么进去。两篇加起来,是同一件事:把接收信息的主权,真正拿回来。
白纸学不会任何东西。真正要做的,是把纸上写错的地方,重写一遍。
你读这篇文章的每一句,都被你现有的框架筛过一遍。同意的留下,不痛不痒的滑走。
而明天,信息照样像水一样流过来。
问题从来不在你收不收,而在于在你的网眼有多大,在于你预设的框架。
一万条经验里哪一条能击中你,早就被你的先验决定好了。先验跟你的自我,是同一件东西。要改先验,就是改人。
这件事,AI 帮不了你;它只会放大不同人的先验。【懂】
经叔最近做了一个网站,可在本号首页右下角订阅。
人肉筛选挖掘的硬核优质内容及深度原创,重点关注科技、文化、财富、权力四大要素以及它们之间的互动与影响。网站定价1999元/年,目前内测优惠价1299元/年,感兴趣的读者也可以加经叔微信订阅。
另外,欢迎加入经叔的知识星球。在这里,我们拒绝无用的焦虑,只谈底层的逻辑与实战的干货。我会结合最新的AI前沿动态、深度的商业创新分析(如一人企业的构建)和独特的文化思潮(如麦克卢汉的媒介洞察),帮助大家把握时间窗口。
我是不懂经的经叔,国内最早翻译介绍了纳瓦尔的《如何不靠运气获得财务自由》,以及影响了纳瓦尔、中本聪、马斯克等大佬的《主权个人》。
不懂经知识星球,众多百万粉丝大V、千万及亿万富翁订阅。专注分享一人企业、一人创投主题,关键词:AI、IP、创投、科技及商业前沿的高杠杆内容。
愈懂愈自由
热门跟贴