1959到1968年,强化学习还没有名字。贝尔曼给出了理论边界,但真正让机器学会下棋的,是两位工程师绕开算力限制的土办法。

贝尔曼划了线,塞缪尔先动手

打开网易新闻 查看精彩图片

贝尔曼的理论指出了动态规划的计算极限。亚瑟·塞缪尔没有等理论完备,直接写了跳棋程序。唐纳德·米基则造出MENACE,用一堆火柴盒和珠子搭出会学习的机器。

两人面对的是同一个问题:算力不够。他们没有硬算所有可能性,而是让机器从对局结果里反推。

时序差分:不等终局就更新

塞缪尔和米基的做法,后来被概括为时序差分学习。核心思路是不必等到棋局结束才调整判断,每一步之后就能根据下一步的估值修正当前估值。

这套方法还带出了策略与价值的区分:一个决定怎么走,一个评估局面好坏。两者分开,机器才能在有限算力下持续改进。

这些早期启发式方法没有严格的数学证明,却让机器真的学会了下棋。时序差分和策略/价值之分,后来成了强化学习的底层构件。