1997年,深蓝在国际象棋上击败卡斯帕罗夫。2016年,AlphaGo在围棋上战胜李世石。德州扑克的AI也早就把职业牌手打得没脾气。但有一款经典游戏一直没被攻破——军棋(Stratego)。

连预算充裕的DeepMind都没能造出一台机器,稳定击败最顶尖的人类军棋手。现在,一支来自卡内基梅隆大学、麻省理工学院、纽约大学和斯坦福大学的研究团队做到了。他们开发的AI叫Ataraxos,以15胜1负4平的战绩击败了Pim Niemeijer——被公认为军棋史上最强的选手。

打开网易新闻 查看精彩图片

更让人意外的是成本:训练它只用了16块GPU和几千美元。

为什么军棋这么难

军棋的规则里藏着一个核心难题。每名玩家有40枚棋子,代表从元帅到间谍的不同军衔,外加炸弹和一面军旗。你的对手知道你的棋子在哪里,但不知道它们是什么。只有两枚棋子碰撞交战时,身份才会揭晓——较弱的一方被移除,胜者的身份同时暴露。

这意味着军棋是一款不完美信息博弈,和德州扑克同类。扑克多年前就被计算机攻克了,军棋却迟迟没有。

纽约大学研究员、该研究合著者Eugene Vinitsky解释了原因:“军棋有一个非常独特的地方,它包含大量隐藏信息,而且这些信息要在很长的时间尺度上逐步展开。”

预算之外的变量

隐藏信息量大、展开周期长,这两点叠加,让军棋的搜索空间和决策链条远比扑克复杂。扑克每一手的信息量有限,而军棋的40枚棋子身份未知,要在整局对弈中一点点试探、推理、记忆。

Ataraxos用16块GPU和几千美元的训练成本,完成了DeepMind在更高预算下没能稳定做到的事。这个对比本身,比胜负数字更值得琢磨。