有人搭了一个叫 Brood War Bench 的测试场,把当下主流大模型拉进来打即时战略,让它们互相对战。结果是:所有模型的水平都没超过新手。

这个结果之所以扎眼,是因为《星际争霸:母巢之战》在 AI 研究里不是新面孔。这款 1998 年的经典即时战略游戏,一直是 AI 研究的老朋友。

打开网易新闻 查看精彩图片

AlphaStar 的旧账

2019 年,DeepMind 的 AlphaStar 曾在这款游戏里击败职业选手。那是即时战略游戏里少见的、AI 站上人类顶尖水平的时刻。

但那次胜利有个前提:AlphaStar 是专门训练的强化学习系统。它不是为了聊天、写代码或者回答问题的通用模型,它的全部本事都长在《星际争霸》这一件事上。

打开网易新闻 查看精彩图片

通用与专用的分界线

Brood War Bench 测的是另一类东西——当下主流的大模型。它们能对话、能写代码、能处理各种任务,但被放进即时战略的对战环境里,表现没能越过新手这条线。

一边是专门训练、击败职业选手的强化学习;一边是通用能力很强、却打不过新手的大模型。同一个游戏,两套系统,结果差得很远。