游戏一直是被人低估的教育工具。它们门槛低,又很懂人性。

说这话的是 Good Start Labs 联合创始人兼 CEO Alex Duffy。这家公司正在做的事,是把游戏变成训练 AI 模型的教材。它去年十月从 AI 媒体与工具公司 Every 分拆出来,拿到了 360 万美元融资,投资方包括 General Catalyst、Inovia、Every 以及一批天使投资人。

打开网易新闻 查看精彩图片

这个想法的起点,是一场 2025 年的 Twitch 直播。

一场直播里,模型分出了性格

那场直播让前沿模型玩桌游《外交》(Diplomacy)。Duffy 说,这游戏正常玩一局要花上"几天甚至几周"。当时他还在 Every 担任 AI 训练负责人。

看着 AI 智能体在《外交》里互相厮杀,Duffy 发现每个前沿模型面对游戏场景时的行为都不一样。

最扎眼的是两个模型的对比:OpenAI 的 o3 靠策划一场未来的背叛赢下了所有对局;而 Claude 的 Opus 4 拒绝撒谎,结果"被打爆了"。

由此 Duffy 得出了一个判断:用《外交》这类游戏训练 AI 模型,可以教会它们战略思考这类能力。尤其是因为,这类游戏的结果是可以被验证的。

后来他在 Every 上发表的一篇文章里写道:"在策略游戏《外交》上微调一个模型,提升了它在客户支持和工业运营基准测试上的表现。"

背叛与诚实,在游戏里是胜负手,在基准测试里却变成了分数。

可验证,才是关键

Duffy 和联合创始人 Tyler Marques 创办 Good Start Labs,目标就是去找更多能教会 AI 模型有用技能的游戏。

他的原话是:"强化学习环境是教模型任何可验证内容的最可靠方式之一,这一点变得非常清楚。"

更大的设想在于:一个游戏以什么方式呈现给 AI,会决定它学到哪些技能,以及这些技能能不能带出游戏、用到工作里。

目前最有力的证据,来自一款十九世纪的铁路游戏。

1830:一款铁路游戏里的股市机制

Good Start Labs 最近让一个 30B 模型在游戏《1830:铁路与强盗大亨》里接受训练。维基百科对这款游戏的描述是:"一款策略游戏,其中唯一涉及运气的元素是决定初始行动顺序。"

随后,他们把同一个模型放到金融研究任务上测试。这个实验的设计目的,就是检验在游戏里学到的习惯能不能迁移到游戏之外。

Duffy 解释说:"那款游戏内部有股市机制。你在竞标这些铁路公司的股票……"

游戏里的竞价、持股、博弈,和金融研究任务之间,就这样被接上了线。

谁最可能背叛你

Good Start Labs 还发布了一份《外交》表现排名。按这份 2026 年 9 月的排名,Grok 4 Fast 是最不可能背叛你的那个模型。

反过来,在《外交》里别信 Gemini 2.5 Pro。

这份榜单本身也说明了一件事:同一个游戏,不同的模型会走出完全不同的路数。而 Duffy 想弄清楚的,正是这些路数背后,哪些能变成真实工作里的能力。