让AI打游戏不新鲜,但把吃豆人当成考卷,专门测"临场反应",这事有点意思。提供AI接口服务的Opper公开了一个叫jevman的基准测试,规则很直接:让AI玩吃豆人。

它测的不是谁分数高那么简单。同一款游戏,6种AI模型各玩100次,然后横向比三件事:拿到多少分、做判断有多快、跑起来花多少钱。

打开网易新闻 查看精彩图片

为什么是吃豆人

打开网易新闻 查看精彩图片

吃豆人这类游戏,每一步都得在极短时间内决定往哪走。幽灵在动,路线在变,犹豫一下就被堵死。用它来考AI,考的是"当下这一秒怎么选",而不是慢慢想一道大题。

所以jevman盯的是"素早い判断"——快速判断。分数只是结果,判断速度和执行成本才是它想拉开差距的地方。

三项指标一起看

打开网易新闻 查看精彩图片

把得分、速度、成本放在同一张表里比,逻辑就清楚了:

  • 得分:AI在游戏里实际拿到多少分
  • 判断速度:每次决策有多快
  • 执行成本:跑完这些局要花多少钱

三者叠加,比的就不只是"谁聪明",而是谁在真实场景里又快又省。对要落地AI的团队来说,这个组合比单看跑分更接近实际选择。

目前公开的信息就到这里:一个吃豆人基准,6款模型,各100局,三项指标。至于谁赢谁输,还得看完整结果。