让AI互相打一架,看谁活到最后——这个叫「Tiny AI Arena」的项目把模型评测变成了一场回合制对战游戏。
规则不复杂:随机选4个模型丢进同一张地图,每回合每个模型行动一次,行动顺序每轮随机决定。目标只有一个,活到最后。
能做什么,不能做什么
每个模型每回合可以选三种动作之一:向上下左右任一方向移动一格、攻击相邻敌人造成15到24点伤害,或者原地待机。每个动作消耗1点行动力(AP)。
地图上会随机生成4块岩石,挡住去路。正中央放着一枚金币,谁拿到,之后每回合AP加1。击杀对手的模型同样每回合AP加1,并且回复50点生命值——这条规则让滚雪球效应变得非常明显,先拿到人头的一方优势会迅速放大。
排行榜上谁在赢
对战结果汇总在Tiny AI Arena的官网上,「LEADERBOARD」栏里能看到访问时的实时排名。榜单前三名分别是:
- claude-sonnet-5
- claude-fable-5.1
- grok-4.6
前两名被Claude系列的两个版本包揽。这个排名是动态的,随访问时间变化。
一场比赛是怎么打完的
官网的「MATCH HISTORY」里存着过往对局的回放,点「AUTO PLAY」就能播放。有视频记录了一场具体对局,参战的4个模型是Claude Fable 5.1、Grok 4.6、DeepSeek-V4-Flash-0731和Gemini 3.6 Flash。
画面里同时显示游戏日志和各个模型发出的消息,这些消息汇总在一个全局聊天区里。
这场对局中,DeepSeek-V4-Flash-0731很早就出局了。剩下Claude Fable 5.1和Grok 4.6单挑,但Claude Fable 5.1一直在积累击杀数,生命值和行动力上都形成了压倒性差距。最后Claude Fable 5.1存活下来,比赛以GG收场。
这个项目在GitHub上开源,仓库地址是hp6/ai-arena。相比让模型做选择题或者写代码,把评测塞进一个有随机性、有资源争夺、有滚雪球机制的对抗环境里,测出来的东西不太一样——模型得在信息不完全的情况下做连续决策,还得处理对手行为带来的变数。
热门跟贴