两年后,GPT-6来了。有人在桌游模拟场景里给它出了一道题:让AI主持一场《龙与地下城》第五版规则下的遭遇战,对阵双方是卓尔精灵和夺心魔。结果发现,这个夺心魔角色居然带着一套“101块骨骼的骨架绑定”。

发帖者表示,这是基于2014年第五版规则进行的测试,整体没有发现重大错误,不过夺心魔本可以打出更有创意的战术。发帖者还为自己此前多次发帖出错道了歉。

打开网易新闻 查看精彩图片

一个给AI出的“遭遇战测试”

发帖者提出了一个想法:把“遭遇战测试”作为AI领域的一个书呆子式基准。具体做法是让AI模拟两只《龙与地下城》生物之间的遭遇战,然后看它多久会出错。

这个测试的趣味在于,它不考察AI背规则的能力,而是看它能否在动态对抗中维持一致性。生物的技能、行动顺序、地形影响、战术选择,任何一环崩了都会暴露问题。

GPT-4o表现最好,Gemini有点可爱

在卓尔精灵对阵夺心魔的测试中,GPT-4o的表现最好,Gemini则被形容为“可爱”。发帖者提到,两者的最终结果相似,并且相信更好的提示词会有所帮助。