两年后,GPT-6来了。有人在桌游模拟场景里给它出了一道题:让AI主持一场《龙与地下城》第五版规则下的遭遇战,对阵双方是卓尔精灵和夺心魔。结果发现,这个夺心魔角色居然带着一套“101块骨骼的骨架绑定”。
发帖者表示,这是基于2014年第五版规则进行的测试,整体没有发现重大错误,不过夺心魔本可以打出更有创意的战术。发帖者还为自己此前多次发帖出错道了歉。
打开网易新闻 查看精彩图片
一个给AI出的“遭遇战测试”
发帖者提出了一个想法:把“遭遇战测试”作为AI领域的一个书呆子式基准。具体做法是让AI模拟两只《龙与地下城》生物之间的遭遇战,然后看它多久会出错。
这个测试的趣味在于,它不考察AI背规则的能力,而是看它能否在动态对抗中维持一致性。生物的技能、行动顺序、地形影响、战术选择,任何一环崩了都会暴露问题。
GPT-4o表现最好,Gemini有点可爱
在卓尔精灵对阵夺心魔的测试中,GPT-4o的表现最好,Gemini则被形容为“可爱”。发帖者提到,两者的最终结果相似,并且相信更好的提示词会有所帮助。
热门跟贴