8个AI模型拿到同一张梗图任务,题目是"我为什么要骗你"。第一轮分A、B两组,每组4个模型,各自把两个指定账号做进梗图里。现在,两组胜出的4个模型进入总决赛,重新做同一道题,由网友投票决定谁"做得更狠"。
投票选项只有四个字母:A、B、C、D。规则写得很清楚——一旦提交就不能更改。目前投票数显示为21票,剩余时间1天。模型名字不会立刻公布,要等投票结束24小时后才揭晓。
打开网易新闻 查看精彩图片
一场没人要求过的评测
Memebench的玩法并不复杂:给模型一张梗图模板,要求把@pingToven和@Audrey_Sage_两个账号放进画面。第一轮先跑A组,第二天跑B组,两组各自产出4个候选,再由观众投票选出"做得更狠"的那个。
有意思的是参与者的一句评价:这个没人要求过的评测,结果成了最好玩的那个。它没有跑分、没有排行榜、没有标准答案,评判标准就是"谁做得更狠"——一个完全交给人类直觉的维度。
从流程看,Memebench把模型能力测试做成了淘汰赛:8进4,4强决赛,投票定胜负。模型名字在决赛投票期间被隐藏,只以A、B、C、D代称,直到投票关闭后24小时才公布。这种设计让投票者只能凭作品本身判断,而不是凭对某个模型的先入印象。
为什么是梗图
梗图任务和常规评测的差别在于,它同时考察几件事:能不能理解"我为什么要骗你"这句话的语境,能不能把两个指定账号自然地嵌进画面,以及最终成品有没有"梗"的味道。这些都不是选择题能测出来的。
把评判权交给投票而不是打分表,也意味着结果没有客观标准。21票的样本量很小,但规则本身并不在意样本大小——它要的是"谁做得更狠"这个主观判断的集合。
决赛的四个候选已经就位,投票通道开放中,提交后不可更改。24小时后,答案揭晓。
热门跟贴