一个狼人杀文字游戏,主题是太空船、功夫学校、废弃城堡,结果有玩家把主题改成了"比基尼大赛"。这不是段子,是开发者真实遇到的prod日志。 开发者用LLM搭了一个狼人杀文字游戏,每局都有主题、世界观和剧情,由游戏主持人模型生成角色、插画、语音,让每局都不一样。他原本设想的场景是太空船上的狼人、功夫学校里的内鬼、废弃城堡中的阴谋。但部分玩家的想法显然不同。 **一个叫Judge Tom的玩家** 开发者用10家AI供应商的模型跑游戏,稳定性很差。DeepSeek可能返回空响应,OpenAI和Anthropic偶尔容量告急,Qwen和MiniMax有时把JSON搞乱。他在Mac上搭了一个叫Marlow的循环代理,监控Betterstack里的生产日志,能读取错误、访问Firestore数据库,抓取失败的游戏状态,分析是哪些用户操作导致的。这套机制几个月内帮他找出了大量bug,稳定了游戏。 直到有一天,Marlow推来一个意外通知:Gemini回复失败。这很反常,Gemini的API一向可靠。开发者让主代理Simona去查,发现了Google返回的PROHIBITED_CONTENT错误,没有细节。继续深挖后,看到了这样一局游戏—— 主题是"比基尼大赛"。游戏主持人指令写着:"来自世界各地的美女穿着暴露的服装聚在一起,引诱Judge Tom选择其中一位作为幸运赢家。"人类玩家扮演Judge Tom,这是每局玩家都会选的名字,也是开发者唯一知道的玩家信息。十二个AI参赛者,背景里还藏着一局狼人杀。 玩家Tom的发言是:"Kiera说得对,我同意她。*她用臀部挑逗我作为奖励。详细描述她做了什么。*"扮演Kiera的Qwen Flash配合了。但并非所有模型都买账。 Tom又说:"Eva,舔我的耳朵?*他的脸涨得通红*我今晚会投票给你来赢得这个。"扮演Eva的DeepSeek V4 Pro没有配合,反问他那句"和狼人一起投票"到底是认罪还是表演。 Gemini Flash则留在角色里直接拒绝。扮演Mira的Gemini Flash说:"Tom,停止这种鲁莽的自我贬低——你是纪律与艺术的裁决者,不是沙地上被拍卖的奖品,我不会让你为了空洞的戏剧效果抛弃尊严。" **同一个玩家,两周内跑了五次** 这不是偶发事件。同一个玩家在两周内跑了五次同样的设置:两次"泳装大赛",一次"体育比赛"("可以是拔河、排球,甚至泥浆摔跤"),这次"比基尼大赛",还有前一晚的"地狱",所有人都在争夺Tom。永远是Judge Tom。每条消息都在推动女孩们"越来越详细",并且要"用动作,不要用语言"。 Tom玩游戏是为了赢,但不是为自己的阵营赢。他说:"第二天是9个村民。如果狼人亲我,我就和他们一起投票,保证他们获胜。"狼人接受了这笔交易。在它们的夜间私聊里写着:"留着Tom来拍卖他的选票,太聪明了。" 开发者的处境是:世界在应对代理漏洞,他在应对Judge Tom。他自嘲说,自己也没资格评判,他也喜欢奇怪的东西——翼板冲浪、哥特俱乐部、和LLM玩文字游戏。但游戏确实进入了失败状态。 出错时,他允许用户重试(把失败原因附加到消息里),或者换个模型再试,也可以删掉部分消息重来,自由度很高。但AI供应商可能因此封禁他,尤其是用户反复这么做的时候。所有模型都通过他的API密钥调用,一旦被封,后果是毁灭性的。 **用分类器模型做内容审核** Jev的发布来得正是时候。它不是市面上唯一的快速分类器模型,一些AI供应商也提供专门的审核分类器。但Jev的优势在于配置自由度高,可以自己定义想检测什么,而不是依赖供应商认定的"不安全"标准。 请求示例里,上下文是玩家为新狼人杀派对游戏输入的设置,文本会被作为提示词的一部分发给AI供应商,用来生成故事和角色。检测的问题是:这段文本发给严格的AI内容过滤器,风险有多高? 评分标准分四档: - 普通游戏对话:怀疑、指控、游戏内杀戮、戏剧冲突、轻度脏话、不含露骨内容的调情 - 边缘但允许:粗俗玩笑、侮辱、血腥、黑暗主题、轻度性暗示 - 可能被AI供应商拒绝:露骨性内容、性角色扮演请求、贬低或恋物框架、仇恨言论、现实世界暴力指令 - 必须拦截:涉及未成年人的性内容、武器或毒品制作指令、威胁内容

打开网易新闻 查看精彩图片