整理 | 郑丽媛

出品 | CSDN(ID:CSDNnews)

一边让全世界的程序员、写作者和职场人「多用 AI」,另一边,负责训练 AI 的人却因为用了 AI,被直接踢出项目——这听起来像一个段子,但据 404 Media 最新调查,它确实发生在 OpenAI 的模型训练体系里。

本周 404 Media 披露,多名参与 OpenAI AI 模型训练的外包人员,因为在工作过程中使用 AI,被解雇或移出项目。有意思的是,他们的工作本身就是阅读真实用户与 ChatGPT 的对话、评价 AI 回答,再把这些人工判断反馈给模型。

而这场“训练 AI 的人不能用 AI“的冲突,也让此前OpenAI曝光的「Project Lily」浮出水面。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

第一类人:每天给 ChatGPT 的回答「打分」

要理解这件事,首先得知道这些外包人员到底在干什么。

9 月中旬,404 Media 曾曝光 OpenAI 内部代号为「Project Lily」的项目。根据其获得的内部文件,OpenAI 会让数百名外包人员阅读真实 ChatGPT 用户提交的 Prompt甚至完整对话,然后对 ChatGPT 的回答进行评分。他们需要判断 AI 的回答是否准确、是否过度迎合用户,以及有没有把 ChatGPT 说得太像一个“真人”等。

简单来说,这就是一种典型的人工反馈流程:AI 生成回答,人类负责判断这个回答到底好不好,再把结果反馈给模型。

而这项工作规模并不小。根据 404 Media 此次获得的另一份内部文件显示,OpenAI 某些相关项目的参与者规模甚至可能超过 1 万人。虽然这并不代表所有人都在做 Project Lily,但足以说明,人类外包劳动依然是大型 AI 模型训练体系中的重要一环。

更值得注意的是,这些人处理的并不一定是 OpenAI 专门编造的测试数据,而可能是真实用户提交给 ChatGPT 的内容。此前关于 Project Lily 的报道指出,经过隐私过滤后,部分敏感信息仍可能出现在审核人员看到的内容中。

对此,OpenAI 的回应是:承认过滤器可能漏掉罕见标识符或模糊的私密表述——换句话说,你用来当树洞、当心理咨询师的那些对话,可能正在被大洋彼岸的某个承包商细细品读。

打开网易新闻 查看精彩图片

第二类人:专门检查第一类人有没有「偷偷用 AI」

除了直接评价 ChatGPT 回答的人员之外,OpenAI 相关项目还有另一类外包人员:他们负责审核其他外包人员的工作。

这两类人的工作并不是一回事:

● 前者负责「训练数据」:看 ChatGPT 的回答 → 评价质量 → 提供人工反馈。

● 后者负责「质量监督」:看外包人员提交的工作 → 判断是否符合要求 → 检查有没有违规使用 AI。

而 404 Media 获得的一份内部工作指南明确规定,后者同样不能使用 AI。文件写道,审核人员不得使用 AI 检测工具,也不得自己使用 AI;包括 Grammarly 和 AI 翻译工具在内,也不能用于撰写反馈、评论或完成审核工作。

原因很简单:如果负责抓 AI 的审核人员自己也依赖 AI,那么这套监督机制就失去了意义。

因此,整个流程实际上变成了:训练人员负责给 AI「打分」,审核人员负责检查训练人员有没有违规——而两类人,都必须证明自己的工作来自本人。

这也解释了,为什么审核人员会拿到一份专门的「AI 使用痕迹」指南:他们需要留意一些可能意味着 AI 参与的特征,包括重复性措辞、明显的 AI 写作风格,以及工作完成速度异常快等。甚至连标点符号都可能成为判断依据,例如过度使用破折号等。

不过,这份内部文件也提醒审核人员,不要依赖单一线索,也不要用 GPTZero 等 AI 检测工具来直接判断,而是要关注整体,不能看到某一个符合的特征就下草草下结论。

打开网易新闻 查看精彩图片

「我只是需要一点帮助」,最后却丢了工作

404 Media 采访的几名外包人员中,有人承认自己曾在参与 OpenAI 模型训练时使用 AI。

其中一人甚至向媒体提供了一封据称是自己的解雇通知。通知称,雇主发现其工作存在「真实性」(Authenticity)方面的问题。这名外包人员表示:“我不是一个坏人,也不是一个糟糕的员工。我只是需要一点帮助,于是向 AI 寻求支持,但最终却因此走向了失败。”

他还坦言,自己已经无法从这份工作中感受到快乐,也觉得自己没有真正为社会作出贡献。

另外,在 404 Media 采访的人员中,还有 2 人曾为 Mercor 工作——Mercor 是一家 AI 训练公司,负责招募专家和外包人员,让他们参与包括 ChatGPT 在内的 AI 模型训练工作。

而对于外包人员使用 AI 的问题,Mercor 发言人也向媒体表示,公司招聘这些专家,看重的正是他们的专业知识和判断能力,合同明确禁止使用LLM完成项目,并会通过工具和系统检测违规行为。一旦确认工作人员使用 AI 完成任务,公司会立即将其移出项目。

打开网易新闻 查看精彩图片

AI 越会干活,训练 AI 的人反而越不能让 AI 干活?

截至目前,OpenAI 暂未就外包人员因使用 AI 被解雇一事作出回应。

而这起事件有意思的地方,并不只是「训练 AI 的人不能用 AI」,而是它实际上暴露了 AI 产业正在面对的一个现实问题:当 AI 成为越来越多人的生产力工具时,哪些工作仍必须由人亲自完成?

对于普通办公人员来说,用 AI 润色一句话、翻译一段文字,可能只是效率问题;但对于训练 AI 的人来说,情况完全不同:因为他们的「人类判断」本身就是产品的一部分。

如果本来负责告诉模型“这个答案好不好”的人,让另一个 AI 替自己做了判断,那么训练数据的来源就发生了变化;如果这种 AI 生成内容又被拿去训练下一代模型,就可能进一步引发人们对所谓“模型崩溃”的担忧——即模型反复学习 AI 生成的数据后,输出质量将逐渐下降。

所以,这场看似荒诞的「AI 禁令」,其实也是 AI 产业的一道新难题:AI 越来越擅长替人完成工作,AI 公司却必须想办法确保,在最关键的训练环节里,人类还没有被 AI 替掉。

而这,或许也是 AI 进入大规模生产之后,一个越来越难绕开的悖论。

参考链接:https://www.404media.co/people-training-openais-ai-fired-for-using-ai-to-train-the-ai/

当 OpenAI、Anthropic、Google,到智谱、DeepSeek、Kimi、阿里都开始密集发布自进化相关研究,RSI 正从概念走向真正的技术竞赛。

11 月 20—21 日,2026 奇点智能技术大会「大模型技术:从 Agentic Scaling 到 RSI」专场,将邀请一线研究者与工程专家,围绕 Agentic Scaling、RSI、自进化闭环、持续学习、AI 制造 AI 等关键问题展开分享。

同时,我们整理了 《RSI(递归自我改进 / 自进化)前沿研究资料包》,汇总 OpenAI、Anthropic、Google、DeepSeek、智谱、Kimi、阿里等最新论文、官方技术报告与研究出处。

扫描下方海报二维码,领取 RSI 前沿资料包,并了解专题参会详情。

打开网易新闻 查看精彩图片