一份2023年1月的内部备忘录,最近因为法院文件解封才被外界看到。写下这段话的人,是微软应用科学总监Brent Hecht。他用了一个相当重的说法来形容AI抓取:"人类历史上最大规模的劳动盗窃"。
这不是外部的批评者在骂街,而是一家正在做生成式AI的公司,自己的高管在内部文件里的判断。据TechCrunch报道,Hecht在备忘录中还把这种行为称为"规模空前的惊人盗窃"。
他担心的不只是版权
Hecht的逻辑链条值得拆开看。生成式AI存在一种"真实风险",会冲击那些人的就业——而这些人恰恰是在不知情、不情愿的情况下,为模型提供了训练数据。
换句话说,被拿去训练模型的内容,来自一批创作者;而模型成熟之后,最先被替代的,可能也是这批创作者。Hecht把这种循环称为"末日循环"(doom loop)理论。
这个判断来自微软内部,而不是某家媒体的社论。它承认了一件事:大语言模型有可能从根基上瓦解自己的内容供应链。
93%这个数字
微软自己的内部研究给出了一个更具体的参照。据称,与微软自家的传统搜索引擎Bing相比,Copilot可能让用户点击进入《纽约时报》的次数减少多达93%。
这个对比的对象不是别的聊天机器人,而是同一家公司、同一批用户习惯下的搜索入口。用户从"点进网站看原文"变成"在对话里拿到答案",中间消失的那部分流量,就是内容方的损失。
这些内容来自2023年《纽约时报》对微软和OpenAI提起的诉讼。该报指控这两家AI公司未经许可复制并使用其受版权保护的作品。
纳德拉的表态与OpenAI的做法
微软CEO萨提亚·纳德拉也曾承认,如果他事先知道OpenAI在抓取付费墙后面的数据,他会行使微软的权利,要求OpenAI重新训练模型,把这部分受保护的数据排除在外。
针对OpenAI的指控则更具体:据称这家ChatGPT的开发商在材料进入大型数据集之前,移除了其中的版权声明,目的是让模型不会向用户重新生成这些版权提示。
诉讼还指控,OpenAI的中期训练数据集包含了来自《纽约时报》、《每日新闻》以及调查报道中心的超过91,000件作品。
争论远没有结束
关于使用受版权保护内容的争论仍在继续,针对OpenAI的这起案件也还没有了结。与此同时,特朗普政府最近站到了OpenAI这类AI公司一边。
美国政府的一份利益声明写道:"在误解合理使用原则的情况下限制大语言模型的发展,将阻碍这种创造性和科学进步,同时妨碍美国的繁荣与经济流动性。"
一边是微软高管在内部文件里称之为"人类历史上最大的劳动盗窃",一边是政府公开表态支持抓取以维持美国的AI优势。这场公开辩论预计还会持续数年,而受AI抓取影响的,远不止《纽约时报》一家——数百家其他出版机构,同样可能被卷入这场由未经请求的数据抓取所驱动的竞争。
热门跟贴