微软在一份新的法庭文件中抛出了一个相当具体的数字:在超过820万条Copilot聊天记录中,只有不到1%的对话出现了至少16个词与新闻文章重合。这家公司正在用这个数据回应《纽约时报》和多位图书作者的版权指控。
这份文件是微软与OpenAI共同面临的版权诉讼的一部分。原告方认为,微软和OpenAI在未经授权的情况下,使用受版权保护的作品来训练AI模型,并且这些AI产品现在直接与原作者竞争。而微软的辩护策略,是把焦点放在“实际输出”上——它想证明,Copilot并没有大规模地“复述”原文。
数据到底说了什么
作为案件调查的一部分,微软向新闻出版商聘请的专家提供了820万条Copilot聊天日志。微软强调,这些日志是特意筛选出来的,因为它们“命中了与新闻原告网站相关的关键词”,按理说应该是最有可能包含受版权保护内容的那一批。
分析结果是这样的:
- 在这820万条记录中,有59,545条包含至少16个词与新闻内容重合,占比不到1%。
- 调查报道中心(CIR)的专家发现,整个数据集中只有51处与CIR的作品存在“实质性重叠”。
- 在图书作者的诉讼中,专家发现820万条对话里只有24条回复包含至少30个匹配词。
- 在受评估的212本书中,只有10本出现了任何匹配内容。
微软认为,这些数字有力地支持了它的立场:将受版权保护的内容用于AI训练数据集,应当被视为“合理使用”。虽然像Copilot这样的系统确实依赖受版权保护的材料,但微软辩称,由此产生的系统与原始作品的用途有本质不同。它总结道,偶尔复现部分文本,“很难削弱大语言模型训练的变革性目的”。
双方的分歧点
原告方的逻辑很直接:你用我的内容训练模型,模型又能吐出我的内容,这既侵犯了复制权,又构成了市场竞争。他们尤其担心的是,如果用户不再去原网站阅读,而是直接通过AI获取答案,那么原创内容的商业价值就会被稀释。
微软的回应则试图把问题从“训练阶段”拉到“输出阶段”。它似乎在说:你看,真正能复现原文的情况少之又少,绝大多数对话都是正常的问答交互,这怎么能算侵权呢?
这个论证路径其实并不新鲜。在AI版权诉讼中,被告方通常会强调“转换性使用”——即AI对作品的使用方式与原始创作目的完全不同,因此不应被视为侵权。微软这次只是用更精确的数据来支撑这个论点。
我的判断
从技术角度看,微软的数据确实说明了一个事实:Copilot并不是一个“复读机”。在绝大多数情况下,它生成的是经过整合、改写的内容,而不是直接复制粘贴。这一点与早期一些AI产品的行为有本质区别。
但问题在于,版权法关注的从来不只是“量”。哪怕只有1%的对话涉及内容重合,如果这些重合的部分恰好是文章的核心段落或关键信息,原告依然可以主张实质性损害。更何况,820万条记录中的1%也是8万多次潜在侵权,这个绝对数字并不小。
另外值得注意的是,微软选择的数据集本身就有倾向性——它筛选的是“最可能包含原告作品”的对话。如果连这批数据都只有不到1%的重合率,那确实能说明Copilot的整体输出行为是克制的。但原告方可能会质疑:这个筛选标准是否合理?有没有可能漏掉了其他更严重的侵权案例?
这场官司的走向
微软在上周五提交了这份文件,目的是推动法官做出简易判决,即不经全面审判就结束案件。如果法官采纳微软的论点,那将对整个AI行业的版权诉讼产生深远影响——它可能意味着,只要AI系统不是大规模地复述原文,训练阶段使用受版权保护的内容就可以被容忍。
反之,如果法官驳回微软的请求,案件将进入全面审理阶段,届时双方将围绕“合理使用”的四个法定因素展开更细致的辩论。那将是一个更漫长、更复杂的过程。
目前,《纽约时报》、CIR和作者协会均未立即回应置评请求。案件的下一步走向,取决于法官如何看待这组数据的分量。
热门跟贴