打开网易新闻 查看精彩图片

你或许已经知道,驱动ChatGPT、Gemini、Claude等聊天机器人的AI模型,是在海量数据库上训练而成的——这些数据库收录了数亿本书籍、网络文章、学术论文,以及几乎所有能在互联网上找到的内容。绝大多数已出版的作者,在毫不知情、未经同意的情况下,为那些可能威胁到他们生计的AI工具贡献了素材。这看起来违法,对吗?

现实并没有那么简单。

"我认为,这一法律领域和技术领域面临的问题之一,就是涉及的因素太多了,"专注于知识产权、版权和技术领域的律师凯西·盖利斯在接受TechCrunch采访时表示,"整件事极为复杂,各方对于正在发生的事情都有强烈的情绪反应,无论是支持还是反对。"

去年,在同类案件中的首批裁决之一中,法官威廉·阿尔萨普裁定Anthropic向一批作家支付高达15亿美元的版权和解金,这些作家的作品曾被用于训练该公司的AI模型。表面上看,这似乎是有利于作者的道义胜利,但阿尔萨普法官实际上裁定Anthropic的AI训练行为本身是合法的。他对Anthropic的处罚,是因为该公司从非法的网络影子图书馆盗取了这些书籍。

"就像任何有志成为作家的读者一样,Anthropic的大语言模型训练这些作品,并非为了抢先复制或取代它们——而是为了转个弯,创造出不同的东西,"法官写道,将大语言模型摄取数万亿词汇的方式,比作作家研读文学作品的过程。

盖利斯认为,这一裁决对AI公司更为有利。对于一家预计到2028年年收入将达约2000亿美元的公司而言,15亿美元的罚款算得了什么?

"我认为,就AI训练而言,这总体上是个好消息——法官审视了整件事,并将其类比为阅读受版权保护的作品,而非复制受版权保护的作品,"盖利斯说,"版权法的核心在于复制,而不在于使用、体验、消费或阅读作品。"

版权法自1976年以来从未更新,这意味着法官在面对可能塑造AI产业未来的法律问题时,必须设法解读50年前制定的准则。

"现在所有人都非常担忧,因为法律层面乱成一锅粥,而这正是问题所在,"JWL International知识产权与媒体业务高级律师兼创始人杰森·亨德森在接受TechCrunch采访时表示,"大家都知道AI模型是在海量内容上训练出来的,但法律在这个问题上还远未跟上。"

这些问题往往取决于合理使用原则——即对受版权保护作品的使用是否具有足够的"转化性",从而在法律上被允许。

合理使用是版权法中的一项例外条款,允许在未经明确授权的情况下使用受版权保护的材料,保护通过批评、戏仿、教育等方式对版权作品进行评论和演绎的权利。法官在判断某一行为是否构成合理使用时,会考量特定因素,包括作品的目的与性质、使用的数量,以及对市场的影响。

"版权始终关乎保护和拓展市场,"亨德森指出,"法院在AI案件的推理上可谓各行其是。目前占上风的逻辑是:如果你训练他人的作品,是为了直接与其竞争,法院就会对此持否定态度……如果你的行为不会构成竞争,法院则倾向于认定其合法。"

亨德森所指的,是媒体与科技公司汤森路透起诉研究公司Ross Intelligence的案件——后者复制了前者的内容,用于构建一个与之竞争的AI法律平台。

"Ross的使用不具有转化性,因为它与汤森路透的使用不存在'进一步的目的或不同的特征',"法官斯蒂法诺斯·比巴斯去年写道。

在该案中,比巴斯法官认定,以训练数据来构建一个直接与路透竞争的新平台,不构成合理使用。尽管作者们或许可以主张,聊天机器人利用他们的作品生成新的合成书籍,实际上是在与他们竞争,但这一论点在法庭上尚未获得支持。

在AI与版权的关系问题上,盖利斯认为,厘清我们究竟在讨论什么至关重要——我们在AI训练语境下对版权的理解,与我们对AI生成内容版权的理解,是截然不同的两件事。

在Thaler诉Perlmutter一案中,法院裁定,如果一部作品100%由AI生成,则不受版权保护。这又打开了一个新的潘多拉魔盒——我们如何确切证明一部作品是否由AI生成?如果是,我们又如何判断其中有多少比例是由AI创作或辅助完成的?

"如果你用微软Word写小说,并使用了拼写检查,我们大概都能接受这样一个观点:Word并不拥有你的小说,"盖利斯说,"AI正在迫使我们重新审视一大堆我们搁置已久的问题。"

目前,大多数AI公司仍深陷这些问题的未决诉讼之中,这意味着我们在短期内不会看到明确的解决方案。

"你所看到的是,最初的几轮裁决正在产生影响,而这种影响本身也可能被推翻——如果其他法院作出不同的裁定,就需要等到后续诉讼阶段才能分出胜负,"盖利斯说,"但与此同时,所有这些裁决都在塑造着当下发生的一切。AI公司若对此视而不见,未免太过短视。"

Q&A

Q1:Anthropic的15亿美元版权和解案,法院最终认定AI训练行为合法吗?

A:是的。法官威廉·阿尔萨普裁定Anthropic的AI训练行为本身合法,将大语言模型学习文本的过程类比为作家研读文学作品。该公司被罚款的原因,是从非法的网络影子图书馆盗取书籍,而非训练行为本身违法。

Q2:版权法中的"合理使用"原则在AI训练案件里是怎么判断的?

A:法院主要看AI训练是否具有"转化性",以及是否会直接与原作者竞争。在汤森路透诉Ross Intelligence案中,法院认定用路透内容训练一个直接竞争的法律平台不构成合理使用;但如果训练目的不是直接竞争,法院则倾向于认定合法。目前各法院的裁量标准尚不统一。

Q3:100%由AI生成的内容可以申请版权保护吗?

A:目前不可以。在Thaler诉Perlmutter案中,法院裁定完全由AI生成的作品不受版权保护。但这也引发了新的难题:如何界定一部作品中AI参与的比例,以及如何证明某内容是否由AI生成,目前法律上都还没有明确答案。