用版权书籍训练AI模型,到底合不合法?这个问题看似简单,答案却远比想象中复杂。

ChatGPT、Gemini、Claude等AI模型背后,是包含数亿本书籍、文章、学术论文的庞大训练数据库。绝大多数作者在不知情、未同意的情况下,成了这些AI工具的"训练素材"——而这些工具恰恰可能威胁到他们的生计。听起来像是明显的侵权,对吧?

打开网易新闻 查看精彩图片

现实并非如此简单。

1.5亿美元罚款,但训练本身合法?

去年,法官William Alsup裁定Anthropic向一群作家支付高达15亿美元的版权和解金——这些作家的作品被用于训练该公司的AI模型。表面上看,这似乎是作者们的道德胜利,但Alsup法官实际上裁定Anthropic的AI训练行为是合法的。他处罚Anthropic的原因,是该公司从非法在线影子图书馆盗版了这些书籍。

Alsup在判决中写道:"像任何渴望成为作家的读者一样,Anthropic的LLM(大语言模型)训练不是为了超越或取代这些作品——而是为了转过一个艰难的弯,创造不同的东西。"他将LLM吸收数万亿词汇的方式,比作作家对文学的研究。

知识产权与科技领域律师Cathy Gellis认为,这一裁决对AI公司更有利。对一家预计到2028年年收入约2000亿美元的公司来说,15亿美元罚款算什么?

"我认为这对AI训练来说总体是个好消息,因为他审视了发生的事情,真正将其类比为阅读受版权保护的作品,而不是复制受版权保护的作品,"Gellis说。"版权法围绕复制展开,但并不围绕使用、体验、消费或阅读作品展开。"

50年未更新的法律,如何应对AI新问题?

打开网易新闻 查看精彩图片

版权法1976年以来就没有更新过。这意味着法官们必须弄清楚如何用50年前的指导方针,来应对可能塑造AI行业未来的法律问题。

JWL International知识产权与媒体业务高级律师Jason Henderson表示:"现在每个人都非常担心,因为法律到处都是漏洞,就是因为这个问题。他们知道AI模型已经在大量数据上训练过,而法律还没有真正跟上这个问题。"

这些问题的核心往往在于合理使用原则——即对受版权保护作品的使用是否具有足够的"变革性",从而在法律上被允许。

合理使用是版权法的一个例外条款,允许在未经明确许可的情况下使用受版权保护的材料,保护评论和迭代创作的能力。但AI训练是否属于"变革性使用",目前法律界尚无统一答案。

法律现状:各方都在观望

目前的情况是,不同法院可能给出不同判决,法律环境充满不确定性。AI公司、作者群体、出版商都在密切关注每一个相关案件,试图从中找到对自己有利的先例。

对作者来说,他们的作品被无偿用于训练可能取代他们的工具,这种愤怒完全可以理解。但对AI公司而言,训练数据的需求是刚性的,他们更希望法律能确认训练行为的合法性。

这场博弈的最终结果,将深刻影响AI行业的发展方向和内容创作者的权益保护。而在这之前,法律的不确定性本身,就是最大的确定性。