打开网易新闻 查看精彩图片

大家好,这里是冲浪普拉斯

早前因AI焚书计划遭受热议的Anthropic最近又被推至风口浪尖。

原因不外乎以下两件事:

第一,Anthropic要上市了,并计划在美国劳动节后公开IPO招股书。

第二,上市前夕,索尼和华纳联手把Anthropic给告了,以侵权的名义

打开网易新闻 查看精彩图片

01

被告栏里白纸黑字的写着两个人:CEO达里奥·阿莫迪(Dario Amodei)与联合创始人本杰明·曼(Benjamin Mann)。

原告称,Anthropic通过BitTorrent(种子下载)、网页抓取与第三方数据收集等渠道,未经授权就取得了“数以万计”的音乐作品。

索尼与华纳作为原告要求Anthropic为每部被侵权的音乐作品支付最高15万美元的法定赔偿,以及每次移除或篡改版权管理信息最高2.5万美元的赔偿。

值得一提的是本杰明·曼曾评价盗版网站为:sketchy AF,翻译一下,这玩意儿可疑的要命。

但结果一目了然,他仍然参与了相关下载。

诉状中明确表示,这一盗版下载指令由CEO达里奥·阿莫迪亲自下达、批准;本杰明·曼亲自执行了操作。

打开网易新闻 查看精彩图片

讽刺的是,Anthropic一直是以“安全优先”为自身代表的公司,其定义也是“AI安全与研究公司”,就连Claude也一直顶着大模型行业“安全派”的招牌。

而如今,两位创始人却坐在了盗版指控的被告席。

索尼与华纳更是将此次行为直接定性成Anthropic有史以来规模最大、最明目张胆的持续性知识产权盗窃行为之一。

而这早已不是Anthropic第一次将自己置身侵权的舆论漩涡之中。

02

2024年,多名小说家与纪实作者提起集体诉讼,称Anthropic为训练Claude系列大模型,系统性的从盗版书库中下载并保存了数万部受版权保护的图书,未经授权也并未支付任何费用。

打开网易新闻 查看精彩图片

这场盗版书训练案最终以超15亿美元的破纪录赔偿金额达成和解,和解基金预计覆盖约48万至50万部合格作品,基础标准为每部赔付3000美元。

附带条款为销毁盗版数据集,并认证其不用于任何商业部署模型。

2026年7月20日,也就是一个月前,法院批准了Anthropic与图书作者、出版商达成的15亿美元集体和解。

令许多人印象深刻的是,同年,Anthropic还启动了耗资数千万美元,并将其定为秘密行动的巴拿马计划,该计划于2026年1月被曝光。

Anthropic通过二手书商等渠道,批量采购22年前出版的纸质实体书,并用液压机切开书脊,高速的逐页扫描后将原书送入碎纸机销毁,用以获取高质量的人类文本训练ai大模型。

在Anthropic文件中曾提到:巴拿马计划,是我们对全世界所有书籍,进行破坏性扫描的行动,且不希望外界知道此事。

打开网易新闻 查看精彩图片

而在此次索尼和华纳出手之前,Anthropic在音乐版权方面也实在称不上清白,单是诉讼已经历四轮积累。

环球音乐出版集团(UMG)Concord MusicGroupABKCO,于2023年率先将其起诉,其中涉及约500首作品。

2026年1月,同一批原告扩大规模,涉及超2万首作品,发起第二轮诉讼,3月发起第三起诉讼,直至8月17日,Round Hill Music提起第四起诉讼,但结果均不理想。

直至两天前索尼与华纳联手共写一纸诉状,Anthropic终于集齐环球、索尼、华纳三大头部音乐公司的共同被告,彻底与音乐界不共戴天。

打开网易新闻 查看精彩图片

这也不仅令人感到奇怪,Claude经历多轮诉讼早已为歌词输出增加护栏,为何还会引起版权方众怒?大模型训练的合理使用解限究竟在哪?若网上的材料当真成为明码标价的训练资产,账单最后又会落在谁的头上?

想追溯这些问题,我们得先从Anthropic与Claude的诞生说起。

03

2021年年初,几名OpenAI前员工创办了Anthropic,而彼时的AI大模型竞赛也已总结出一条业内心照不宣的规律:想要让模型吐出好东西,前提是先把足够多足够好的文字喂进去。

随手拼凑的网页自然也能教会模型说话作答,但经过创作者精心打磨的书籍和歌词,往往会提供更加稳定的结构与信息。

这其实不难理解,就像你每天吃压缩饼干与私厨定制的对比,长此以往在身体上自然会有不同表现。

对于大模型来说,书籍当然算得上一口营养均衡的好饭,但是想要把别人的心血喂给模型,也得先跟厨子谈好价格。

打开网易新闻 查看精彩图片

书可以买,可以授权,问题也很明显,

合法取得书籍的流程包括但不限于:联系出版社,确认权利,沟通价格,签署合同。

一套流程走下来,进度慢了不止一点半点,几乎等同于自家的大模型才会开口说人话,对家的大模型都快能后空翻了。

版权合规并非做不到,只是会消耗时间和钱,当所有对手都在抢训练窗口,一条更快、更便宜的数据路径,诱惑实在太大。

Anthropic决定走一条捷径,但很不幸,而这条捷径的终点是法院。

打开网易新闻 查看精彩图片

根据Bartz案件的文件显示,Anthropic自成立初期便开始建立一个计划长期保留的资料库。

21年初,联合创始人本杰明·曼下载了包含196640本书的Books3,根据法院判定,这些内容全部由未经授权的版权作品副本汇集而成,并认定Mann知道其来源未经授权,两年后,Books3因版权投诉被托管方下架。

同年6月,Anthropic又从LibGen下载至少500万本书,而LibGen被称作“影子图书馆”,再翻译一下,你可以喊它,盗版资料库。

2022年7月,Anthropic再从PiLiMi下载至少200万本,而PiLiMi的全程就是Pirate Library Mirror,即,盗版图书馆镜像。

结果我们已然清楚,Anthropic花了15亿美元为捷径付出了代价,但互联网案底已经留下,这起案件也成为索尼与华纳控告创始人参与、批准公司决策的有力证据。

04

当然,被写进诉状也不等于个人责任成立。

索尼与华纳还要证明两人做过什么、知道什么,以及这些行为与具体作品侵权之间有什么联系。

但对所有AI创业者来说,一张张诉状所代表的信号已经明确。

训练数据不再只是技术团队的一张表格或一打资料,它正在变成董事会和创始人需要签字负责的资产。

反观Anthropic,似乎只是犯了全天下AI大模型都会犯的错而已,它还有一丝可辩解的机会,那就是“合理使用”。

来做个名词解释。

合理使用,即指在评论、研究、搜索、转换性创作等特定情形下,法律允许不经权利人许可使用受版权保护的作品。

大模型公司们一直主张,模型学习语言规律,并没有向用户出售原书,训练是一种高度转换性的使用,而这也并非没有依据。

Bartz案同样给了Anthropic一半好消息。

法官认定,在该案证据下,把特定图书复制进训练集用于训练大模型,属于合理使用,购买纸质书、拆书扫描成数字版本,只要纸书被销毁且数字版没有对外传播,也属于合理使用。

打开网易新闻 查看精彩图片

但坏消息在另外一半,法院认为,盗版资料库复制没有合理使用保护,Anthropic省下的钱和流程麻烦,也不是合法理由。

换言之,训练模型可能具有转换性,但不代表你可以先偷一份原料,你可以研究厨子怎么做的菜,但不能先偷走厨子的食材。

05

音乐出版商苦主们如今走的就是这条路。

它们没有只盯着Claude向用户吐出了几句歌词,而是把整个数据链条拆开成夺命数连问:

你的作品最初从哪里取得?作品们是否被永久保留?作品是否进入训练输入?训练过程中做过哪些复制?模型能否复现歌词?作品名称、作者等版权管理信息有没有在清洗中被删掉?

即便Claude早就拒绝提供整首歌词,但拦住Claude今天说什么,不等于拦住了Claude昨天吃了什么。

打开网易新闻 查看精彩图片

护栏不能解释训练材料是否经过许可、数据清洗是否删除权利信息、模型内部是否保留可复现内容,而事情的真相,我们心知肚明,它们都在护栏的上游。

因而我们也可以理解,版权方们的怒火并非局限于AI是否能吐歌词,而是在于AI公司能否证明所有数据的进货渠道。

但AI催生的生意不会停止,就在诉讼不断增加的同时,合法入口也作为一门生意正式开张了。

2025年年底,音乐科技公司KLAY宣布,分别与环球、索尼、华纳旗下的唱片和出版业务达成AI授权协议。

KLAY称,其大音乐模型完全使用获得许可的音乐训练,参与的艺术家和词曲作者会得到认可与回报。

而三大唱片公司也在强调,Klay不仅尊重艺人、词曲作者与权利持有者,更能提供一套完整的AI授权、使用与收益分配机制。

随后音乐数据平台Musicmatch也紧跟Klay步伐宣布与三大公司达成AI授权,可使用的目录超过1500万部音乐作品。

在AI大模型公司还在与官司缠斗时,授权市场的大门已经打开了。

06

看起来是合法合规挑不出毛病了,但与此同时,一笔账单也在慢慢形成。

打开网易新闻 查看精彩图片

首先是没有什么争议的授权费用:不论是书籍也好,歌词也好,甚至是图片、新闻,这些资料数据一旦有了可交易许可,曾经不被计入账面的数据也会慢慢显性

第二是数据治理费用:大模型厂商需要了解每一批数据的来源与途径,这样的训练需要耗时多久,更新多少版本,仍旧是一个未知数

第三是模型工程:曾经没有版权的争议数据判定不能使用,后果远不止按一下键盘上的Delete,公司需要定位这些数据曾经进入过哪些数据混合,影响过哪些版本,最终再决定到底是微调还是重训,这期间耗费的算力、时间成本远不可估计

第四是诉讼准备与客户担保:毕竟谁都不会愿意花钱买一个随时可能把官司转嫁给自己的模型,于是知识产权赔偿开始从合同附件变成产品卖点

而Anthropic当前商业条款就写得很直接,如果第三方指控客户对服务的付费、合规使用侵犯知识产权,Anthropic会为客户抗辩,并承担法院判决或获批和解产生的赔偿。

也就是说,如果企业使用了Claude,那么版权风险会由Anthropic替你承担一部分。

打开网易新闻 查看精彩图片

第五,也是准重要的一笔费用,市场准入:当授权市场大门开启,小模型说不清的数据账本和赔偿条款将很快被大企业弃用,大厂有钱买授权,也有资本承担赔偿后果。小模型公司既要追赶能力又要兼顾法律成本,能够存活的空间将大大降低,笑到最后的,恐怕只有最有钱买数据版权的少数公司而已

07

Anthropic此次风波只是一场版权官司,但对于众多企业采购者与使用者而言,也可以是一场关于AI生产成本分配的重新谈判

由此也可以预见,当AI模型大战进入下一阶段时,大模型仍然会将算力、速度、价格作为核心卖点,但区别是进入公司核心业务时,大模型们仍需比较,谁能够真正拿的出一套经得起法院与客户追问的进货单。

能力或许能够决定AI产品的上限,但只有落在纸面上的数据来源和白纸黑字的合同担保,才是决定它能不能在企业存活的最佳筹码。

你又会作何选择呢?

这里是冲浪普拉斯,感谢大家的订阅和点赞,我们下期见。

打开网易新闻 查看精彩图片

欢迎点击下方卡片, 关注我们