全球前沿AI模型开发商因毁书训练模型而饱受批评,如今,连最初的数字书商亚马逊也被曝加入这一行列。
据404 Media报道,通过在一批图书中放置追踪装置,他们证实亚马逊正在批量购买图书,并在拉斯维加斯的一个仓库中进行扫描——过程中切掉书脊,书籍被毁。二手书销量据报正在激增,一些书商担忧这或许与AI公司的大宗采购有关——它们买书是为了切割并扫描这些大部头。
打开网易新闻 查看精彩图片
亚马逊的回应与“Project Panama”
亚马逊在声明中表示,购书是为了“帮助开发和改进客户使用的产品和服务”。
这并非孤例。Anthropic此前也发起过类似项目,名为“Project Panama”。内部文件显示,该项目旨在“破坏性地扫描世界上所有的书”,以训练其AI模型。规模有多大?一家供应商的项目提案要求在六个月内采购50万到200万本书——这一数量足以覆盖蒙特利尔大图书馆的全部实体馆藏,后者藏书约120万册。
不过,并非所有人都认为这种毁书行为是悲剧。一位书商对BBC表示,世界“不再需要五百万本《达芬奇密码》”。
AI公司为何盯上实体书?
大型AI公司正在耗尽可用于训练大语言模型的有用文本数据,这使得此前无法在线获取的实体书成为抢手资源。这只是AI开发者对高质量训练数据——即非AI自身生成的数据——的无限需求,在科技界之外引发意外后果的一个例子。
就在本周,谷歌与Mercor围绕精神航空(Spirit Airlines)的旧数据展开争夺,其中包括数亿封内部电子邮件、微软Teams聊天记录和员工生产力数据——最终谷歌胜出。
热门跟贴