在针对人工智能行业对训练数据永不满足的需求进行的一项更具创造性的调查中,404 Media 的记者在一批他们怀疑将购买用于人工智能训练的珍本书籍中放置了一个跟踪设备,并跟踪这批书籍穿越全国到达拉斯维加斯的一家亚马逊工厂,据媒体报道,书籍被扫描并销毁。

404 Media 创始编辑 Emanuel Maiberg 周一发表的这篇报道指出,目的地是亚马逊位于拉斯维加斯的 VGT3 设施。根据调查,亚马逊一直在购买大量书籍,扫描它们以获取人工智能训练数据,并在此过程中销毁实体书本——该媒体称此前从未报道过这一操作。

这些发现为几个月来悄然困扰书商和档案管理员的做法增添了一个重要的新名称,随着公众的注意力越来越多地转向人工智能公司实际获取数据的地方,这些发现也随之而来。请关注我们在 AI Buzz Wire 上对训练数据之战的持续报道。

一盒书里的追踪装置

调查背后的方法论使其引人注目。 404 Media 没有依赖文件或采访,而是在一批善本书籍中嵌入了 GPS 跟踪器,该商店怀疑这些书籍将被人工智能公司收购,然后监控包裹到达最终目的地的旅程。

该目的地——亚马逊的 VGT3 设施——在报告中被描述为亚马逊扫描书籍以获取人工智能训练数据的站点。完整的调查详细介绍了购买操作及其规模,可供 404 Media 订阅者查看。

这个故事周一登上《黑客新闻》头版后迅速在开发者和技术政策圈传播,评论者讨论了销毁善本书籍以训练商业人工智能系统的文化和法律影响。

亚马逊加入了不断增长的名单

该报告是有关人工智能时代实体书命运的更广泛争议的最新篇章。今年夏天早些时候,书商和研究人员记录了人工智能公司如何购买数十万册古董和绝版书籍,将它们输入训练数据集,并销毁实体副本——批评者将这种做法描述为工业规模的文化遗产擦除。

新报告的独特之处在于它命名了特定设施、特定公司和特定供应链。到目前为止,大部分讨论都依赖于书商和法庭文件的总体索赔。跟踪的货物提供了具体的数据点:一箱善本、买家和建筑物。

为什么训练数据需求不断升级

这种做法背后的经济学原理很简单。据广泛报道,前沿人工智能模型已经消耗了开放网络上现有的大部分高质量文本,迫使公司寻找难以访问的来源:书籍、档案和授权语料库。稀有和绝版书籍之所以有吸引力,正是因为它们不太可能出现在标准的网络抓取数据集中。

对于批评者来说,为了满足这种需求而销毁实体书已经成为该行业与人类文化的榨取关系的象征——数据作为一种可以开采的资源,无论在这个过程中损失了什么。对于相关公司而言,数字化图书代表了法院和立法者仍在整理的法律灰色地带,特别是在针对培训数据的版权诉讼在多个司法管辖区进行的情况下。

扫描和数字化本身都不需要销毁——出版商和档案管理员指出,销毁似乎是一种节省成本的措施,因为存储物理卷比捕获内容后将其打浆更昂贵。

保存问题

档案管理员长期以来一直认为数字化不是保存。扫描捕捉到了一本书的文本,但不是它的旁注、它的装订历史、它的材料品质——这些特征使一本稀有的书成为历史文物,而不是文字的容器。扫描后销毁实体副本将关闭未来检查的大门,并且与数字文件不同,随着成像技术的进步,纸浆书籍无法重新扫描。

图书贸易的经济性加剧了损失。稀有和绝版的书籍数量很少。当拥有人工智能规模预算的买家进入市场时,他们可以以高于图书馆和收藏家的价格购买剩余的副本——而当这些副本在扫描后被销毁时,给定版本的幸存数量可能会在几个月内永久减少。

欧洲的书商协会一直是对这种做法最直言不讳的批评者之一,404 Media 的调查让他们的警告有了具体的足迹:设施、供应链和指定的企业买家。

接下来会发生什么

此次调查可能会加强对亚马逊在人工智能数据供应链中所扮演角色的审查,而这一地位原本由其云业务主导。它还可能在欧洲和美国再次呼吁制定规则,要求保存人工智能培训中使用的文化材料,随着图书购买规模变得更加清晰,书商协会和一些政策制定者已经提出了这一想法。

目前,调查最具体的结果是信息性的:一个指定的设施、一个有记录的旅程以及一个表明图书行业的警告并不抽象的公共记录。被追踪货物中的珍本书籍在拉斯维加斯结束了旅程。它们的内容大概存在于训练语料库中。

关注人工智能数据大战

大规模的训练数据、版权之争和人工智能伦理——AI Buzz Wire 每日报道。

阅读更多人工智能新闻 →