人工智能公司正在购买成千上万的古董和绝版书籍,将其内容输入训练数据集,然后销毁实体书——研究人员和书商称,这种工业规模的做法正在抹杀文化遗产,尽管它为下一代语言模型提供了动力。这些披露最初出现在法庭文件中,现在在欧洲图书销售界引起共鸣,为人工智能版权战开辟了新战线。对于重塑行业的训练数据争议的 突发人工智能新闻,下面的详细信息追踪了对干净文本的搜寻如何变成了珍本书籍的篝火。

实践如何运作

根据 Anthropic 在 2026 年法庭诉讼中披露并《华盛顿邮报》报道的文件,该过程是故意工业化的。该文件描述了扫描承包商的“液压动力切割机”如何“整齐地切割”书籍,以便可以“在高速、高质量、生产级扫描仪上扫描”页面。文件指出,一旦数字化,扫描公司将“与回收公司安排收集完成的书籍”。

换句话说,书不会被归还。它们被简化为数字文本,然后被打浆。

为什么公司想要旧的印刷书籍

对实体书的兴趣源于人工智能开发人员面临的一个日益恶化的问题:开放的互联网越来越受到人工智能生成的文本的污染。正如法律博客 Verfassungsblog 在题为“人工智能正在吞噬图书世界”的分析中所解释的那样,合成内容的训练可能会降低模型质量——研究人员将这种现象称为模型崩溃。相比之下,2022 年之前印刷的书籍肯定是人类编写的。

还有一个合法的计算。公司认为,扫描他们拥有的实体书可能符合美国版权法的“合理使用”条款,他们认为这种辩护比抓取受版权保护的网络内容更有力。法院是否接受这一论点仍然是一个悬而未决的问题,但这并没有阻止购买狂潮。

Zoom 图书现象

在欧洲,人们的注意力集中在一家名为 Zoom Books 的加拿大在线书店上,Verfassungsblog 报道称,该书店已经收购了数十万本非小说类图书,但商业需求所剩无几。这些书籍——晦涩难懂的学术著作、地区历史和专业技术手册——对二手书卖家来说几乎毫无价值,但却代表了人工智能实验室以前未开发的丰富培训材料。

未来主义报告称,破坏正在“以令人难以置信的规模发生,即使几乎没有副本留下来”,这意味着对于某些图书来说,扫描和粉碎的副本可能是最后幸存的流通版本之一。

书商和研究人员的反击

这些报道引起了古董书商的警惕,他们表示,大量买家正在扭曲二手市场,并以比档案保存它们的速度更快的速度删除稀有版本。阿纳多卢通讯社援引一位土耳其古籍书商的话说,他对索赔的范围表示怀疑,同时承认欧洲图书市场的担忧日益加剧。 《印度时报》和《Boing Boing》的报道将这一趋势描述为人工智能公司试图通过退回到前互联网印刷来“摆脱自己的人工智能困境”的直接结果。

保护主义者认为,这种破坏尤其令人不安,因为没有中央登记处跟踪哪些书籍已被扫描和销毁。一旦低生存率的作品被粉碎,损失可能是永久性的——除非扫描它的公司选择共享数字副本,但通常不会。

##版权战新阶段

此次购书活动处于两个悬而未决的法律纠纷的交叉点:未经许可在受版权保护的作品上训练人工智能模型是否构成合理使用,以及扫描后销毁物理来源是否会改变计算结果。迄今为止,法院发出了复杂的信号,一些裁决有利于人工智能开发者,而另一些裁决则保留了创作者的主张。

对于人工智能公司来说,计算很简单。印刷书籍提供密集、高质量、人工撰写的文本,而这些文本在网上越来越难找到。对于图书馆、档案馆和保护稀有版本的收藏家来说,这种权衡远没有那么有利:不可替代的实物文物被简化为训练代币,然后回收成纸浆。

这种做法还引发了有关透明度的问题。 Anthropic之所以披露这一信息,只是因为它在诉讼中被迫。目前尚不清楚有多少其他公司正在采取类似的策略,有多少图书已经被销毁,或者是否会出现任何行业范围的标准来在有风险的图书被扫描和丢弃之前对其进行保护。

无人能量化的规模问题

这种趋势难以监管的部分原因在于它的扩散性。与单个大型档案馆或数据库不同,图书购买活动分布在数千笔单独交易中——在房地产销售、图书馆出售销售和在线市场上——其中大量买家购买一堆非小说类书籍不会引起明显的危险信号。然而,将数十万次购买汇总起来,累积效应就是从物理记录中悄悄删除大量小众、低流通量的知识。

图书馆员和档案管理员警告说,损失分布并不均匀。大众市场的畅销书存在无数册,但对人工智能培训师最有吸引力的书籍——专门的、信息密集的、印数很少的作品——恰恰是最不可能在其他地方保存下来的书籍。一旦被销毁,它们可能仅作为锁定在公司服务器内的专有训练数据而存在,最初生产和依赖它们的公众无法访问。

保持人工智能领先地位

培训数据之战正在愈演愈烈,其利害关系远远超出了企业的资产负债表范围。要阅读更多 AI 新闻 并关注法院、监管机构和保护主义者的反应,请继续关注 AI Buzz Wire。

阅读更多人工智能新闻 →