据《卫报》周六报道的内部文件称,牛津大学允许 OpenAI 根据其博德利图书馆的历史文本来训练其人工智能模型,并使用数字化材料来“填充 OpenAI 训练集”——这一目的在公开宣布合作伙伴关系时从未提及。
牛津大学于 2025 年 3 月以数字化项目的形式公布了这一合作,称使用 OpenAI 软件扫描世界上最著名的图书馆之一的文本将使学生和研究人员更广泛地获取这些内容。公告中没有提到的是,这些材料将用于 OpenAI 商业模型的训练。 《卫报》审查的内部文件明确表明了这一目的,这是迄今为止著名文化机构悄悄提供[人工智能行业原材料]的最明显例子之一(https://aibuzzwire.news)。
具有未明确目的的合作伙伴关系
这项安排的细节是通过信息自由请求公布的,该请求显示了大学会议记录,其中记录了包括博德利安学院治理委员会成员在内的工作人员对与 ChatGPT 背后的公司合作的声誉风险的担忧。工作人员还提出了与一家能源密集型科技公司的交易将对大学的环境承诺产生的影响。
OpenAI 的一位发言人为该计划进行了辩护,称该公司“自豪”地确保“今天的人工智能模型能够为未来保存世界的历史知识”。该发言人补充道:“超过十亿人在日常生活中使用这项技术,它反映不同的文化、历史和观点非常重要。”
从都铎民谣到博士论文
数字化的规模是巨大的。截至 2025 年 6 月,Bodleian 收藏中的 125,000 张历史论文扫描图像已与 OpenAI 共享,其中包括欧洲和美国大学写于 19 世纪和 20 世纪的博士论文。扫描的其他材料包括罕见的 10,000 首 16 世纪“民谣”——曾经在都铎街角流传的歌词和音符。
这些都不是传统意义上的秘密。博德利安图书馆的大部分历史馆藏都是公共领域的作品,版权法对旧文本的训练模型几乎没有限制。但为学者提供数字化图书馆和填充商业培训集之间的区别是机构历来期望大声声明的区别。牛津大学没有——这一遗漏与其说是关于法律权利,不如说是关于大学与其社区之间的透明度。
图书馆作为新的数据前沿
图书馆书架的抢购有一个简单的经济驱动因素:开放网络的有用数据即将耗尽。随着被抓取的网站充斥着人工智能生成的材料,对这些内容的培训变得循环和退化,开发人员已经转向物理的、通常是历史的书籍收藏作为新鲜的、人工编写的文本的来源。
这些症状在大街上随处可见。据《卫报》报道,二手书商收到了大量晦涩难懂的订单——18 世纪非洲农具指南、20 世纪 50 年代汽车司机的传记——正是因为此类书籍不太可能以数字化形式存在于网上。书商推测这些购买代表了下一代人工智能模型的新数据。
OpenAI 在学术界和文化机构中都遵循同样的策略。该公司已与波士顿公共图书馆、加州理工学院、麻省理工学院和密歇根大学在一个名为 NextGenAI 的项目下达成协议,牛津大学是该项目唯一的英国成员。博德利图书馆是欧洲最古老的图书馆之一,拥有数千年的藏书,在一定程度上是最有传奇色彩的图书馆。
这对文化机构意味着什么
牛津事件可能会加剧全世界博物馆、档案馆和图书馆已经存在的争论:当一家科技公司免费提供藏品数字化服务时,实际上正在交换什么?数字化带来真正的公共利益——访问、保存、可搜索性。但牛津大学的文件表明,价值是双向流动的,训练集的使用对 OpenAI 来说很重要,即使它的重要性不足以宣布。
对于预算紧张的机构来说,这种诱惑是可以理解的:专业数字化成本高昂,而像 OpenAI 这样的公司却提供免费服务。担心声誉风险的博德利安管理委员会成员似乎直觉地意识到了信息自由文件后来证实的事实——该大学的品牌正在为数据获取工作提供合法性,无论这是否是其意图。
现在的问题是,其他机构是否会在其人工智能合作伙伴关系中坚持透明度条款:明确披露培训用途、选择退出敏感材料以及公开报告共享内容和原因。在此之前,世界上伟大的馆藏将继续成为训练数据——一次一个安静的数字化项目。
---
保持人工智能领先地位人工智能训练数据之争正在重塑科技以外的行业。获取最新的人工智能新闻、分析和突破——尽在一个地方。
阅读更多人工智能新闻 →