《纽约时报》针对 OpenAI 和微软的版权诉讼中未经编辑的新材料揭示了一系列引人注目的内部承认,其中包括一位微软高管私下将公司的人工智能培训实践描述为盗窃,而 OpenAI 自己的领导层也承认其聊天机器人对对其进行培训的出版商构成了“生存威胁”。

TechCrunch 周四报道称,这份文件是在《纽约时报》首次提起诉讼三年后提交的,指控这些公司根据其内容训练生成人工智能模型,违反了版权法。新公开的材料详细介绍了这些公司据称如何获取和使用该内容:绕过未被发现的付费墙,通过大规模抓取构建训练数据集,以及故意从训练数据中删除版权声明。 更多相关背景,请参阅我们的人工智能资讯

值得注意的是,TechCrunch 本身也提出了警告:许多新信息来自《纽约时报》自己的简报,而不是底层的证据,这些证据仍然是密封的,而且引用的内容也没有原始上下文。

出版商的“末日循环”

最重要的爆料之一是微软自己的数据,该数据涉及其副驾驶“答案引擎”对《纽约时报》网站流量的影响。根据该文件,微软的内部数据显示,与传统的 Bing 搜索相比,Copilot 导致 nytimes.com 域的点击率下降了 93%。

微软应用科学总监 Brent Hecht 在 2024 年 1 月撰写的一份内部演示文稿中将这种下降描述为“厄运循环”,将“同时损害我们模型和整个网络的性能”。

文件中引用的微软文件中写道:“最终产品威胁其主要供应商的经济基础是非常不寻常的,但这就是我们为法学硕士业务在‘内容供应链’方面创造的情况。”

这一承认直接削弱了人工智能公司所依赖的合理使用辩护的一个支柱:即该使用不会取代原始作品或损害其市场。

高管自己的话被记录下来

未经编辑的文件还记录了公司最高层人士的坦诚评估。

微软首席执行官萨蒂亚·纳德拉 (Satya Nadella) 在今年早些时候的一份证词中表示,“任何付费的东西都应该由任何想要使用它的人获得许可……用于基础或培训。”纳德拉明确表示,如果他“知道 OpenAI 已经收集并训练了付费墙背后的信息”,他就会“援引[微软的权利]要求 OpenAI 重新训练其模型。”

纳德拉还宣誓同意,与聊天机器人对话“已经取代了......在人工智能平台的网站上为您提供信息,而不是需要访问底层源。”

在 OpenAI 方面,该公司 ChatGPT 负责人尼克·特利 (Nick Turley) 在内部通讯中写道,出版商面临着来自聊天机器人等产品的“生存威胁”,这些产品“在很大程度上是替代性的”,并且“随着它们变得更好,替代性将越来越大”。 OpenAI 总裁格雷格·布罗克曼 (Greg Brockman) 形容这些模型“在新闻方面表现出色”。

在 2023 年 1 月的一份内部备忘录中,赫克特(后来标记了“末日循环”的微软高管)称这次抓取是“规模空前的惊人盗窃行为”和“人类历史上最大的劳动力盗窃行为”。

复制的规模之大

这些文件以先前未披露的规模量化了复制行为。文件称,仅 OpenAI 的中期训练数据集就包含《纽约时报》、《纽约每日新闻》和调查报道中心发表的超过 91,692 份作品。

来自 Common Crawl(免费开放的网络爬行数据存储库)的数据集仅包含来自 nytimes.com 的超过 200 万份文档。该文件还描述了 Project Mango,这是一项 Microsoft-OpenAI 数据计划,其组装的训练数据集包含来自新闻出版商的至少 160,903 份独特作品的副本。文件称,OpenAI 将其整个 GPT-3 训练数据集交付给微软进行评估,微软同样通过 Project Taxi 和 Project Mango 计划向 OpenAI 提供了训练数据。

据称,OpenAI 员工还构建了 WebText 和 WebText2 等早期训练数据集,这些数据集过度依赖于抓取的新闻内容。

付费墙黑客攻击和剥夺版权声明

也许最生动的细节涉及内容是如何获得的。文件称,当 OpenAI 研究员尼克·莱德 (Nick Ryder) 向布罗克曼讲述“绕过纽约时报付费墙的黑客行为”时,布罗克曼回答说:“啊,太好了。”

这些文件进一步描述了在训练数据到达模型之前刻意去除版权声明的努力,因为研究人员“不希望”模型向用户输出“版权声明”。

《纽约每日新闻》的法律顾问史蒂文·利伯曼 (Steven Lieberman) 在与 TechCrunch 分享的一份声明中表示:“这里首次披露的证据表明 OpenAI 和微软知道他们所做的事情是错误的。”

这对于合理使用斗争意味着什么

人工智能公司是否可以在没有许可证的情况下合法地使用受版权保护的材料进行培训的问题仍然悬而未决,但到目前为止,法官基本上支持人工智能公司的合理使用论点。本月早些时候,特朗普政府提交了一份简报,为 OpenAI 未经许可使用受版权保护的材料来训练其大型语言模型进行辩护。

然而,一些新的承认与合理使用测试的市场损害要求背道而驰,即使用不得替代或削弱原始作品的市场。这些产品“很大程度上具有替代性”的内部声明,加上微软自己的数据显示,点击率下降了 93%,这为《纽约时报》方面提供了迄今为止最具体的市场替代证据。

该诉讼是该案件的最新升级,该案件已成为人工智能公司如何获取训练数据的决定性法律斗争。无论结果如何,现在未经编辑的记录表明,公司自己的高管很早就了解了这种紧张局势,并将其书面记录下来。

如需继续报道塑造人工智能的法律斗争,请关注我们最新的人工智能新闻以及对定义该行业的案例的深入分析。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →