新闻集团针对注重隐私的搜索引擎 Brave 提起反诉,升级了针对未经授权使用其新闻报道的法律战,指控该公司抄袭受版权保护的文章来喂养人工智能模型,这被该媒体集团称为“公然盗窃”。

路透社周三报道称,反诉讼是因两家公司之间持续存在的法律纠纷而提起的。新闻集团声称,Brave 在未经许可或无补偿的情况下,系统地从其出版物中收集文章,其中包括《华尔街日报》、《纽约邮报》、伦敦《泰晤士报》和其他主要新闻媒体。 更多相关背景,请参阅我们的AI新闻

针对 Brave 的指控

根据文件,Brave 抓取了新闻集团的文章并将其提供给第三方用于人工智能培训目的。该媒体公司辩称,这构成了直接版权侵权,因为内容在未经权利人授权的情况下被复制、存储和重新分发。

新闻集团使用“公然盗窃”一词突显了其对涉嫌行为的严肃态度。该公司将自己定位为人工智能时代最积极的出版商权利捍卫者之一,已就多家科技公司使用其内容提起法律诉讼。

Brave 由 JavaScript 创始人 Brendan Eich 创立,将自己定位为隐私优先的 Google 搜索替代品。该公司运营一个使用自己的爬虫构建的搜索索引,该索引此前曾受到出版商的审查,他们认为其内容在未经同意的情况下被编入索引并改变用途。

更广泛的版权战场

Brave 的反诉讼是传统出版商与人工智能公司之间大规模法律冲突的最新一起。过去两年,众多媒体机构提起诉讼,指控其内容在未经许可的情况下被抄袭,用于训练大型语言模型和其他人工智能系统。

《纽约时报》于 2023 年底起诉 OpenAI 和微软,该案仍在诉讼中。数百家当地报纸联合对同一家公司提起版权诉讼。作者协会和个人作者就人工智能公司在训练数据中使用书籍的问题分别提起了法律诉讼。

新闻集团一直处于这场斗争的最前沿。据报道,该公司此前与 OpenAI 达成了价值数千万美元的许可协议,展示了其寻求诉讼和商业交易并举的策略。 Brave 的反诉表明,新闻集团目前正在将其执法力度扩大到最大的人工智能公司之外,以包括促进数据收集的中介机构。

中介问题

针对 Brave 的案件提出了法院尚未完全解决的一个重要法律问题:抓取网络的搜索引擎和数据聚合商收集的内容随后用于人工智能训练时是否需要承担责任。

像谷歌这样的搜索引擎长期以来一直在为搜索结果索引网页构成合理使用的原则下运行。然而,随着生成式人工智能的兴起,情况发生了巨大变化。当搜索引擎的索引被重新用于训练可以生成竞争内容的模型时,合理使用防御就变得不那么清晰了。

Brave 的搜索索引是使用其专有的爬虫程序构建的,在这场争论中占据了灰色地带。该公司辩称其抓取行为是搜索引擎的标准。新闻集团认为,将抓取的内容重新用于人工智能训练远远超出了搜索功能所需的范围。

对网页抓取生态系统的影响

如果新闻集团胜诉,此案可能会对支撑人工智能行业的网络抓取生态系统产生深远影响。许多人工智能公司依靠数据代理、搜索索引和自动爬虫来收集训练模型所需的大量文本。要求这些中介机构承担责任的裁决可能会扰乱整个行业的供应链。

相反,对 Brave 有利的裁决将加强搜索引擎和数据聚合商的地位,使出版商更难控制其内容出现在开放网络上后的使用方式。

法律专家指出,结果可能取决于有关 Brave 爬虫如何运行、收集哪些数据以及如何向人工智能开发人员提供这些数据的具体技术细节。搜索结果索引和模型训练数据收集之间的区别可能是决定性的。

新闻业的利害关系

对于新闻集团和其他出版商来说,这个案例涉及的不仅仅是一个搜索引擎。该公司辩称,不受控制的新闻报道威胁到新闻机构的经济基础。如果人工智能系统可以使用从新闻媒体抓取的材料来生成内容而无需补偿,那么出版商就会失去读者和维持其运营的广告收入。

特朗普政府在这个问题上发出了混合信号。虽然一些官员对出版商的担忧表示同情,但其他官员则推动制定优先考虑人工智能开发而不是版权执法的政策。像新闻集团诉勇敢这样的案件的解决可能最终取决于法院如何在这些法律制定时不存在的行业背景下解释现有的版权法。

目前,反诉讼发出了一个明确的信息:新闻集团打算寻求一切可用的途径来保护其内容,从最大的人工智能实验室到为其提供数据的搜索引擎。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →