麻省理工学院计算机科学家周二在《自然通讯》上发表的一项新研究得出了一项可能重塑人工智能版权争论的发现:随着扩散模型接受更多数据的训练,它们的输出变得越来越不可能追溯到任何特定的训练材料。研究人员将这种现象称为“归因衰退”。对于关注快速发展的生成式人工智能世界的读者来说,这篇论文是 AI Buzz Wire 本周报道的更重要的研究成果之一。
这篇题为“生成扩散模型的输出通常无法归因”的论文由戴正和大卫·K·吉福德撰写,两人都隶属于麻省理工学院计算机科学与人工智能实验室(CSAIL)。他们的核心问题看似简单:当生成模型生成图像时,您能否在训练数据中找到负责该输出的特定项目?
研究人员发现了什么
答案越来越是否定的。研究人员表明,归因(定义为定位可对生成样本负责的部分训练数据的任务)“如果模型是在足够大的数据集上进行训练的,那么归因就变得不可能了。”
作者写道:“我们发现,模型训练的数据越多,其生成的样本的可归因性就越低,这种现象我们今后将其称为归因衰减。”
为了测试这一点,该团队开发了一种“消融”方法,允许从已经训练的模型中删除特定的训练示例,而无需进行昂贵的重新训练。然后,他们进行了大规模的假设实验:如果特定图像或整个创作者的作品从未出现在训练集中,模型会生成什么?
在该研究的一些最引人注目的结果中,研究人员发现,对于在足够大的数据集上训练的模型,他们可以删除蒙娜丽莎 - 甚至莱昂纳多·达·芬奇的所有作品 - 并且该模型仍然可以重现图像或艺术风格。没有任何一个训练项目对输出有因果关系。
为什么版权诉讼很重要
调查结果处于活跃的法律战场之中。 Midjourney 和 Stable Diffusion 等扩散模型引起了艺术家的诉讼,他们认为训练数据中的作品副本允许人工智能系统复制他们的输出和风格。
在 2023 年正在进行的一起版权案件中,Andersen 等人。在 Stability AI Ltd. 诉 Stability AI Ltd. 案中,原告一直试图迫使 Midjourney 披露用于训练其模型的数据集。他们声称 Midjourney “通过抓取与特定艺术家姓名相关的图像来构建其训练集,其明确目的是使其模型能够模仿这些艺术家的表达内容。”
麻省理工学院的研究表明,大规模建立这种因果关系在技术上可能是不可能的。正如最先报道该研究细节的 The Register 指出的那样,这项研究看起来可能会让人工智能监管变得更加困难而不是更容易——这与作者开始这项工作时所希望的相反。
合理使用问题
在麻省理工学院的新闻稿中,吉福德认为研究结果是双向的。如果生成的输出与任何单独的训练数据无关,则模型可能具有真正的创造性,而不仅仅是复制机器。
吉福德说:“这引发了关于合理使用的问题,关于输出本身是否作为小说作品受版权保护,以及当模型产生的内容与互联网上的任何内容无关时作者如何获得补偿的问题。”
其影响超出了图像生成器的范围。扩散模型已成为生成视听媒体的主要架构,并越来越多地用于科学应用,包括蛋白质结构建模和治疗发现。归因工具也被提出用于机器学习、数据中毒检测、模型可解释性、公平性审计和隐私合规性。
对归因初创公司的警告
该研究还对不断发展的人工智能起源和内容验证工具行业提出了警告。研究人员发现,基于相似性的归因(将生成的输出与视觉上相似的训练图像进行匹配)会在大型训练数据体系中产生错误归因。
换句话说,当模型接受数十亿张图像的训练时,声称“这张人工智能图像来自该艺术家的作品集”的工具可能根本就是错误的。对于依靠技术归属来解决来源纠纷的平台、法院和监管机构来说,麻省理工学院的研究结果表明,这种确定性对于前沿规模的模型来说可能是遥不可及的。
接下来会发生什么
预计该论文将在正在进行的诉讼和政策辩论中被引用,包括围绕欧盟人工智能法案的透明度要求和艺术家补偿制度提案的讨论。如果归因衰减适用于最大的生产模型,那么基于跟踪特定作品的输出的补偿方案可能需要围绕集体许可而不是项目级跟踪重新设计。
该研究还为人工智能开发人员提出了一个微妙的观点:不可归因实际上可能会加强受版权数据训练的合理使用论点,同时削弱艺术家证明个人输出的特定伤害的能力。版权之争的双方都会在数据中找到有用的东西。
保持人工智能领先地位
更多突破性人工智能研究与分析,请访问【AI Buzz Wire】(https://aibuzzwire.news),了解人工智能行业的每日报道。
阅读更多人工智能新闻 →