Новое исследование ученых-компьютерщиков Массачусетского технологического института, опубликованное во вторник в журнале Nature Communications, дает открытие, которое может изменить ход дебатов по поводу авторских прав на ИИ: по мере того, как диффузионные модели обучаются на большем количестве данных, их результаты становится все более невозможными для отслеживания какого-либо конкретного фрагмента учебного материала. Исследователи называют это явление «распадом атрибуции». Для читателей, следящих за быстро развивающимся миром генеративного искусственного интеллекта, эта статья является одним из наиболее важных результатов исследований, опубликованных на этой неделе в [AI Buzz Wire] (https://aibuzzwire.news).

Статья под названием «Результаты моделей генеративной диффузии часто невозможно объяснить» была написана Чжэн Даем и Дэвидом К. Гиффордом, которые оба связаны с Лабораторией компьютерных наук и искусственного интеллекта Массачусетского технологического института (CSAIL). Их главный вопрос был обманчиво простым: когда генеративная модель создает изображение, можете ли вы найти в обучающих данных конкретный элемент, отвечающий за этот результат?

Что обнаружили исследователи

Ответ все чаще оказывается нет. Исследователи показывают, что атрибуция, определяемая как задача поиска части обучающих данных, которая может нести ответственность за сгенерированную выборку, «может стать невозможной, если модель обучается на достаточно большом массиве данных».

«Мы обнаруживаем, что чем на большем количестве данных обучается модель, тем менее атрибутивными становятся ее сгенерированные образцы — явление, которое мы отныне называем распадом атрибуции», — пишут авторы.

Чтобы проверить это, команда разработала методологию «абляции», которая позволяет удалять конкретные обучающие примеры из уже обученной модели без дорогостоящего переобучения. Затем они провели крупномасштабные эксперименты «что, если»: что бы сгенерировала модель, если бы конкретное изображение или вся работа автора никогда не входила в обучающую выборку?

Некоторые из самых поразительных результатов исследования заключаются в том, что из моделей, обученных на достаточно больших наборах данных, они могут удалить Мону Лизу — или даже все работы Леонардо да Винчи — и модель все равно сможет воспроизвести изображение или художественный стиль. Ни один элемент обучения не был причинно ответственен за результат.

Почему это важно для судебных разбирательств по авторским правам

Результаты оказались в центре активной юридической битвы. Модели распространения, такие как Midjourney и Stable Diffusion, вызвали судебные иски со стороны художников, которые утверждают, что копии их работ в обучающих данных позволяют системам искусственного интеллекта воспроизводить их результаты и стиль.

В одном продолжающемся деле об авторских правах, возбужденном в 2023 году, Andersen et al. против Stability AI Ltd. истцы пытались заставить Midjourney раскрыть наборы данных, используемые для обучения ее моделей. Они утверждают, что Midjourney построила свои обучающие наборы «путем сбора изображений, связанных с именами конкретных художников, с конкретной целью дать возможность своей модели имитировать выразительное содержание этих художников».

Исследование Массачусетского технологического института предполагает, что установление таких причинно-следственных связей может быть технически невозможным в больших масштабах. Как отметил The Register, который первым сообщил подробности исследования, похоже, что исследование скорее затруднит, чем облегчит регулирование ИИ, что является противоположностью тому, на что надеялись авторы, когда начинали работу.

Вопрос о добросовестном использовании

В пресс-релизе Массачусетского технологического института Гиффорд утверждает, что результаты двоякие. Если сгенерированные выходные данные не имеют ничего общего с какой-либо отдельной частью обучающих данных, модели могут быть действительно творческими, а не просто копирующими машинами.

«Это поднимает вопросы о добросовестном использовании, о том, охраняются ли сами результаты авторским правом как новые произведения, и о том, как авторы получают компенсацию, когда то, что получается из модели, не может быть связано ни с чем в Интернете», — сказал Гиффорд.

Последствия выходят за рамки генераторов изображений. Модели диффузии стали доминирующей архитектурой для создания аудиовизуальных носителей и все чаще используются в научных приложениях, включая моделирование структуры белков и терапевтические открытия. Также были предложены инструменты атрибуции для машинного отучения, обнаружения искажения данных, интерпретируемости модели, аудита справедливости и соблюдения конфиденциальности.

Предупреждение для стартапов по атрибуции

В исследовании также содержится предостережение в отношении растущей индустрии инструментов искусственного интеллекта и проверки контента. Исследователи обнаружили, что атрибуция на основе сходства — сопоставление сгенерированных результатов с визуально похожими обучающими изображениями — приводит к ложным атрибуциям в больших режимах обучающих данных.

Другими словами, инструмент, который утверждает, что «это изображение ИИ взято из портфолио этого художника», может просто ошибаться, когда модели обучаются на миллиардах изображений. Для платформ, судов и регуляторов, рассчитывающих на техническую атрибуцию для разрешения споров о происхождении, результаты MIT показывают, что такая уверенность может быть недостижима для моделей передового масштаба.

Что будет дальше

Ожидается, что этот документ будет цитироваться в текущих судебных процессах и политических дебатах, включая дискуссии вокруг требований прозрачности Закона ЕС об искусственном интеллекте и предложений по системам компенсации артистам. Если снижение атрибуции справедливо для крупнейших производственных моделей, схемы компенсации, основанные на отслеживании результатов конкретных работ, возможно, придется перестроить с учетом коллективного лицензирования, а не отслеживания на уровне отдельных изделий.

Исследование также поднимает тонкий вопрос для разработчиков ИИ: отсутствие атрибуции может на самом деле усилить аргументы в пользу добросовестного использования для обучения на данных, защищенных авторским правом, одновременно подрывая способность художников доказывать конкретный вред от отдельных результатов. Обе стороны борьбы за авторские права найдут в данных что-то, что можно использовать.

Будьте впереди ИИ

Чтобы узнать больше о последних исследованиях и анализе ИИ, посетите AI Buzz Wire, где ежедневно освещаются новости индустрии ИИ.

Читать больше новостей об искусственном интеллекте →