Нове дослідження комп’ютерних науковців Массачусетського технологічного інституту, опубліковане у Nature Communications у вівторок, дає висновок, який може змінити дискусію щодо авторських прав на штучний інтелект: оскільки дифузійні моделі навчаються на більшій кількості даних, їхні результати стає все важче відстежити до будь-якої конкретної частини навчального матеріалу. Дослідники називають це явище «розпадом атрибуції». Для читачів, які спостерігають за швидкоплинним світом генеративного штучного інтелекту, ця стаття є одним із найбільш важливих результатів дослідження, висвітленого цього тижня на [AI Buzz Wire] (https://aibuzzwire.news).

Стаття під назвою «Результати моделей генеративної дифузії часто не підлягають приписуванню» була написана Чжен Даєм і Девідом К. Гіффордом, обидва пов’язані з Лабораторією комп’ютерних наук і штучного інтелекту Массачусетського технологічного інституту (CSAIL). Їх центральне питання було оманливо простим: коли генеративна модель створює зображення, чи можна знайти певний елемент у навчальних даних, який відповідає за цей результат?

Що виявили дослідники

Відповідь все частіше – ні. Дослідники показують, що атрибуція — визначена як завдання визначення місця розташування частини навчальних даних, які можуть вважатися відповідальними за згенеровану вибірку — «може стати неможливою, якщо модель навчена на достатньо великому масиві даних».

«Ми виявили, що чим більше даних навчається модель, тим менш придатними стають створені нею зразки, і це явище ми надалі називатимемо розпадом атрибуції», — пишуть автори.

Щоб перевірити це, команда розробила методологію «абляції», яка дозволяє видаляти конкретні навчальні приклади з уже навченої моделі без дорогого перенавчання. Потім вони провели широкомасштабні експерименти «що-якщо»: що генерувала б модель, якби конкретне зображення або ціла робота творця ніколи не були в навчальному наборі?

У деяких із найбільш вражаючих результатів дослідження дослідники виявили, що для моделей, навчених на досить великих наборах даних, вони можуть видалити Мону Лізу — або навіть усі роботи Леонардо да Вінчі — і модель все одно зможе відтворити зображення чи художній стиль. Жоден елемент навчання не був причинно відповідальним за результат.

Чому це важливо для судового розгляду авторських прав

Висновки припадають на поле активної судової битви. Моделі розповсюдження, такі як Midjourney і Stable Diffusion, привернули судові позови від художників, які стверджують, що копії їхніх робіт у навчальних даних дозволяють системам ШІ відтворювати їхні результати та стиль.

В одній триваючій справі про авторські права з 2023 року Andersen et al. проти Stability AI Ltd., позивачі намагалися змусити Midjourney розкрити набори даних, які використовуються для навчання моделей. Вони стверджують, що Midjourney побудувала свої навчальні набори, «збираючи зображення, пов’язані з іменами конкретних художників, щоб дозволити своїй моделі імітувати виразний вміст цих художників».

Дослідження MIT показує, що встановлення таких причинно-наслідкових зв’язків може бути технічно неможливим у великому масштабі. Як зазначає The Register, який першим оприлюднив подробиці дослідження, дослідження, швидше за все, ускладнить регулювання штучного інтелекту, а не полегшить — навпаки, на що сподівалися автори, починаючи роботу.

Питання добросовісного використання

У прес-релізі Массачусетського технологічного інституту Гіффорд стверджує, що висновки суттєві. Якщо згенеровані результати не мають нічого спільного з окремими навчальними даними, моделі можуть бути справді творчими, а не просто копіювальними машинами.

«Це викликає питання про добросовісне використання, про те, чи захищені авторським правом результати самі як романи, і про те, як автори отримують компенсацію, коли те, що виходить із моделі, не можна віднести ні до чого в Інтернеті», — сказав Гіффорд.

Наслідки виходять за межі генераторів зображень. Дифузійні моделі стали домінуючою архітектурою для створення аудіовізуальних медіа і все частіше використовуються в наукових програмах, включаючи моделювання структури білків і терапевтичні відкриття. Інструменти атрибуції також були запропоновані для відміни машинного навчання, виявлення пошкодження даних, інтерпретації моделі, аудиту справедливості та відповідності конфіденційності.

Попередження для стартапів з атрибуцією

Дослідження також містить застереження щодо зростаючої індустрії походження ШІ та інструментів перевірки вмісту. Дослідники виявили, що атрибуція на основі схожості — зіставлення згенерованих результатів із візуально подібними навчальними зображеннями — створює помилкові атрибуції у великих режимах навчальних даних.

Іншими словами, інструмент, який стверджує, що «це зображення штучного інтелекту походить із портфоліо цього художника», може бути просто неправильним, якщо моделі навчаються на мільярдах зображень. Для платформ, судів і регуляторів, які розраховують на технічну атрибуцію для вирішення суперечок про походження, результати Массачусетського технологічного інституту свідчать про те, що така впевненість може бути недосяжною для прикордонних моделей.

Що буде далі

Очікується, що документ буде цитуватися в поточних судових процесах і політичних дебатах, включаючи дискусії навколо вимог прозорості Закону ЄС про штучний інтелект та пропозицій щодо систем компенсації художникам. Якщо спад атрибуції діє для найбільших виробничих моделей, схеми компенсації, засновані на відстеженні результатів до конкретних робіт, можливо, доведеться переробити навколо колективного ліцензування, а не відстеження на рівні предметів.

Дослідження також піднімає тонкий момент для розробників штучного інтелекту: відсутність атрибутів може фактично посилити аргументи добросовісного використання для навчання на захищених авторським правом даних, водночас підриваючи здатність художників доводити конкретну шкоду від окремих результатів. Обидві сторони боротьби за авторські права знайдуть, що використовувати в даних.

Будьте попереду ШІ

Щоб отримати більше актуальних досліджень та аналізу штучного інтелекту, відвідайте AI Buzz Wire, щоб щоденно висвітлювати індустрію штучного інтелекту.

Читати більше новин AI →