یک مطالعه جدید از دانشمندان کامپیوتر MIT که در روز سهشنبه در Nature Communications منتشر شد، یافتهای را ارائه میکند که میتواند بحث در مورد حق تکثیر هوش مصنوعی را تغییر دهد: از آنجایی که مدلهای انتشار بر روی دادههای بیشتری آموزش میبینند، خروجیهای آنها به طور فزایندهای غیرممکن میشود که به هر قطعه خاصی از مواد آموزشی بازگردند. محققان این پدیده را "تجزیه اسناد" می نامند. برای خوانندگانی که دنیای پرشتاب هوش مصنوعی مولد را ردیابی میکنند، این مقاله یکی از نتایج تحقیقاتی مهمتر است که این هفته توسط [AI Buzz Wire] (https://aibuzzwire.news) پوشش داده شد.
این مقاله با عنوان «خروجیهای مدلهای انتشار مولد اغلب غیر قابل انتساب هستند» توسط ژنگ دای و دیوید کی. سوال اصلی آنها به طرز فریبنده ای ساده بود: وقتی یک مدل مولد تصویری را تولید می کند، آیا می توانید آیتم خاصی را در داده های آموزشی که مسئول آن خروجی است پیدا کنید؟
آنچه محققان پیدا کردند
پاسخ، به طور فزاینده ای، منفی است. محققان نشان میدهند که تخصیص - که به عنوان وظیفه مکانیابی بخشی از دادههای آموزشی که میتواند مسئول یک نمونه تولید شده باشد - تعریف میشود - «اگر یک مدل بر روی مجموعهای از دادههای به اندازه کافی آموزش داده شود، میتواند غیرممکن شود».
نویسندگان می نویسند: «ما متوجه می شویم که هرچه یک مدل بر روی داده های بیشتری آموزش ببیند، نمونه های تولید شده آن کمتر قابل انتساب می شوند، پدیده ای که از این پس به عنوان فروپاشی اسناد از آن یاد می کنیم.
برای آزمایش این، تیم یک روش "ابلشن" را توسعه داد که به نمونه های آموزشی خاص اجازه می دهد تا بدون آموزش مجدد پرهزینه، از یک مدل آموزش دیده از قبل حذف شوند. آنها سپس آزمایشهای چه میشد در مقیاس بزرگ را انجام دادند: اگر یک تصویر خاص، یا کل مجموعه آثار خالق هرگز در مجموعه آموزشی نبود، مدل چه چیزی تولید میکرد؟
در برخی از برجستهترین نتایج این مطالعه، محققان دریافتند که برای مدلهایی که بر روی مجموعه دادههای به اندازه کافی بزرگ آموزش دیدهاند، میتوانند مونالیزا - یا حتی تمام کارهای لئوناردو داوینچی - را حذف کنند و مدل همچنان میتواند تصویر یا سبک هنری را بازتولید کند. هیچ یک از آیتم های آموزشی به طور علّی مسئول خروجی نبود.
چرا برای دعوای حق چاپ اهمیت دارد
یافته ها در میانه یک میدان نبرد قانونی فعال قرار می گیرند. مدلهای انتشار مانند Midjourney و Stable Diffusion شکایت هنرمندانی را به خود جلب کردهاند که استدلال میکنند کپیهایی از کارشان در آموزش دادهها به سیستمهای هوش مصنوعی اجازه میدهد خروجی و سبک خود را بازتولید کنند.
در یکی از پروندههای حقوق مؤلف از سال 2023، اندرسن و همکاران. در مقابل Stability AI Ltd.، شاکیان سعی کرده اند Midjourney را مجبور کنند مجموعه داده های مورد استفاده برای آموزش مدل های خود را افشا کند. آنها ادعا می کنند که Midjourney مجموعه های آموزشی خود را "با خراش دادن تصاویر مرتبط با نام هنرمندان خاص به منظور فعال کردن مدل خود برای تقلید از محتوای رسا هنرمندان" ساخته است.
مطالعه MIT نشان می دهد که ایجاد چنین پیوندهای علی ممکن است از نظر فنی در مقیاس غیرممکن باشد. همانطور که The Register، که برای اولین بار جزئیات این مطالعه را گزارش کرد، اشاره کرد، به نظر میرسد که این تحقیق احتمالاً مقررات هوش مصنوعی را به جای آسانتر کردن، دشوارتر میکند – برعکس آنچه نویسندگان هنگام شروع کار امیدوار بودند.
سوال استفاده منصفانه
در بیانیه مطبوعاتی MIT، گیفورد استدلال میکند که یافتهها هر دو طرف را قطع میکنند. اگر خروجیهای تولید شده هیچ ارتباطی با هر بخش از دادههای آموزشی نداشته باشند، ممکن است مدلها به جای ماشینهای کپی صرف، خلاقانه باشند.
گیفورد میگوید: «این پرسشهایی را در مورد استفاده منصفانه، در مورد اینکه آیا خروجیها بهعنوان آثار جدید دارای حق نسخهبرداری هستند یا خیر، و در مورد اینکه چگونه نویسندگان وقتی که آنچه از یک مدل بیرون میآید به هیچ چیز در اینترنت نسبت داده نمیشود، جبران میشود، ایجاد میکند».
مفاهیم فراتر از تولید کننده های تصویر است. مدلهای انتشار به معماری غالب برای تولید رسانههای سمعی و بصری تبدیل شدهاند و به طور فزایندهای در کاربردهای علمی، از جمله مدلسازی ساختار پروتئین و کشف درمانی استفاده میشوند. ابزارهای انتساب همچنین برای حذف یادگیری ماشینی، تشخیص مسمومیت داده ها، تفسیرپذیری مدل، ممیزی عادلانه و رعایت حریم خصوصی پیشنهاد شده است.
هشداری برای استارتآپهای Attribution
این مطالعه همچنین برای صنعت رو به رشد ابزارهای تأیید محتوا و منشأ هوش مصنوعی هشدار می دهد. محققان دریافتند که اسناد مبتنی بر شباهت - تطبیق خروجیهای تولید شده با تصاویر آموزشی مشابه بصری - نسبتهای نادرست را در رژیمهای داده آموزشی بزرگ ایجاد میکند.
به عبارت دیگر، ابزاری که ادعا می کند "این تصویر هوش مصنوعی از نمونه کارها آن هنرمند گرفته شده است" ممکن است زمانی که مدل ها بر روی میلیاردها تصویر آموزش می بینند اشتباه باشد. برای پلتفرمها، دادگاهها و تنظیمکنندههایی که برای حل و فصل اختلافات منشأ روی اسناد فنی حساب میکنند، نتایج MIT نشان میدهد که چنین اطمینانی ممکن است برای مدلهای مقیاس مرزی دور از دسترس باشد.
بعد چه می آید
انتظار میرود این مقاله در بحثهای حقوقی و سیاستی جاری، از جمله بحثهای پیرامون الزامات شفافیت قانون هوش مصنوعی اتحادیه اروپا و پیشنهادات برای سیستمهای غرامت هنرمندان مورد استناد قرار گیرد. اگر کاهش انتساب برای بزرگترین مدلهای تولید وجود داشته باشد، طرحهای جبران خسارت مبتنی بر ردیابی خروجیها به کارهای خاص ممکن است به جای ردیابی در سطح مورد نیاز به طراحی مجدد پیرامون مجوز جمعی داشته باشند.
این مطالعه همچنین یک نکته ظریف را برای توسعهدهندگان هوش مصنوعی مطرح میکند: غیرقابل انتساب ممکن است در واقع استدلالهای استفاده منصفانه برای آموزش دادههای دارای حق چاپ را تقویت کند، در حالی که به طور همزمان توانایی هنرمندان برای اثبات آسیبهای خاص از خروجیهای فردی را تضعیف میکند. هر دو طرف مبارزه حق چاپ چیزی برای استفاده در داده ها پیدا می کنند.
از هوش مصنوعی جلوتر بمانید
برای تحقیقات بیشتر و تجزیه و تحلیل هوش مصنوعی، از [AI Buzz Wire] (https://aibuzzwire.news) برای پوشش روزانه صنعت هوش مصنوعی بازدید کنید.
اخبار هوش مصنوعی را بیشتر بخوانید →