Utafiti mpya kutoka kwa wanasayansi wa kompyuta wa MIT uliochapishwa katika Mawasiliano ya Mazingira mnamo Jumanne unatoa matokeo ambayo yanaweza kuunda upya mjadala juu ya hakimiliki ya AI: jinsi mifano ya uenezaji inavyofunzwa juu ya data zaidi, matokeo yao yanazidi kuwa magumu kufuatilia nyuma kwenye kipande chochote cha nyenzo za mafunzo. Watafiti huita jambo hilo "kuoza kwa sifa." Kwa wasomaji wanaofuatilia ulimwengu unaosonga kwa kasi wa uzalishaji wa AI, karatasi ni mojawapo ya matokeo ya utafiti muhimu yaliyotolewa wiki hii na AI Buzz Wire.

Karatasi hiyo, iliyopewa jina la "Matokeo ya Miundo ya Usambazaji wa Uzalishaji Mara nyingi Haiwezekani," iliandikwa na Zheng Dai na David K. Gifford, wote wanaohusishwa na Maabara ya Sayansi ya Kompyuta na Maabara ya Usanii wa MIT (CSAIL). Swali lao kuu lilikuwa rahisi kwa udanganyifu: wakati modeli ya uzalishaji inapotoa picha, unaweza kupata kipengee maalum katika data ya mafunzo ambayo inawajibika kwa matokeo hayo?

Walichogundua Watafiti

Jibu, inazidi, ni hapana. Watafiti wanaonyesha kuwa maelezo - yanayofafanuliwa kama kazi ya kupata sehemu ya data ya mafunzo ambayo inaweza kuwajibishwa kwa sampuli inayozalishwa - "inaweza kuwa haiwezekani ikiwa mfano utafunzwa kwenye mkusanyiko mkubwa wa data."

"Tunagundua kuwa data nyingi zaidi ambazo modeli hufunzwa, ndivyo sampuli zake zinazozalishwa zinavyopungua, jambo ambalo tunarejelea kama uozo wa sifa," waandishi wanaandika.

Ili kujaribu hili, timu ilibuni mbinu ya "ablation" ambayo inaruhusu mifano mahususi ya mafunzo kuondolewa kutoka kwa muundo ambao tayari umefunzwa bila mafunzo ya gharama kubwa. Kisha walifanya majaribio makubwa ya nini-ikiwa: mtindo ungezalisha nini ikiwa picha fulani, au kazi nzima ya mtayarishi, haijawahi kuwa katika seti ya mafunzo?

Katika baadhi ya matokeo ya kuvutia zaidi ya utafiti, watafiti waligundua kuwa kwa miundo iliyofunzwa kwenye hifadhidata kubwa vya kutosha, wanaweza kuondoa Mona Lisa - au hata kazi zote za Leonardo da Vinci - na mtindo bado unaweza kutoa picha au mtindo wa kisanii. Hakuna kipengee kimoja cha mafunzo kilichowajibika kwa matokeo.

Kwa Nini Ni Muhimu Kwa Madai ya Hakimiliki

Matokeo yanatua katikati ya uwanja wa mapambano wa kisheria. Miundo ya usambaaji kama vile Midjourney na Stable Diffusion imevutia kesi kutoka kwa wasanii ambao wanahoji kuwa nakala za kazi zao katika data ya mafunzo huruhusu mifumo ya AI kutoa matokeo na mtindo wao.

Katika kesi moja inayoendelea ya hakimiliki kutoka 2023, Andersen et al. v. Stability AI Ltd., walalamikaji wamekuwa wakijaribu kulazimisha Midjourney kufichua seti za data zinazotumika kufunza miundo yake. Wanadai Midjourney ilijenga seti zake za mafunzo "kwa kukwangua picha zinazohusiana na majina mahususi ya wasanii kwa madhumuni ya kuwezesha muundo wake kuiga maudhui ya wasanii hao."

Utafiti wa MIT unapendekeza kuwa kuanzisha viunganishi kama hivyo kunaweza kuwa haiwezekani kitaalam kwa kiwango. Kama vile Jarida, ambalo liliripoti maelezo ya utafiti kwanza, lilivyobaini, utafiti unaonekana uwezekano wa kufanya udhibiti wa AI kuwa mgumu zaidi badala ya kuwa rahisi - kinyume cha kile ambacho waandishi walitarajia walipoanza kazi.

Swali la Matumizi ya Haki

Katika taarifa ya vyombo vya habari ya MIT, Gifford anasema matokeo yamekatwa kwa njia zote mbili. Iwapo matokeo yanayozalishwa hayana uhusiano wowote na kipande chochote cha data ya mafunzo, miundo inaweza kuwa ya kiubunifu badala ya mashine za kunakili tu.

"Hiyo inazua maswali kuhusu matumizi ya haki, kuhusu kama matokeo yenyewe yana hakimiliki kama riwaya inavyofanya kazi, na kuhusu jinsi waandishi hulipwa fidia wakati kile kinachotoka kwa mtindo hakihusiki na chochote kwenye mtandao," Gifford alisema.

Athari zinaenea zaidi ya jenereta za picha. Miundo ya usambaaji imekuwa usanifu mkuu wa kuzalisha maudhui ya sauti na kuona na inazidi kutumika katika matumizi ya kisayansi, ikiwa ni pamoja na uundaji wa muundo wa protini na ugunduzi wa matibabu. Zana za maelezo pia zimependekezwa kwa ujifunzaji wa mashine, utambuzi wa sumu ya data, tafsiri ya modeli, ukaguzi wa haki na utiifu wa faragha.

Onyo kwa Wanaoanzisha Sifa

Utafiti huo pia una tahadhari kwa tasnia inayokua ya asili ya AI na zana za uthibitishaji wa yaliyomo. Watafiti waligundua kuwa maelezo yanayotegemea kufanana - kulinganisha matokeo yanayotokana na picha zinazofanana za mafunzo - hutoa sifa za uwongo katika mifumo mikubwa ya data ya mafunzo.

Kwa maneno mengine, zana inayodai "picha hii ya AI ilitoka kwa jalada la msanii huyo" inaweza kuwa sio sahihi wakati wanamitindo wanafunzwa mabilioni ya picha. Kwa majukwaa, mahakama, na wasimamizi wanaohesabu sifa za kiufundi kusuluhisha mizozo ya asili, matokeo ya MIT yanapendekeza kuwa hakika kama hiyo inaweza kuwa nje ya kufikiwa kwa mifano ya mizani ya mipaka.

Nini Kinafuata

Karatasi hiyo inatarajiwa kutajwa katika mijadala ya madai na sera inayoendelea, ikijumuisha majadiliano kuhusu mahitaji ya uwazi ya Sheria ya EU AI na mapendekezo ya mifumo ya fidia ya wasanii. Ikiwa uozo wa sifa utadumu kwa miundo mikubwa zaidi ya uzalishaji, mipango ya fidia kulingana na ufuatiliaji wa matokeo ya kazi mahususi inaweza kuhitaji kubuniwa upya karibu na utoaji wa leseni ya pamoja badala ya ufuatiliaji wa kiwango cha bidhaa.

Utafiti pia unaibua jambo dogo kwa wasanidi wa AI: kutohusishwa kunaweza kuimarisha hoja za matumizi ya haki kwa mafunzo ya data iliyo na hakimiliki, huku ikidhoofisha uwezo wa wasanii wa kuthibitisha madhara mahususi kutoka kwa matokeo ya mtu binafsi. Pande zote mbili za pambano la hakimiliki zitapata kitu cha kutumia katika data.

Kaa Mbele ya AI

Kwa utafiti na uchanganuzi zaidi wa AI, tembelea AI Buzz Wire kwa matangazo ya kila siku ya tasnia ya AI.

Soma habari zaidi za AI →