Panaliten anyar saka ilmuwan komputer MIT sing diterbitake ing Nature Communications, Selasa, menehi panemuan sing bisa ngowahi debat babagan hak cipta AI: amarga model difusi dilatih babagan data luwih akeh, asile dadi saya ora bisa dilacak maneh menyang materi latihan tartamtu. Para panaliti nyebut fenomena kasebut "pembusukan atribusi." Kanggo para pamaca sing nglacak jagad AI generatif sing obah kanthi cepet, kertas kasebut minangka salah sawijining asil riset sing luwih penting sing diliputi minggu iki dening AI Buzz Wire.
Makalah kasebut kanthi irah-irahan "Outputs of Generative Diffusion Models are Asring Unattributable," dikarang dening Zheng Dai lan David K. Gifford, loro-lorone afiliasi karo MIT's Computer Science and Artificial Intelligence Laboratory (CSAIL). Pitakonan utama dheweke gampang banget: nalika model generatif ngasilake gambar, sampeyan bisa nemokake item tartamtu ing data latihan sing tanggung jawab kanggo output kasebut?
Sing Ditemokake Peneliti
Jawaban, tambah akeh, ora. Para panaliti nuduhake yen atribusi - ditetepake minangka tugas kanggo nemokake bagean saka data latihan sing bisa tanggung jawab kanggo sampel sing digawe - "bisa dadi mokal yen model dilatih ing korpus data sing cukup gedhe."
"Kita nemokake manawa luwih akeh data model sing dilatih, conto sing digawe kurang bisa diatribusi, fenomena sing saiki diarani bosok atribusi," tulis penulis.
Kanggo nyoba iki, tim ngembangake metodologi "ablasi" sing ngidini conto latihan khusus dicopot saka model sing wis dilatih tanpa latihan maneh sing larang. Dheweke banjur nglakokake eksperimen apa-yen skala gedhe: model apa sing bakal diasilake yen gambar tartamtu, utawa kabeh karya pangripta, ora tau ana ing set latihan?
Ing sawetara asil sinau sing paling nggumunake, peneliti nemokake manawa model sing dilatih ing set data sing cukup gedhe, bisa mbusak Mona Lisa - utawa malah kabeh karya Leonardo da Vinci - lan model kasebut isih bisa ngasilake gambar utawa gaya seni. Ora ana siji item latihan sing tanggung jawab kanggo output.
Napa Penting kanggo Litigasi Hak Cipta
Temuan kasebut ana ing tengah-tengah medan perang legal sing aktif. Model difusi kayata Midjourney lan Stable Diffusion wis narik tuntutan hukum saka seniman sing mbantah manawa salinan karyane ing data latihan ngidini sistem AI ngasilake output lan gaya.
Ing siji kasus hak cipta sing terus-terusan wiwit taun 2023, Andersen et al. v Stability AI Ltd., penggugat wis nyoba kanggo meksa Midjourney kanggo mbukak dataset digunakake kanggo olahraga model sawijining. Dheweke ujar manawa Midjourney nggawe set latihan "kanthi ngethok gambar sing ana gandhengane karo jeneng seniman tartamtu kanggo tujuan nyata supaya model bisa niru konten ekspresif seniman kasebut."
Panaliten MIT nyatake yen nggawe hubungan sebab-akibat kasebut bisa uga ora mungkin sacara teknis ing skala. Minangka The Register, sing pisanan nglaporake rincian sinau, nyathet, riset kasebut katon bakal nggawe regulasi AI luwih angel tinimbang luwih gampang - ngelawan apa sing dikarepake penulis nalika miwiti karya.
Pitakonan Gunakake Adil
Ing release penet MIT kang, Gifford udur temuan Cut loro cara. Yen output sing diasilake ora ana hubungane karo data latihan individu, model bisa uga pancen kreatif tinimbang mesin salinan.
"Iki nuwuhake pitakon babagan panggunaan sing adil, babagan apa output kasebut dhewe duwe hak cipta minangka karya novel, lan babagan carane penulis entuk ganti rugi nalika apa sing metu saka model ora ana hubungane karo apa wae ing internet," ujare Gifford.
Implikasi ngluwihi generator gambar. Model difusi wis dadi arsitektur dominan kanggo ngasilake media audiovisual lan saya akeh digunakake ing aplikasi ilmiah, kalebu model struktur protein lan panemuan terapeutik. Piranti atribusi uga wis diusulake kanggo unlearning mesin, deteksi keracunan data, interpretasi model, audit keadilan, lan kepatuhan privasi.
Peringatan kanggo Atribusi Startups
Panaliten kasebut uga ngati-ati kanggo tuwuhing industri asal-usul AI lan alat verifikasi konten. Para panaliti nemokake yen atribusi adhedhasar mirip - sing cocog karo output sing digawe kanggo gambar latihan sing padha - ngasilake atribusi palsu ing rezim data latihan gedhe.
Ing tembung liyane, alat sing ngaku "gambar AI iki asale saka portofolio artis kasebut" bisa uga salah nalika model dilatih babagan milyaran gambar. Kanggo platform, pengadilan, lan regulator sing ngandelake atribusi teknis kanggo ngrampungake perselisihan asal-usul, asil MIT nuduhake manawa kepastian kasebut bisa uga ora bisa digayuh kanggo model skala perbatasan.
Apa Sabanjure
Makalah kasebut samesthine bakal dikutip ing debat pengadilan lan kabijakan sing isih ana, kalebu diskusi babagan syarat transparansi EU AI Act lan usulan kanggo sistem kompensasi artis. Yen bosok atribusi tetep kanggo model produksi paling gedhe, skema ganti rugi adhedhasar nglacak output menyang karya tartamtu bisa uga kudu didesain ulang babagan lisensi kolektif tinimbang pelacakan tingkat item.
Panliten kasebut uga nuwuhake titik subtle kanggo pangembang AI: unattributability bisa uga nguatake argumentasi panggunaan sing adil kanggo latihan babagan data sing duwe hak cipta, lan ing wektu sing padha ngrusak kemampuan seniman kanggo mbuktekake cilaka tartamtu saka output individu. Loro-lorone perang hak cipta bakal nemokake sing bisa digunakake ing data kasebut.
Tetep Ahead saka AI
Kanggo riset lan analisis AI liyane, bukak AI Buzz Wire kanggo liputan saben dina babagan industri AI.
Waca liyane warta AI →