Satu kajian baharu daripada saintis komputer MIT yang diterbitkan dalam Nature Communications pada hari Selasa menyampaikan penemuan yang boleh membentuk semula perdebatan mengenai hak cipta AI: memandangkan model penyebaran dilatih pada lebih banyak data, output mereka menjadi semakin mustahil untuk dikesan kembali ke mana-mana bahan latihan tertentu. Para penyelidik memanggil fenomena itu "kemerosotan atribusi." Bagi pembaca yang menjejaki dunia AI generatif yang bergerak pantas, makalah itu merupakan salah satu hasil penyelidikan yang lebih penting yang diliputi minggu ini oleh AI Buzz Wire.

Makalah itu, bertajuk "Output of Generative Diffusion Models are often Unattributable," telah dikarang oleh Zheng Dai dan David K. Gifford, kedua-duanya bergabung dengan Makmal Sains Komputer dan Kepintaran Buatan (CSAIL) MIT. Soalan utama mereka adalah mudah menipu: apabila model generatif menghasilkan imej, bolehkah anda mencari item tertentu dalam data latihan yang bertanggungjawab untuk output itu?

Perkara yang Ditemui Penyelidik

Jawapannya, semakin, tidak. Para penyelidik menunjukkan bahawa atribusi — ditakrifkan sebagai tugas untuk mencari sebahagian daripada data latihan yang boleh dipertanggungjawabkan untuk sampel yang dijana — "boleh menjadi mustahil jika model dilatih pada korpus data yang cukup besar."

"Kami mendapati bahawa lebih banyak data model dilatih, semakin kurang boleh dikaitkan sampel yang dihasilkannya, fenomena yang kemudiannya kami rujuk sebagai pereputan atribusi," tulis penulis.

Untuk menguji ini, pasukan membangunkan metodologi "ablasi" yang membolehkan contoh latihan khusus dialih keluar daripada model yang sudah terlatih tanpa latihan semula yang mahal. Mereka kemudian menjalankan eksperimen bagaimana jika berskala besar: apakah model yang akan dihasilkan jika imej tertentu, atau keseluruhan hasil kerja pencipta, tidak pernah berada dalam set latihan?

Dalam beberapa hasil kajian yang paling menarik, penyelidik mendapati bahawa untuk model yang dilatih pada set data yang cukup besar, mereka boleh mengalih keluar Mona Lisa — malah semua karya Leonardo da Vinci — dan model itu masih boleh mengeluarkan semula imej atau gaya artistik. Tiada satu pun item latihan yang bertanggungjawab secara kausal untuk output.

Mengapa Ia Penting untuk Litigasi Hak Cipta

Penemuan itu mendarat di tengah-tengah medan pertempuran undang-undang yang aktif. Model resapan seperti Midjourney dan Stable Diffusion telah menarik saman daripada artis yang berpendapat bahawa salinan kerja mereka dalam data latihan membolehkan sistem AI menghasilkan semula output dan gaya mereka.

Dalam satu kes hak cipta yang berterusan dari 2023, Andersen et al. lwn Stability AI Ltd., plaintif telah cuba memaksa Midjourney untuk mendedahkan set data yang digunakan untuk melatih modelnya. Mereka mendakwa Midjourney membina set latihannya "dengan mengikis imej yang dikaitkan dengan nama artis tertentu untuk tujuan nyata membolehkan modelnya meniru kandungan ekspresif artis tersebut."

Kajian MIT mencadangkan bahawa mewujudkan pautan kausal sedemikian mungkin secara teknikalnya mustahil pada skala. Sebagai The Register, yang pertama kali melaporkan butiran kajian, menyatakan, penyelidikan itu nampaknya akan menjadikan peraturan AI lebih sukar daripada lebih mudah - bertentangan dengan apa yang penulis harapkan apabila mereka memulakan kerja.

Soalan Penggunaan Adil

Dalam siaran akhbar MIT, Gifford berpendapat penemuan itu memotong kedua-dua cara. Jika output yang dihasilkan tidak ada kaitan dengan mana-mana data latihan individu, model mungkin benar-benar kreatif dan bukannya mesin penyalin semata-mata.

"Itu menimbulkan persoalan tentang penggunaan adil, sama ada output itu sendiri boleh hak cipta sebagai karya novel, dan tentang cara pengarang mendapat pampasan apabila apa yang keluar daripada model tidak dikaitkan dengan apa-apa di internet," kata Gifford.

Implikasinya melangkaui penjana imej. Model resapan telah menjadi seni bina dominan untuk menjana media audiovisual dan semakin digunakan dalam aplikasi saintifik, termasuk pemodelan struktur protein dan penemuan terapeutik. Alat atribusi juga telah dicadangkan untuk unlearning mesin, pengesanan keracunan data, kebolehtafsiran model, audit keadilan dan pematuhan privasi.

Amaran untuk Permulaan Atribusi

Kajian itu juga membawa peringatan untuk industri yang berkembang bagi alat asal AI dan pengesahan kandungan. Para penyelidik mendapati bahawa atribusi berasaskan persamaan — memadankan output yang dijana dengan imej latihan yang serupa secara visual — menghasilkan atribusi palsu dalam rejim data latihan yang besar.

Dalam erti kata lain, alat yang mendakwa "imej AI ini datang daripada portfolio artis itu" mungkin salah apabila model dilatih pada berbilion-bilion imej. Untuk platform, mahkamah dan pengawal selia yang bergantung pada atribusi teknikal untuk menyelesaikan pertikaian asal, keputusan MIT mencadangkan kepastian sedemikian mungkin tidak dapat dicapai untuk model skala sempadan.

Apa Yang Akan Datang

Kertas itu dijangka disebut dalam perbahasan litigasi dan dasar yang sedang berjalan, termasuk perbincangan mengenai keperluan ketelusan EU AI Act dan cadangan untuk sistem pampasan artis. Jika pereputan atribusi berlaku untuk model pengeluaran terbesar, skim pampasan berdasarkan pengesanan output kepada kerja tertentu mungkin perlu direka bentuk semula mengikut pelesenan kolektif dan bukannya penjejakan peringkat item.

Kajian itu juga membangkitkan perkara yang halus untuk pembangun AI: tidak boleh dikaitkan sebenarnya boleh mengukuhkan hujah penggunaan saksama untuk latihan mengenai data berhak cipta, sambil pada masa yang sama menjejaskan keupayaan artis untuk membuktikan bahaya khusus daripada output individu. Kedua-dua pihak dalam perjuangan hak cipta akan mencari sesuatu untuk digunakan dalam data.

Kekal Mendahului AI

Untuk penyelidikan dan analisis AI yang lebih canggih, lawati AI Buzz Wire untuk liputan harian industri AI.

Baca lebih banyak berita AI →