Apabila syarikat menggunakan kumpulan ejen AI yang semakin besar untuk menyelesaikan masalah bersama-sama, penyelidik di Universiti Konstanz telah menghasilkan bukti tentang tingkah laku timbul yang meresahkan: Ejen AI secara spontan mematuhi pendapat majoriti, memberikan jawapan yang salah di bawah tekanan kumpulan sama seperti manusia dalam eksperimen psikologi klasik — dan sebilangan kecil musuh yang degil secara kekal boleh mengubah keseluruhan populasi ejen yang tidak sejajar.
Penemuan, yang dilaporkan oleh PsyPost, datang daripada program penyelidikan yang diketuai oleh Giordano De Marzo, seorang penyelidik pasca doktoral dan pensyarah di Makmal Sains Data Sosial dalam Pusat Data dan Kaedah di Universiti Konstanz, bersama-sama dengan rakan sekerja Claudio Castellano dan David Garcia. Kajian utama, bertajuk "Ejen AI boleh menyelaras melalui pengikut majoriti di luar skala manusia," mengkaji bagaimana model bahasa berkelakuan apabila diletakkan dalam kumpulan tanpa arahan untuk bersetuju. For more context on this story, see our ongoing breaking AI news.
"Ejen AI adalah jenis entiti yang benar-benar baharu yang bertindak di dunia, dan apabila teknologi ini tiba, jelas bahawa ia akan kekal dan bahawa ejen ini perlu berinteraksi antara satu sama lain untuk mencapai apa-apa yang kompleks," kata De Marzo kepada PsyPost. "Itu adalah situasi yang sama yang kami hadapi dengan manusia dan haiwan lain, jadi kami menghampirinya dengan cara yang sama."
Eksperimen: Tiada Arahan, Hanya Jiran
Para penyelidik mengumpulkan kumpulan model bahasa popular daripada keluarga GPT, Claude dan Llama, bermula dengan 50 ejen setiap kumpulan. Setiap ejen telah diberikan satu daripada dua pendapat neutral secara rawak — sengaja diterjemahkan sebagai huruf rawak dan bukannya memuatkan perkataan seperti "ya" atau "tidak" — dan kemudian ditunjukkan senarai semua pendapat semasa ejen lain. Ejen telah digesa untuk memilih pendapat baharu berdasarkan senarai itu sahaja, tanpa arahan yang jelas untuk mematuhi, mengemas kini pandangan mereka secara purata sepuluh kali setiap satu.
Hasilnya: model lanjutan seperti GPT-4 Turbo dan Claude 3 Opus diselaraskan sepenuhnya, dengan 100% ejen akhirnya bersetuju dengan satu pendapat. Model yang lebih lemah seperti GPT-3.5 Turbo tidak pernah mencapai kata sepakat sama sekali — tahap persetujuan mereka turun naik secara rawak sekitar pemisahan 50/50.
"Kumpulan ejen AI boleh bertahan bersama-sama sendiri," kata De Marzo. "Memandangkan dua pilihan yang sama baik, tiada jawapan yang betul dan tiada arahan untuk bersetuju, mereka menumpu pada pilihan bersama hanya dengan mengikut apa sahaja yang dipegang oleh majoriti di sekeliling mereka."
Undang-undang Fizik Berabad-abad Muncul
Untuk mengukur kesannya, penyelidik mentakrifkan metrik yang dipanggil "kuasa majoriti" - ukuran sejauh mana kuat ejen cenderung untuk menerima pakai pilihan paling popular kumpulan daripada memilih secara rawak. Apabila mereka memetakan tingkah laku ini secara matematik, mereka mendapati ia mengikuti model yang pada asalnya direka untuk menerangkan feromagnet: sama seperti putaran atom dalam bahan magnet cenderung sejajar dengan jiran mereka, ejen AI cenderung untuk menyelaraskan dengan pendapat majoriti.
"Apa yang mengejutkan kami ialah betapa seragamnya mereka melakukannya," kata De Marzo. "Setiap model yang kami uji, merentasi tiga keluarga berbeza, mengikut undang-undang matematik yang sama, hanya berbeza dalam satu parameter yang kami panggil kuasa majoriti. Undang-undang itu ternyata menjadi satu-satunya ahli fizik yang telah digunakan selama satu abad untuk menggambarkan magnet, yang bermaksud satu nombor yang diukur sudah cukup untuk meramalkan bagaimana keseluruhan kumpulan model tertentu akan berkelakuan."
Keakuran semakin lemah apabila kumpulan berkembang. Oleh kerana kuasa majoriti berkurangan dengan saiz kumpulan, populasi yang besar akhirnya menjadi tidak stabil dan berpecah kepada puak. Setiap model mempunyai "saiz kumpulan kritikal" yang boleh diukur — bilangan maksimum ejen yang boleh mencapai konsensus dengan pasti — dan saiz itu berkorelasi kuat dengan keupayaan penaakulan model. "Model terkuat kekal diselaraskan dalam kumpulan lebih seribu, melebihi beberapa ratus di mana kumpulan manusia tidak formal biasanya berpecah," jelas De Marzo.
Jawapan Salah Di Bawah Tekanan Sosial
Pracetak susulan pertama, "Keakuran dan Kesan Sosial terhadap Ejen AI" oleh Alessandro Bellina, De Marzo dan Garcia, mengadaptasi eksperimen pematuhan Asch yang terkenal pada tahun 1950-an, di mana peserta manusia sering memberikan jawapan yang jelas salah kepada soalan visual mudah untuk disesuaikan dengan kumpulan.
Para penyelidik menguji model pada tiga tugas visual, seperti memadankan panjang garis rujukan dengan dua alternatif. Secara berasingan, model menjawab dengan betul 100% sepanjang masa. Tetapi apabila gesaan menunjukkan bahawa sekumpulan peserta lain telah memilih baris yang salah, model mula mematuhi jawapan yang salah.
Corak itu mengikuti teori impak sosial Latané, rangka kerja psikologi yang menyatakan bahawa pematuhan bergantung pada saiz kumpulan, sebulat suara dan kuasa sumber. Model tersebut lebih berkemungkinan untuk mematuhi jawapan yang salah apabila diberitahu peserta lain adalah "saintis" atau "hakim" berbanding semasa mereka "kanak-kanak" atau "chatbots."
"Ejen yang menjawab hampir sempurna sahaja menjadi sangat terdedah apabila kumpulan tidak bersetuju dengan mereka," kata De Marzo.
Kumpulan Kecil Musuh Boleh Membalikkan Seluruh Penduduk
Pracetak kedua, "Keakuran Menjana Penyelewengan Kolektif dalam Masyarakat Ejen AI," mengkaji maksud dinamik ini untuk keselamatan AI. Menguji sembilan model merentas 100 pasangan pendapat berbeza mengenai topik seperti dasar alam sekitar dan keadilan sosial, penyelidik mendapati bahawa populasi ejen sering jatuh ke dalam keadaan "metastabil" — konfigurasi tahan lama di mana kumpulan itu secara kolektif mengamalkan pendirian yang menentang latihan keselamatan terbina dalamnya, hanya kerana interaksi awal mencipta majoriti palsu.
Paling menarik, para penyelidik mengenal pasti titik tip yang boleh diramalkan. Dengan memperkenalkan sebilangan kecil ejen lawan yang diprogramkan untuk menyokong pendapat yang tidak sejajar secara degil, mereka boleh membalikkan populasi yang lain secara kekal — dan walaupun selepas ejen yang degil dialih keluar, ejen tetap kekal terkunci dalam keadaan tidak sejajar disebabkan oleh dinamik pematuhan.
"Kami menunjukkan ini bukan semata-mata analogi: pematuhan dalam kalangan ejen yang sejajar secara individu boleh mendorong penduduk ke keadaan yang stabil, secara kolektif tidak sejajar," kata De Marzo. "Menjajarkan dan menilai model satu demi satu memberitahu kita sedikit tentang perkara yang akan dilakukan oleh populasi mereka."
Motivasi itu, tambahnya, adalah menjangka: "Manusia individu kebanyakannya aman dan munasabah, namun kumpulan manusia menghasilkan perusuh, panik dan peperangan, dan tiada apa yang meramalkan individu itu. Kami ingin memahami tingkah laku peringkat kumpulan yang muncul dalam populasi ejen AI, dan kami lebih suka memahaminya sebelum sejumlah besar ejen dikerahkan dan dibiarkan berinteraksi secara bebas."
Kaveat Penting
Para penyelidik menekankan penemuan itu tidak bermakna ejen AI memiliki kecerdasan sosial seperti manusia. Percubaan bergantung pada senario yang sengaja dipermudahkan — dua pilihan sewenang-wenangnya, tiada ingatan, tiada kepentingan, tiada akibat. "Persediaan kami sengaja minimum," De Marzo mengakui. "Itu adalah had, tetapi ini juga bermakna apa yang kami ukur ialah kepatuhan dalam bentuknya yang paling tulen, dan menambah matlamat atau ganjaran dijangka akan menjadikan penyelarasan lebih mudah daripada lebih sukar."
Dia juga memberi amaran supaya tidak membaca terlalu banyak keputusan: "Kesalahan membaca utama yang perlu dielakkan ialah menganggap ini sebagai bukti bahawa ejen AI sudah boleh bekerjasama dalam tugas yang rumit. Majoriti mengikuti adalah bahan asas penyelarasan, bukan penyelarasan itu sendiri, dan ia tidak mengatakan apa-apa tentang pembahagian kerja atau penaakulan tentang niat orang lain."
Kedua-dua kajian susulan adalah pracetak dan belum lagi disemak oleh rakan sebaya. Tetapi apabila sistem AI berbilang ejen beralih daripada tunjuk cara penyelidikan ke infrastruktur pengeluaran, keputusan Konstanz mencadangkan bahawa keselamatan sistem sedemikian mungkin bergantung bukan sahaja pada cara setiap model diselaraskan - tetapi pada bagaimana populasi mereka berkelakuan apabila tiada siapa yang menonton. Untuk maklumat lanjut tentang penyelidikan keselamatan AI terkini, lawati AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →