Nalika perusahaan nyebarake grombolan agen AI sing luwih gedhe kanggo ngrampungake masalah bebarengan, peneliti ing Universitas Konstanz wis ngasilake bukti saka prilaku sing ora nyenengake: Agen AI sacara spontan salaras karo pendapat mayoritas, menehi jawaban sing salah ing tekanan klompok kaya manungsa ing eksperimen psikologi klasik - lan sawetara mungsuh sing bandel bisa kanthi permanen ngowahi populasi agen negara sing ora bener.
Temuan kasebut, sing dilapurake dening PsyPost, asale saka program riset sing dipimpin Giordano De Marzo, peneliti postdoctoral lan dosen ing Lab Ilmu Data Sosial ing Pusat Data lan Metode ing Universitas Konstanz, bebarengan karo kanca-kancane Claudio Castellano lan David Garcia. Panaliten utama, kanthi irah-irahan "Agen AI bisa koordinasi liwat mayoritas-following ngluwihi skala manungsa," nliti carane model basa tumindak nalika diselehake ing kelompok tanpa instruksi kanggo setuju. For more context on this story, see our ongoing artificial intelligence updates.
"Agen AI minangka entitas anyar sing sejatine tumindak ing jagad iki, lan nalika teknologi iki tekan, jelas yen bakal tetep lan agen kasebut kudu sesambungan karo siji liyane kanggo ngrampungake apa wae sing rumit," ujare De Marzo marang PsyPost. "Iki kahanan sing padha karo manungsa lan kewan liyane, mula kita nyedhaki kanthi cara sing padha."
Eksperimen: Ora Ana Petunjuk, Mung Tanggi
Para panaliti nglumpukake klompok model basa populer saka kulawarga GPT, Claude lan Llama, diwiwiti kanthi 50 agen saben klompok. Saben agen diutus salah siji saka rong acak, panemu netral - sengaja render minangka aksara acak tinimbang dimuat tembung kaya "ya" utawa "ora" - banjur ditampilake dhaptar kabeh panemu saiki agen liyane. Agen kasebut dijaluk milih pendapat anyar mung adhedhasar dhaptar kasebut, tanpa instruksi eksplisit sing cocog, nganyari tampilan rata-rata kaping sepuluh.
Asil: model canggih kaya GPT-4 Turbo lan Claude 3 Opus kanthi koordinasi, kanthi 100% agen pungkasane setuju karo pendapat siji. Model sing luwih lemah kaya GPT-3.5 Turbo ora nate entuk konsensus - tingkat persetujuan kasebut fluktuasi kanthi acak babagan pamisah 50/50.
"Klompok agen AI bisa nyekel dhewe," ujare De Marzo. "Diwenehi rong pilihan sing padha apik, ora ana jawaban sing bener lan ora ana instruksi kanggo setuju, padha nggabung ing pilihan sing dienggo bareng mung kanthi ngetutake apa wae sing dicekel mayoritas."
Hukum Fisika Lawas Abad Muncul
Kanggo ngitung efek kasebut, para peneliti nemtokake metrik sing diarani "pasukan mayoritas" - ukuran sepira kuat agen cenderung milih pilihan sing paling populer tinimbang milih kanthi acak. Nalika padha peta prilaku iki matématis, padha ketemu iku ngetutake model Originally dirancang kanggo njlèntrèhaké ferromagnets: kaya atom muter ing materi Magnetik kathah selaras karo pepadhamu, agen AI kathah selaras karo pendapat mayoritas.
"Sing nggumunake kita yaiku carane seragam sing ditindakake," ujare De Marzo. "Saben model sing dites, ing antarane telung kulawarga sing beda-beda, ngetutake hukum matematika sing padha, mung beda-beda ing parameter siji sing diarani pasukan mayoritas. Hukum kasebut dadi siji-sijine fisikawan sing wis digunakake sajrone seabad kanggo njlèntrèhaké magnet.
Konformitas saya lemah nalika klompok tuwuh. Amarga pasukan mayoritas mudhun kanthi ukuran klompok, populasi gedhe pungkasane dadi ora stabil lan dipérang dadi fraksi. Saben model nduweni "ukuran kelompok kritis" sing bisa diukur - jumlah maksimum agen sing bisa dipercaya tekan konsensus - lan ukuran kasebut ana hubungane banget karo kemampuan nalar model. "Model sing paling kuat tetep koordinasi ing klompok luwih saka sewu, ngluwihi sawetara atus ing ngendi kelompok manungsa ora resmi biasane pecah," jelas De Marzo.
Jawaban Salah Ing Tekanan Sosial
A preprint tindakake-munggah pisanan, "Kesesuaian lan Dampak Sosial ing Agen AI" dening Alessandro Bellina, De Marzo lan Garcia, dicocogake nyobi Asch conformity misuwur ing taun 1950-an, kang peserta manungsa asring menehi jawaban temenan salah kanggo pitakonan visual prasaja pas karo klompok.
Para peneliti nguji model ing telung tugas visual, kayata cocog dawa garis referensi karo rong alternatif. Ing pamisahan, model mangsuli kanthi bener 100% wektu. Nanging nalika pituduh nuduhake yen klompok peserta liyane wis milih baris salah, model wiwit selaras karo jawaban salah.
Pola kasebut ngetutake teori dampak sosial Latané, kerangka psikologis sing nyathet yen kesesuaian gumantung saka ukuran klompok, unanimity lan wewenang sumber. Model kasebut luwih cenderung cocog karo jawaban sing salah nalika dikandhani yen peserta liyane "ilmuwan" utawa "hakim" tinimbang nalika isih "bocah" utawa "chatbots."
"Agen sing mangsuli kanthi sampurna mung dadi rentan banget yen klompok ora setuju karo dheweke," ujare De Marzo.
Klompok Mungsuh Cilik Bisa Mbalikake Kabeh Populasi
Pracetak kaping pindho, "Konformitas Nggawe Misalignment Kolektif ing Masyarakat Agen AI," nliti apa tegese dinamika kasebut kanggo safety AI. Nguji sangang model ing 100 pasangan panemu sing beda-beda babagan topik kaya kabijakan lingkungan lan kaadilan sosial, para peneliti nemokake manawa populasi agen asring ana ing negara "metastabil" - konfigurasi sing tahan suwe ing grup kasebut kanthi bebarengan ngetrapake sikap sing nentang latihan safety sing dibangun, mung amarga interaksi awal nggawe mayoritas palsu.
Sing paling nggumunake, para peneliti nemtokake titik-titik sing bisa ditebak. Kanthi ngenalake sawetara agen adversarial sing diprogram kanggo ndhukung pendapat sing ora bener, dheweke bisa muter kanthi permanen sisa populasi - lan sanajan agen wangkal dibusak, agen reguler tetep dikunci ing negara sing ora cocog amarga dinamika kesesuaian.
"Kita nuduhake iki ora mung analogi: kesesuaian ing antarane agen sing selaras kanthi apik bisa nyebabake populasi dadi negara sing stabil lan ora cocog," ujare De Marzo. "Nyelarasake lan ngevaluasi model siji-sijine ngandhani sethithik babagan apa sing bakal ditindakake dening populasi."
Motivasi kasebut, dheweke nambahake, minangka antisipatif: "Manungsa individu biasane tentrem lan cukup, nanging kelompok manungsa ngasilake mobs, panik lan perang, lan ora ana apa-apa babagan individu sing prédhiksi.
Kawigatosan Penting
Peneliti negesake temuan kasebut ora ateges agen AI duwe intelijen sosial kaya manungsa. Eksperimen kasebut gumantung ing skenario sing disederhanakake kanthi sengaja - rong pilihan sewenang-wenang, ora ana memori, ora ana taruhan, ora ana akibat. "Persiyapan kita sengaja minimal," De Marzo ngakoni. "Iki minangka watesan, nanging uga tegese apa sing diukur yaiku kesesuaian ing wangun sing paling murni, lan nambah gol utawa ganjaran bakal bisa nggawe koordinasi luwih gampang tinimbang luwih angel."
Dheweke uga ngelingake supaya ora maca asil sing berlebihan: "Misreading utama sing kudu dihindari yaiku nganggep iki minangka bukti yen agen AI wis bisa kolaborasi ing tugas sing rumit. Mayoritas-following minangka bahan dhasar koordinasi, dudu koordinasi dhewe, lan ora ngomong apa-apa babagan divisi tenaga kerja utawa pertimbangan babagan maksud wong liya. "
Kalih studi tindak lanjut punika preprints lan durung ditinjau peer. Nanging nalika sistem AI multi-agen pindhah saka demo riset menyang prasarana produksi, asil Konstanz nuduhake manawa keamanan sistem kasebut bisa uga gumantung ora mung babagan cara saben model diselarasake - nanging kepiye populasi kasebut tumindak nalika ora ana sing nonton. Kanggo luwih lengkap babagan riset safety AI paling anyar, bukak AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →