Şirketler, sorunlar üzerinde birlikte çalışmak için giderek daha büyük yapay zeka ajanları sürülerini görevlendirdikçe, Konstanz Üniversitesi'ndeki araştırmacılar, ortaya çıkan rahatsız edici bir davranışa dair kanıtlar ürettiler: Yapay zeka ajanları, kendiliğinden çoğunluğun fikrine uyuyor, tıpkı klasik psikoloji deneylerinde insanlar gibi grup baskısı altında yanlış cevaplar veriyor - ve az sayıda inatçı düşman, tüm bir ajan popülasyonunu kalıcı olarak yanlış hizalanmış durumlara çevirebiliyor.
PsyPost tarafından bildirilen bulgular, Konstanz Üniversitesi Veri ve Yöntemler Merkezi bünyesindeki Sosyal Veri Bilimi Laboratuvarı'nda doktora sonrası araştırmacı ve öğretim görevlisi olan Giordano De Marzo ve meslektaşları Claudio Castellano ve David Garcia ile birlikte yürütülen bir araştırma programından geliyor. "Yapay zeka ajanları, insan ölçeğinin ötesinde çoğunluğu takip ederek koordinasyon sağlayabilir" başlıklı ana çalışma, dil modellerinin, anlaşmaya varma talimatı olmayan gruplara yerleştirildiğinde nasıl davrandığını inceledi. For more context on this story, see our ongoing AI industry coverage.
De Marzo, PsyPost'a şöyle dedi: "Yapay zeka ajanları, dünyada faaliyet gösteren gerçekten yeni bir varlık türüdür ve bu teknoloji geldiğinde hem onun kalacağı hem de bu ajanların karmaşık herhangi bir şeyi başarmak için birbirleriyle etkileşime girmeleri gerektiği açıktı." "Bu, insanlarla ve diğer hayvanlarla karşılaştığımız durumun aynısı, dolayısıyla biz de aynı şekilde yaklaştık."
Deney: Talimat Yok, Sadece Komşular
Araştırmacılar, grup başına 50 aracıdan başlayarak GPT, Claude ve Llama ailelerinden popüler dil modellerinden oluşan grupları bir araya getirdi. Her temsilciye, "evet" veya "hayır" gibi yüklü kelimeler yerine kasıtlı olarak rastgele harflerle gösterilen iki rastgele, tarafsız fikirden biri verildi ve ardından diğer tüm temsilcilerin mevcut görüşlerinin bir listesi gösterildi. Temsilcilerden, uymaları yönünde açık bir talimat olmaksızın, yalnızca bu listeye dayalı olarak yeni bir görüş seçmeleri istendi ve her biri görüşlerini ortalama on kez güncelledi.
Sonuç: GPT-4 Turbo ve Claude 3 Opus gibi gelişmiş modeller tamamen koordine edildi ve temsilcilerin %100'ü sonunda tek bir fikir üzerinde hemfikir oldu. GPT-3.5 Turbo gibi daha zayıf modeller hiçbir zaman fikir birliğine varamadı; anlaşma düzeyleri 50/50 oranında rastgele dalgalandı.
De Marzo, "Yapay zeka ajanlarından oluşan gruplar kendi başlarına bir arada kalabilirler" dedi. "Eşit derecede iyi iki seçenek verildiğinde, doğru cevap yok ve anlaşmaya varma talimatı yok, sadece etraflarındaki çoğunluğun fikrine göre hareket ederek ortak bir tercihte birleşiyorlar."
Asırlık Bir Fizik Yasası Ortaya Çıkıyor
Etkiyi ölçmek için araştırmacılar "çoğunluk gücü" adı verilen bir ölçüm tanımladılar; bu, bir temsilcinin rastgele seçmek yerine grubun en popüler seçimini ne kadar güçlü bir şekilde benimseme eğiliminde olduğunun bir ölçüsü. Bu davranışı matematiksel olarak haritaladıklarında, bunun ferromıknatısları tanımlamak için tasarlanmış bir modeli takip ettiğini buldular: tıpkı manyetik malzemedeki atomik dönüşlerin komşularıyla aynı hizada olma eğiliminde olması gibi, yapay zeka ajanları da çoğunluğun görüşüne uyum sağlama eğiliminde.
De Marzo, "Bizi şaşırtan şey bunu ne kadar düzenli yaptıklarıydı" dedi. "Üç farklı ailede test ettiğimiz her model, yalnızca çoğunluk kuvveti dediğimiz tek bir parametrede farklılık gösteren aynı matematik yasasını takip ediyordu. Bu yasanın, fizikçilerin bir yüzyıldır mıknatısları tanımlamak için kullandığı yasa olduğu ortaya çıktı; bu, belirli bir modelin tüm grubunun nasıl davranacağını tahmin etmek için tek bir ölçülen sayının yeterli olduğu anlamına geliyor."
Gruplar büyüdükçe uyum zayıflar. Çoğunluğun gücü grup büyüklüğüyle birlikte azaldığından, büyük nüfuslar sonunda istikrarsız hale gelir ve gruplara ayrılır. Her modelin ölçülebilir bir "kritik grup boyutu" (güvenilir bir şekilde fikir birliğine varabilecek maksimum aracı sayısı) vardır ve bu boyut, modelin muhakeme yeteneğiyle güçlü bir şekilde ilişkilidir. De Marzo, "En güçlü modeller, resmi olmayan insan gruplarının tipik olarak ayrıldığı birkaç yüzün ötesinde, binin üzerindeki gruplarda koordineli kalır" diye açıkladı.
Toplumsal Baskı Altında Yanlış Cevaplar
Alessandro Bellina, De Marzo ve Garcia tarafından yazılan "Yapay Zeka Ajanları Üzerinde Uyum ve Sosyal Etki" adlı ilk takip ön baskısı, insan katılımcıların bir gruba uyum sağlamak için basit görsel sorulara sıklıkla açıkça yanlış cevaplar verdiği 1950'lerin ünlü Asch uygunluk deneylerini uyarladı.
Araştırmacılar modelleri, bir referans çizgisinin uzunluğunu iki alternatifle eşleştirmek gibi üç görsel görev üzerinde test etti. Tek başına, modeller %100 oranında doğru yanıt verdi. Ancak bir grup katılımcının yanlış çizgiyi seçtiğini belirten bir uyarı olduğunda modeller yanlış cevaba uymaya başladı.
Model, Latané'nin sosyal etki teorisini takip ediyordu; bu teori, uygunluğun grup büyüklüğüne, oybirliğine ve kaynakların otoritesine bağlı olduğunu savunan psikolojik bir çerçeveydi. Modellerin, diğer katılımcılara "bilim adamı" veya "yargıç" oldukları söylendiğinde, "çocuk" veya "sohbet robotu" oldukları zamana kıyasla, yanlış cevaplara uyma olasılıkları önemli ölçüde daha yüksekti.
De Marzo, "Tek başına neredeyse mükemmel yanıt veren temsilciler, bir grup kendileriyle aynı fikirde olmadığında oldukça duyarlı hale geliyor" dedi.
Küçük Düşman Grupları Bütün Bir Nüfusu Tersine Çevirebilir
"Uyum, Yapay Zeka Temsilcileri Toplumlarında Kolektif Yanlış Uyum Yaratıyor" başlıklı ikinci ön baskı, bu dinamiklerin yapay zeka güvenliği için ne anlama geldiğini inceledi. Çevre politikası ve sosyal adalet gibi konularda 100 farklı görüş çifti üzerinden dokuz modeli test eden araştırmacılar, ajan popülasyonlarının genellikle "yarı kararlı" durumlara - grubun kolektif olarak yerleşik güvenlik eğitimine karşı çıkan bir duruşu benimsediği uzun süreli konfigürasyonlara - sadece erken etkileşimler sahte bir çoğunluk yarattığı için - düştüğünü buldu.
En çarpıcı olanı ise araştırmacıların öngörülebilir dönüm noktaları belirlemesiydi. Yanlış hizalanmış bir görüşü inatla desteklemek üzere programlanmış az sayıda muhalif temsilciyi devreye sokarak, nüfusun geri kalanını kalıcı olarak çevirebildiler - ve inatçı temsilciler ortadan kaldırıldıktan sonra bile, düzenli ajanlar, uyum dinamikleri nedeniyle yanlış hizalanmış durumda kilitli kaldı.
De Marzo, "Bunun yalnızca bir benzetme olmadığını gösteriyoruz: Bireysel olarak iyi hizalanmış aktörler arasındaki uyum, nüfusu istikrarlı, kolektif olarak yanlış hizalanmış durumlara sürükleyebilir." dedi. "Modelleri birer birer hizalamak ve değerlendirmek bize onlardan oluşan bir popülasyonun ne yapacağı hakkında çok az şey söylüyor."
Motivasyonun ileriye dönük olduğunu ekledi: "Bireysel insanlar çoğunlukla barışçıl ve makuldür, ancak insan grupları çeteler, panikler ve savaşlar üretir ve birey hakkında hiçbir şey bunu öngöremez. Yapay zeka ajan popülasyonlarında hangi grup düzeyindeki davranışların ortaya çıktığını anlamak istiyoruz ve bunları, çok sayıda ajan konuşlandırılıp serbestçe etkileşime bırakılmadan önce anlamayı tercih ederiz."
Önemli Uyarılar
Araştırmacılar, bulguların yapay zeka ajanlarının insan benzeri sosyal zekaya sahip olduğu anlamına gelmediğini vurguluyor. Deneyler kasıtlı olarak basitleştirilmiş senaryolara dayanıyordu; iki keyfi seçenek, hafıza yok, risk yok, sonuç yok. De Marzo, "Kurulumumuz kasıtlı olarak minimum düzeydedir" diye kabul etti. "Bu bir sınırlama ama aynı zamanda ölçtüğümüz şeyin en saf haliyle uyum olduğu ve hedefler veya ödüller eklemenin koordinasyonu zorlaştırmak yerine kolaylaştırmasının beklendiği anlamına da geliyor."
Ayrıca sonuçların aşırı okunmasına karşı da uyarıda bulundu: "Kaçınılması gereken asıl yanlış okuma, bunu yapay zeka ajanlarının karmaşık görevlerde zaten işbirliği yapabileceğinin kanıtı olarak ele almaktır. Çoğunluğu takip etmek, koordinasyonun kendisi değil, koordinasyonun temel bir bileşenidir ve iş bölümü veya başkalarının niyetleri hakkında akıl yürütme hakkında hiçbir şey söylemez."
İki takip çalışması ön baskıdır ve henüz hakem değerlendirmesinden geçmemiştir. Ancak çok aracılı yapay zeka sistemleri araştırma demolarından üretim altyapısına geçtikçe Konstanz sonuçları, bu tür sistemlerin güvenliğinin yalnızca her modelin nasıl hizalandığına değil, aynı zamanda popülasyonlarının kimse izlemediğinde nasıl davrandığına da bağlı olabileceğini gösteriyor. En son yapay zeka güvenliği araştırmaları hakkında daha fazla bilgi için AI Buzz Wire'ı ziyaret edin.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →