कंपन्या एकत्रितपणे समस्यांवर काम करण्यासाठी एआय एजंट्सचे नेहमीच मोठे झुंड तैनात करत असताना, कॉन्स्टँझ विद्यापीठातील संशोधकांनी अस्वस्थ वर्तनाचे पुरावे सादर केले आहेत: एआय एजंट उत्स्फूर्तपणे बहुसंख्य मतांचे पालन करतात, क्लासिक मानसशास्त्र प्रयोगातील मानवांप्रमाणेच गटाच्या दबावाखाली चुकीची उत्तरे देतात - आणि कमी संख्येने जाहिराती कायमस्वरूपी लोकसंख्येमध्ये बदलू शकतात. चुकीची राज्ये.
सायपोस्टने नोंदवलेले निष्कर्ष, कोन्स्टान्झ विद्यापीठातील सेंटर फॉर डेटा अँड मेथड्समधील सोशल डेटा सायन्स लॅबमधील पोस्टडॉक्टरल संशोधक आणि लेक्चरर जिओर्डानो डी मार्झो यांच्या नेतृत्वाखालील संशोधन कार्यक्रमातून आले आहेत, क्लॉडिओ कॅस्टेलानो आणि डेव्हिड गार्सिया यांच्या सहकार्यांसह. मुख्य अभ्यास, "AI एजंट बहुसंख्य-अनुसरणाद्वारे समन्वय साधू शकतात-मानवी प्रमाणाबाहेर" या शीर्षकाच्या मुख्य अभ्यासात, सहमत होण्याच्या सूचना नसलेल्या गटांमध्ये ठेवल्यावर भाषा मॉडेल कसे वागतात याचे परीक्षण केले. For more context on this story, see our ongoing AI news.
"एआय एजंट्स ही जगात काम करणारी एक वास्तविक नवीन प्रकारची संस्था आहे आणि जेव्हा हे तंत्रज्ञान आले तेव्हा ते कायम राहील आणि या एजंटांना कोणतीही गुंतागुंतीची गोष्ट पूर्ण करण्यासाठी एकमेकांशी संवाद साधावा लागेल हे स्पष्ट होते," डी मार्झो यांनी सायपोस्टला सांगितले. "आम्ही मानव आणि इतर प्राण्यांच्या बाबतीत हीच परिस्थिती आहे, म्हणून आम्ही त्याच प्रकारे संपर्क साधला."
प्रयोग: कोणतीही सूचना नाही, फक्त शेजारी
संशोधकांनी GPT, क्लॉड आणि लामा कुटुंबातील लोकप्रिय भाषा मॉडेलचे गट एकत्र केले, ज्याची सुरुवात प्रत्येक गटात 50 एजंट्सपासून होते. प्रत्येक एजंटला दोन यादृच्छिक, तटस्थ मतांपैकी एक नियुक्त केले गेले - "होय" किंवा "नाही" सारख्या लोड केलेल्या शब्दांऐवजी मुद्दाम यादृच्छिक अक्षरे म्हणून प्रस्तुत केले गेले - आणि नंतर इतर सर्व एजंटांच्या वर्तमान मतांची सूची दर्शविली. एजंट्सना केवळ त्या सूचीवर आधारित नवीन मत निवडण्यास सांगितले गेले, ज्याचे पालन करण्याची कोणतीही स्पष्ट सूचना नाही, प्रत्येकी सरासरी दहा वेळा त्यांचे मत अद्यतनित केले.
परिणाम: GPT-4 Turbo आणि Claude 3 Opus सारखी प्रगत मॉडेल्स पूर्णपणे समन्वयित आहेत, 100% एजंट शेवटी एकाच मतावर सहमत आहेत. GPT-3.5 टर्बो सारख्या कमकुवत मॉडेल्समध्ये कधीही एकमत झाले नाही — त्यांच्या कराराची पातळी 50/50 स्प्लिटच्या आसपास यादृच्छिकपणे चढ-उतार झाली.
"एआय एजंटचे गट स्वतःच एकत्र राहू शकतात," डी मार्झो म्हणाले. "दोन तितकेच चांगले पर्याय दिलेले, कोणतेही बरोबर उत्तर आणि सहमती दर्शविण्याची कोणतीही सूचना नाही, ते फक्त त्यांच्या सभोवतालच्या बहुसंख्य लोकांचे जे काही आहे ते अनुसरण करून सामायिक निवडीवर एकत्रित होतात."
एक शतक-जुना भौतिकशास्त्र कायदा उदयास आला
परिणामाचे प्रमाण निश्चित करण्यासाठी, संशोधकांनी "बहुसंख्य शक्ती" नावाचे मेट्रिक परिभाषित केले - एजंट यादृच्छिकपणे निवडण्याऐवजी गटाची सर्वात लोकप्रिय निवड किती जोरदारपणे स्वीकारतो याचे एक माप. जेव्हा त्यांनी हे वर्तन गणितीयरित्या मॅप केले तेव्हा त्यांना आढळले की ते मूळत: फेरोमॅग्नेट्सचे वर्णन करण्यासाठी डिझाइन केलेल्या मॉडेलचे अनुसरण करते: ज्याप्रमाणे चुंबकीय सामग्रीमधील अणू स्पिन त्यांच्या शेजाऱ्यांशी संरेखित करतात, त्याचप्रमाणे AI एजंट बहुसंख्य मतानुसार संरेखित करतात.
"आम्हाला आश्चर्य वाटले की त्यांनी ते किती समानतेने केले," डी मार्झो म्हणाले. "आम्ही तपासलेल्या प्रत्येक मॉडेलने, तीन वेगवेगळ्या कुटुंबांमध्ये, समान गणितीय कायद्याचे पालन केले, केवळ एका पॅरामीटरमध्ये फरक आहे, ज्याला आपण बहुसंख्य बल म्हणतो. तो नियम असा निघाला की भौतिकशास्त्रज्ञांनी चुंबकाचे वर्णन करण्यासाठी शतकानुशतके वापरले आहे, याचा अर्थ दिलेल्या मॉडेलचा संपूर्ण गट कसा वागेल हे सांगण्यासाठी एकच मोजलेली संख्या पुरेशी आहे."
जसजसे गट वाढतात तसतसे अनुरूपता कमकुवत होते. बहुसंख्य शक्ती गटाच्या आकारासह कमी होत असल्याने, मोठी लोकसंख्या अखेरीस अस्थिर होते आणि गटांमध्ये विभागली जाते. प्रत्येक मॉडेलमध्ये मोजता येण्याजोगा "गंभीर गट आकार" असतो — एजंट्सची कमाल संख्या जी विश्वासार्हपणे सहमतीपर्यंत पोहोचू शकते — आणि तो आकार मॉडेलच्या तर्कशक्तीच्या क्षमतेशी जोरदारपणे संबंधित असतो. "सर्वात मजबूत मॉडेल्स हजाराहून अधिक गटांमध्ये समन्वित राहतात, काही शंभराच्या पलीकडे ज्यात अनौपचारिक मानवी गट विशेषत: वेगळे होतात," डी मार्झो यांनी स्पष्ट केले.
सामाजिक दबावाखाली चुकीची उत्तरे
अलेस्सांद्रो बेलिना, डी मार्जो आणि गार्सिया यांच्या "एआय एजंट्सवर अनुरूपता आणि सामाजिक प्रभाव" या पहिल्या फॉलो-अप प्रीप्रिंटने 1950 च्या दशकातील प्रसिद्ध Asch अनुरूपता प्रयोगांचे रुपांतर केले, ज्यामध्ये मानवी सहभागींनी समूहात बसण्यासाठी साध्या दृश्य प्रश्नांना स्पष्टपणे चुकीची उत्तरे दिली.
संशोधकांनी तीन व्हिज्युअल कार्यांवर मॉडेल्सची चाचणी केली, जसे की दोन पर्यायांच्या विरूद्ध संदर्भ रेषेची लांबी जुळणे. एकाकीपणात, मॉडेल्सनी 100% वेळेस योग्य उत्तर दिले. परंतु जेव्हा प्रॉम्प्टने सूचित केले की इतर सहभागींच्या गटाने चुकीची ओळ निवडली आहे, तेव्हा मॉडेल चुकीच्या उत्तरास अनुरूप होऊ लागले.
पॅटर्नने लॅटनेच्या सामाजिक प्रभाव सिद्धांताचे पालन केले, एक मनोवैज्ञानिक फ्रेमवर्क ज्यामध्ये अनुरूपता गट आकार, एकमत आणि स्त्रोतांच्या अधिकारावर अवलंबून असते. जेव्हा इतर सहभागींना ते "मुले" किंवा "चॅटबॉट्स" होते त्यापेक्षा "शास्त्रज्ञ" किंवा "न्यायाधीश" असल्याचे सांगितले तेव्हा मॉडेल चुकीच्या उत्तरांना अनुरूप असण्याची शक्यता जास्त होती.
"ज्या एजंटला एकटे उत्तर देतात ते एजंट जेव्हा त्यांच्याशी सहमत नसतात तेव्हा ते अतिसंवेदनशील बनतात," डी मार्झो यांनी नमूद केले.
शत्रूंचे छोटे गट संपूर्ण लोकसंख्येला फ्लिप करू शकतात
दुसरी प्रीप्रिंट, "कन्फॉर्मिटी जनरेट्स कलेक्टिव्ह मिसलॅग्नमेंट इन एआय एजंट सोसायटीज," AI सुरक्षिततेसाठी या डायनॅमिक्सचा अर्थ काय आहे हे तपासले. पर्यावरणीय धोरण आणि सामाजिक न्याय यांसारख्या विषयांवर 100 भिन्न मतांच्या जोड्यांमध्ये नऊ मॉडेल्सची चाचणी करताना, संशोधकांना आढळले की एजंट लोकसंख्या बहुतेक वेळा "मेटास्टेबल" स्थितींमध्ये येते - दीर्घकाळ टिकणारी कॉन्फिगरेशन ज्यामध्ये गट एकत्रितपणे त्याच्या अंगभूत सुरक्षा प्रशिक्षणाला विरोध करणारी भूमिका स्वीकारतो, फक्त सुरुवातीच्या परस्परसंवादामुळे खोटे बहुमत निर्माण झाले.
सर्वात आश्चर्यकारकपणे, संशोधकांनी अंदाज लावता येण्याजोगे टिपिंग पॉइंट्स ओळखले. चुकीच्या मताला हट्टीपणे समर्थन देण्यासाठी प्रोग्रॅम केलेले काही विरोधक एजंट्स सादर करून, ते उर्वरित लोकसंख्येला कायमस्वरूपी पलटवू शकतात — आणि हट्टी एजंट काढून टाकल्यानंतरही, नियमित एजंट अनुरूपतेच्या गतिशीलतेमुळे चुकीच्या स्थितीत लॉक केलेले राहिले.
"आम्ही दाखवतो की हे केवळ एक साधर्म्य नाही: वैयक्तिकरित्या सु-संरेखित एजंट्समधील अनुरूपता लोकसंख्येला स्थिर, सामूहिकरित्या चुकीच्या स्थितीत आणू शकते," डी मार्झो म्हणाले. "एकावेळी मॉडेलचे संरेखन करणे आणि त्यांचे मूल्यमापन करणे आम्हाला त्यांच्यातील लोकसंख्या काय करेल याबद्दल थोडेसे सांगते."
प्रेरणा, त्यांनी जोडले, आगाऊ आहे: "वैयक्तिक मानव बहुतेक शांत आणि वाजवी असतात, तरीही मानवी गट जमाव, दहशत आणि युद्धे निर्माण करतात आणि व्यक्तीबद्दल काहीही असे भाकीत करत नाही. एआय एजंट लोकसंख्येमध्ये कोणते गट-स्तरीय वर्तन उदयास येते हे आम्हाला समजून घ्यायचे आहे आणि मोठ्या संख्येने एजंट्स मुक्तपणे तैनात होण्याआधी आणि त्यांच्याशी संवाद साधण्यासाठी आम्ही त्याऐवजी समजून घेऊ."
महत्वाच्या सूचना
संशोधक निष्कर्षांवर जोर देतात याचा अर्थ एआय एजंट्सकडे मानवासारखी सामाजिक बुद्धिमत्ता आहे असे नाही. प्रयोग जाणीवपूर्वक सरलीकृत परिस्थितींवर अवलंबून होते - दोन अनियंत्रित पर्याय, कोणतीही मेमरी नाही, कोणतेही दावे नाहीत, कोणतेही परिणाम नाहीत. "आमचा सेटअप मुद्दाम कमी आहे," डी मारझोने कबूल केले. "ही एक मर्यादा आहे, परंतु याचा अर्थ असा आहे की आम्ही जे मोजले ते त्याच्या शुद्ध स्वरूपातील अनुरूपता आहे आणि लक्ष्य किंवा बक्षिसे जोडणे कठीण होण्याऐवजी समन्वय सुलभ करणे अपेक्षित आहे."
त्यांनी परिणामांचे ओव्हररीडिंग विरुद्ध चेतावणी देखील दिली: "एआय एजंट आधीच जटिल कार्यांमध्ये सहयोग करू शकतात याचा पुरावा म्हणून हे टाळण्यासाठी मुख्य चुकीचे वाचन करणे आहे. बहुसंख्य-अनुसरण हा समन्वयाचा मूलभूत घटक आहे, स्वतः समन्वय नाही, आणि ते श्रम विभाजन किंवा इतरांच्या हेतूबद्दल तर्क करण्याबद्दल काहीही सांगत नाही."
दोन फॉलो-अप अभ्यास प्रीप्रिंट आहेत आणि अद्याप समवयस्क-पुनरावलोकन केलेले नाहीत. परंतु मल्टी-एजंट एआय सिस्टीम संशोधन डेमोमधून उत्पादन पायाभूत सुविधांकडे जाताना, कॉन्स्टँझ परिणाम सूचित करतात की अशा प्रणालींची सुरक्षा केवळ प्रत्येक मॉडेल कसे संरेखित केले जाते यावर अवलंबून नाही - परंतु कोणीही पाहत नसताना त्यांची लोकसंख्या कशी वागते यावर अवलंबून असू शकते. नवीनतम AI सुरक्षितता संशोधनाबद्दल अधिक माहितीसाठी, AI Buzz Wire ला भेट द्या.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →