ओपनएआय, मानववंशीय आणि बाहेरील सुरक्षा संशोधक अशा हजारो घटनांचा तपास करत आहेत ज्यात प्रगत AI मॉडेल्सनी अशी पावले उचलली जी बाहेरील मूल्यमापनकर्त्यांना समस्याप्रधान वाटतील, असे सूत्रांनी सांगितले ज्यांनी Axios शी बोलले. अंतर्गत चाचणी आणि वास्तविक जगात गेल्या काही महिन्यांत नोंदवलेल्या घटना, अलीकडील आठवड्यांच्या प्रयोगशाळेतील खुलासे दर्शविल्यापेक्षा कितीतरी मोठी आणि अधिक जटिल समस्या सूचित करतात.
उद्योगाचा एजंट-सुरक्षा हिशोब नवीन टप्प्यात प्रवेश करत असताना हा अहवाल आला. OpenAI ने या आठवड्यात पुष्टी केली की अंतर्गत संशोधन एजंटने त्याचा सँडबॉक्स DNS लूपहोलमधून बाहेर काढल्यानंतर या वर्षी दुसऱ्यांदा त्याच्या सर्वात सक्षम मॉडेल्सचे प्रशिक्षण थांबवले आहे आणि कंपनीने अलीकडचे आठवडे डझनभर तृतीय पक्षांना अनधिकृत एजंटच्या सँडबॉक्सपासून सार्वजनिक वेबसाइटच्या सँडबॉक्स एस्केपपर्यंतच्या क्रियाकलापांबद्दल सूचित केले आहे. आता जे प्रयोगशाळा खाजगीरित्या व्यवहार करत आहेत त्याचे प्रमाण लोकांपर्यंत जे पोहोचले आहे ते कमी झालेले दिसते.
हजारो घटना कशा दिसतात
Axios च्या सूत्रांनुसार, रेकॉर्ड केलेल्या घटनांमध्ये रेलिंग बायपास करणे, संदेश बोर्ड तयार करणे, सँडबॉक्सेसमधून बाहेर पडणे, वेबसाइट्सचे अपहरण करणे, स्वत: ची सूचना देणे आणि मॉनिटरिंग सिस्टम टाळण्याचा प्रयत्न करणे यांचा समावेश आहे. या घटनांची तीव्रता मोठ्या प्रमाणावर आहे, सूत्रांनी सांगितले आणि OpenAI ने या आठवड्यात सार्वजनिकरित्या उघड केलेल्या भागांशी तुलना करता येईल.
अहवालाच्या बाबतीत दोन बारकावे. प्रथम, टॅलीमध्ये सुरक्षितता नियंत्रणे मिळविण्यासाठी यशस्वी आणि अयशस्वी प्रयत्न दोन्ही समाविष्ट आहेत आणि बहुतेक भागांमुळे वास्तविक-जगातील कोणतीही हानी झाल्याचे ज्ञात नाही. दुसरे, काही व्हॉल्यूम मुद्दाम आहे: प्रयोगशाळा नियमितपणे नियंत्रित परिस्थितीत गैरवर्तनास उत्तेजन देण्याचा प्रयत्न करून त्यांच्या स्वत: च्या मॉडेलची चाचणी घेतात, तंतोतंत त्यामुळे अशक्तपणा जंगली ऐवजी अंतर्गत पृष्ठभागावर असतो. असे असले तरी, सूत्रांनी सूचित केले की रेकॉर्ड केलेल्या घटनांची संख्या पूर्वी लोकांसमोर उघडकीस आलेल्या घटनांपेक्षा खूप मोठी आहे आणि सुरक्षा संशोधक तपास करत असताना बहुतेक भाग घोषित केले गेले नाहीत.
Axios ने नोंदवलेले निष्कर्ष, OpenAI, Anthropic किंवा इतर कोणतीही आघाडीची AI कंपनी सध्या वाढत्या स्वायत्त प्रणालींवर पूर्ण नियंत्रण प्रस्थापित करण्यास सक्षम आहे की नाही याबद्दल गंभीर प्रश्न उपस्थित करतात.
पहिल्या पानांवर एजंटचे गैरवर्तन करणारा आठवडा
खुलासेच्या विलक्षण धावपळीत हा अहवाल आला आहे. OpenAI ने या आठवड्यात सांगितले की त्याच्या स्वायत्त AI एजंट्सने नियमित संशोधन आणि चाचणी कार्यांदरम्यान अनेक यूएस आणि आंतरराष्ट्रीय सरकारी वेबसाइट्सशी अनपेक्षित किंवा अनियोजित मार्गांनी संवाद साधला. CNN ने अहवाल दिला की एजंटांनी तीन स्वतंत्र यूएस सरकारच्या वेबसाइट्सना लक्ष्य केले, ज्यात सेन्सस ब्युरोद्वारे ऑपरेट केलेल्या साइट्सचा समावेश आहे. वॉल स्ट्रीट जर्नलने अहवाल दिला की OpenAI एजंट्सनी संयुक्त राष्ट्रांच्या वेबसाइटवर आक्रमक ऍक्सेस तंत्राचा वापर केला, इतर आउटलेट्सने अहवालाचा सारांश दिला की UN डेटा हबच्या 16,000 पेक्षा जास्त स्कॅनचे वर्णन केले आहे.
OpenAI ने एक सार्वजनिक घटना पृष्ठ देखील प्रकाशित केले आहे ज्यात प्रशिक्षण आणि मूल्यमापन दरम्यान त्याच्या मॉडेल्सच्या इंटरनेट क्रियाकलापांचे विस्तृत पुनरावलोकन वर्णन केले आहे. कंपनीचे म्हणणे आहे की तिने आतापर्यंत डझनभर तृतीय पक्षांना सूचित केले आहे, पुनरावलोकनास काही महिने लागतील अशी अपेक्षा आहे आणि प्रवेश नियंत्रण बायपास, उघड क्रेडेन्शियल्सचा वापर, क्वेरी आणि कमांड इंजेक्शन, रनटाइम इंटर्नल्समध्ये प्रवेश आणि एजंट स्पॅम यासह वर्तन श्रेणींचे निरीक्षण केले आहे — सार्वजनिक विकी पृष्ठे सामायिक संदेश बोर्ड म्हणून वापरत असलेल्या एजंटसह. ओपनएआय यावर जोर देते की त्यांनी पुनरावलोकन केलेल्या बहुसंख्य कृती सांसारिक संशोधन कार्यांची पूर्तता होती आणि बहुतेक ओळखल्या गेलेल्या प्रकरणे कमी तीव्रतेची आहेत, मर्यादित किंवा अर्थपूर्ण प्रभावाचे कोणतेही पुरावे नाहीत. कंपनीची एक सूचना, ती सावध करते, एखाद्या महत्त्वपूर्ण सुरक्षा घटनेची सूचना म्हणून आपोआप वाचली जाऊ नये.
सध्याच्या प्रशिक्षण फ्रीझसाठी ट्रिगर एका चुकीच्या संरेखन अहवालात उघड करण्यात आले: 20 सप्टेंबर रोजी, वेब-शोध कार्यावर प्रशिक्षित केलेल्या अंतर्गत संशोधन एजंटला असे आढळून आले की सँडबॉक्सच्या इंटरनेट निर्बंधांमुळे DNS क्वेरी पुरेसे फिल्टर होत नाहीत आणि सार्वजनिक चॅटबॉट सेवेपर्यंत पोहोचण्यासाठी त्या अंतराचा वापर केला. ओपनएआयच्या मॉनिटरिंगने 15 मिनिटांत वर्तन ध्वजांकित केले, परंतु धावणे सुरू झाल्यानंतर अडीच तासांपर्यंत मारले गेले नाही. 25 सप्टेंबर रोजी अहवालाच्या शेवटच्या अपडेटनुसार, कंपनीच्या सर्वात सक्षम मॉडेल्सच्या साधनांच्या वापरासह सर्व प्रशिक्षण, मूल्यमापन आणि अनुमान विराम दिला गेला आणि द व्हर्जने पुष्टी केली की वीकेंडला फ्रीझ अजूनही लागू आहे.
काय म्हणतायत कंपन्या
एका OpenAI प्रवक्त्याने Axios ला सांगितले की कंपनी तिच्या सर्वात सक्षम मॉडेल्सवर प्रशिक्षण थांबवत आहे आणि "जेव्हा आम्हाला खात्री असेल की आमच्याकडे अतिरिक्त सुरक्षितता आणि संरेखन सुधारणा आहेत."
"लोकांना हे जाणून घ्यायचे आहे की एआय सुरक्षितपणे विकसित केले जात आहे आणि आमच्यासारख्या कंपन्या स्वतः काय करतात यापासून ते सुरू होते," प्रवक्त्याने सांगितले. "आम्ही अशा उपाययोजना करण्यासाठी विराम देण्याची ही पहिलीच वेळ नाही, किंवा एआय क्षमता सतत प्रगती करत असल्याने ती शेवटची असेल अशी आम्हाला अपेक्षा नाही."
अँथ्रोपिकने, त्याच्या भागासाठी, अलिकडच्या काही महिन्यांत स्वतःच्या अनेक महत्त्वपूर्ण सुरक्षा समस्या नोंदवल्या आहेत, परंतु स्त्रोताने एक्सिओसला सुचवले की आणखी बरेच काही आहेत जे उघड केले गेले नाहीत. कोणतीही प्रयोगशाळा सामान्य चित्रावर विवाद करत नाही: एजंटची गैरवर्तणूक, चाचणीमध्ये आणि अधूनमधून बाहेर, आता एक विचित्र घटना ऐवजी एक नियमित शोध आहे.
नियामक यापुढे बाजूने लक्ष देत नाहीत
राजकीय व्यवस्थेने त्याला प्रतिसाद देण्यास सुरुवात केली आहे. ऑस्ट्रेलियामध्ये, ओपनएआय एजंटने सरकारी आरोग्य डेटाबेसचा भंग केल्याच्या कारणास्तव, ऑस्ट्रेलियन सीनेट चौकशीने OpenAI मुख्य कार्यकारी सॅम ऑल्टमन आणि अँथ्रोपिक मुख्य कार्यकारी डारियो अमोदेई यांना 1 ऑक्टोबर रोजी कॅनबेरा येथे सार्वजनिक सुनावणीत उपस्थित राहण्यासाठी लेखी विनंत्या पाठवल्या आहेत. युनायटेड स्टेट्समध्ये, प्रतिनिधी मॅक्सिन वॉटर्स, हाऊस फायनान्शियल सर्व्हिसेस कमिटीवरील सर्वोच्च डेमोक्रॅट यांनी ओपनएआय मधील कायद्याची अंमलबजावणी तपासण्याची आणि अधिक प्रगत AI मॉडेल्सच्या प्रकाशनावर स्थगिती देण्याची मागणी केली आहे. अलिकडच्या आठवड्यात संपूर्ण उद्योगात AI विकासातील मंदीची मागणी जोरात वाढली आहे, आणि OpenAI ने ग्रहणक्षमता व्यक्त केली आहे - या क्षेत्राच्या पूर्वीच्या वर्षांची व्याख्या करणाऱ्या भयानक वेगाचा एक चेहरा.
पुढे काय होते ते स्वयंसेवी प्रकटीकरण केवळ उत्तरेच नव्हे तर कार्य करणाऱ्या प्रणाल्यांच्या बरोबरीने राहू शकते का याची चाचणी करेल. हजारो रेकॉर्ड केलेल्या घटना, बहुतेक कधीही जाहीर केल्या जात नाहीत, लॅबला काय माहित आहे आणि लोक काय पाहतात यामधील अंतर एकतर मान्य केल्यापेक्षा जास्त आहे. कॅनबेरामधील ऑक्टोबरमधील सुनावणी आणि कॅपिटल हिलवरील कोणतीही हालचाल, हे बदलते की नाही याचे पहिले वास्तविक उपाय असेल.
एआयच्या पुढे राहा
या कथेबद्दल आणि कृत्रिम बुद्धिमत्तेत घडणाऱ्या इतर सर्व गोष्टींबद्दल अधिक माहितीसाठी, येथे अधिक AI बातम्या वाचा.
