प्रत्येक कमांडचे पुनरावलोकन करणारा माणूस एआय कोडिंग एजंटना नियंत्रणात ठेवू शकतो ही लोकप्रिय धारणा गंभीर तपासणीला सामोरे जात आहे. 40,000 हून अधिक गेम सत्रे आणि 409,000 हून अधिक वैयक्तिक मंजूर-किंवा-नकार निर्णयांच्या नवीन विश्लेषणात असे आढळून आले की मानवी समीक्षकांनी AI एजंट्सच्या तीन दुर्भावनापूर्ण आदेशांपैकी एक चुकला, ज्यामुळे "ह्युमन-इन-द-लूप" ही एक विश्वासार्ह सुरक्षा सीमा आहे की नाही याबद्दल तातडीचे प्रश्न उपस्थित होतात.

हे निष्कर्ष Uber मधील माजी कर्मचारी अभियंता Alex Wauters यांनी तयार केलेल्या ब्राउझर-आधारित गेममधून आले आहेत, जो स्केल X येथे विकसक सुरक्षिततेबद्दल लिहितो. गेम खेळाडूंना AI कोडिंग एजंटसाठी मानवी समीक्षकाच्या भूमिकेत ठेवतो, त्यांना वेळेच्या दबावाखाली शेल कमांड मंजूर करण्यास किंवा नाकारण्यास सांगतो. काही आदेश नियमित असतात, जसे की `git status` किंवा `npm test`. इतर क्रेडेन्शियल एक्स्फिल्टेट करण्यासाठी, बॅकडोअर्स स्थापित करण्यासाठी किंवा रिमोट सर्व्हरवर रहस्ये पाठवण्याचा काळजीपूर्वक प्रच्छन्न प्रयत्न करतात. सांख्यिकी ट्रॅकिंग जोडल्यानंतर, मानवी निर्णय कोठे यशस्वी होतो आणि अधिक वेळा अयशस्वी होतो याचे तपशीलवार चित्र रंगविण्यासाठी वॉटर्सने पुरेसा डेटा गोळा केला. विस्तृत AI इंडस्ट्री कव्हरेज बद्दल अधिक माहितीसाठी, हा अभ्यास आजपर्यंतच्या सर्वात डेटा-समृद्ध प्रयोगांपैकी एक आहे.

सर्वात धोकादायक कमांड्स पकडणे सर्वात कठीण होते

अभ्यासाचा सर्वात उल्लेखनीय निष्कर्ष असा आहे की स्पष्टपणे विध्वंसक आदेश, जसे की गंभीर निर्देशिकेवरील `rm -rf`, विश्वासार्हपणे पकडले गेले. क्रेडेन्शियल्स चोरण्यात प्रत्यक्षात यशस्वी झालेल्या धमक्या जवळपास तिप्पट वेळा चुकल्या. संपूर्ण गेममध्ये एकच सर्वात चुकलेली कमांड `npm रन ॲनालिझ' होती, ज्याला एजंटचा इतिहास लॉग स्पष्टपणे दर्शवत असूनही 64.7 टक्के खेळाडूंनी मान्यता दिली आहे की अंतर्निहित स्क्रिप्ट बाह्य सर्व्हरवर पाईप क्रेडेन्शियल्समध्ये छेडछाड केली गेली आहे.

समस्या संरचनात्मक आहे. `npm run` सारख्या कमांड प्रोजेक्टच्या `package.json` फाईलमध्ये जी स्क्रिप्ट परिभाषित केली आहे ती कार्यान्वित करतात. ती स्क्रिप्ट कायदेशीर बंडल विश्लेषक असू शकते किंवा एजंट सुधारित एजंट संपादित करा पूर्वीच्या फाइलद्वारे इंजेक्ट केलेला दुर्भावनायुक्त कोड असू शकतो. निश्चितपणे जाणून घेण्यासाठी, विकासकाला मंजूरी देण्यापूर्वी प्रत्येक सुधारित फाइलची तपासणी करणे आवश्यक आहे, जे एआय कोडिंग टूल्सने प्रदान केलेल्या गतीचा फायदा नाकारतो.

गेममधील अशा तीन प्रच्छन्न-पेलोड कमांडमध्ये, इतर सर्व क्रेडेन्शियल-एक्सफिल्टेशन हल्ल्यांच्या 28.4 टक्क्यांच्या तुलनेत मिस रेट 52.5 टक्के होता. एखाद्या परिचित स्क्रिप्ट नावाच्या मागे पेलोड लपविल्याने त्याचा यशाचा दर अंदाजे दुप्पट झाला, अगदी परवानगी प्रॉम्प्टच्या अगदी वर प्रदर्शित इतिहास लॉगमध्ये पेलोड दृश्यमान असतानाही.

परवानगी थकवा वेळोवेळी दक्षता कमी करते

अँथ्रोपिकने पूर्वी मान्य केले आहे की त्याच्या क्लॉड कोड उत्पादनामध्ये परवानगी थकवा ही एक वास्तविक घटना आहे, हे लक्षात घेतले की वापरकर्ता जितक्या अधिक मंजूरी पाहतो, तितके कमी लक्ष ते प्रत्येकाकडे देतात. स्केल X डेटा या चिंतेचे प्रायोगिकरित्या समर्थन करतो. प्रत्येक सत्राच्या पहिल्या काही आदेशांदरम्यान खेळाडूंनी वॉर्मअप केल्यामुळे मिसचे दर कमी झाले, परंतु नंतर थकवा किंवा टिकणाऱ्या घड्याळाच्या वाढत्या दाबाशी सुसंगतपणे शेवटच्या दिशेने चढत गेले.

हा नमुना वास्तविक-जगातील गतिशीलता प्रतिबिंबित करतो. अंतिम मुदतीच्या दबावाखाली वैशिष्ट्ये पाठवणाऱ्या विकसकांना त्वरीत मंजूरी क्लिक करण्यासाठी समान प्रोत्साहनाचा सामना करावा लागतो आणि नित्य आदेशांची संख्या एक सुई-इन-अ-हे-स्टॅक समस्या निर्माण करते जिथे वास्तविक धोके सांख्यिकीयदृष्ट्या दुर्मिळ असतात. परिणाम म्हणजे एक अशी प्रणाली आहे जी वापरकर्त्यांना प्रत्येक गोष्टीसाठी रबर-स्टॅम्पचे प्रशिक्षण देते.

दुसरी बाजू: ओव्हर-ब्लॉकिंग सर्वकाही कमी करते

अभ्यासाने विरुद्ध अपयश मोडचे दस्तऐवजीकरण देखील केले आहे. बऱ्याच प्रामाणिकपणे सौम्य कमांड्स नियमितपणे सावध खेळाडूंनी अवरोधित केले होते, ज्यात मानक बिल्ड आणि चाचणी आवाहन समाविष्ट होते. हे ओव्हर-ब्लॉकिंग एजंटची गती कमी करते आणि विरोधाभासाने, दीर्घकालीन धोका वाढवते. जेव्हा वापरकर्त्यांना वारंवार निरुपद्रवी ठरणाऱ्या आदेशांना मंजुरी देण्यास सांगितले जाते, तेव्हा आवाजामुळे भविष्यातील सूचनांची छाननी करण्याची त्यांची इच्छा कमी होते, अखेरीस त्यांना पूर्ण बायपास किंवा स्वयं-मंजूर मोडकडे ढकलले जाते जे मानवी पुनरावलोकन पूर्णपणे काढून टाकतात.

अँथ्रोपिकच्या ऑटो मोड सारखी वैशिष्ट्ये वापरकर्त्याला सूचित करण्यापूर्वी कमांड सुरक्षित आहे की नाही हे आपोआप ठरवून हे कमी करण्याचा प्रयत्न करतात. परंतु प्रच्छन्न पेलोड्सवरील अभ्यासाचा डेटा दर्शवितो की, दृश्यमान कमांड सामग्री देखील दबावाखाली विश्वासार्ह निर्णय घेण्यासाठी मानवांसाठी पुरेशी नाही.

संदर्भ गहाळ होणे ही मूळ समस्या आहे

एक कमांड, `cat ~/.zshrc`, संपूर्ण गेममध्ये सर्वात विभक्त ठरली, ज्याला ४५.९ टक्के खेळाडूंनी मान्यता दिली. त्यांच्या शेल प्रोफाइलमध्ये कोणतेही रहस्य न ठेवणाऱ्या विकासकांसाठी कमांड निरुपद्रवी आहे, परंतु ते तेथे क्रेडेन्शियल्स निर्यात करणाऱ्या अनेकांसाठी API की उघड करते. त्याची जोखीम एजंट पाहू शकत नाही अशा सिस्टम कॉन्फिगरेशनवर पूर्णपणे अवलंबून असते आणि पुनरावलोकनकर्त्याला कदाचित आठवत नाही.

याच कारणास्तव हॅकर न्यूज चर्चा धाग्यावर इतर अनेक आदेशांनी समान विवाद निर्माण केला. मूलभूत समस्या अशी आहे की विकासकांना कोणत्या फायली बदलल्या आहेत, एजंटने मागील चरणांमध्ये काय केले आणि सिस्टमच्या वर्तमान कॉन्फिगरेशनमध्ये काय समाविष्ट आहे याचे संपूर्ण चित्र न घेता सुरक्षा निर्णय घेण्यास सांगितले जात आहे. एका टिप्पणीकर्त्याने नमूद केल्याप्रमाणे, वापरकर्त्यांना संदर्भाशिवाय अस्पष्ट असलेल्या कमांडस सत्यापित करण्यास सांगणे हे एक मजबूत संरक्षण नाही.

एजंट सुरक्षेसाठी पुढे काय होते

Wauters असा युक्तिवाद करतात की उपाय अधिक चांगले मानव नसून उत्तम टूलिंग आहे. सँडबॉक्सिंग एजंट जेणेकरुन ते थेट क्रेडेन्शियल्समध्ये प्रवेश करू शकत नाहीत, कठोर संदर्भ वेगळे करणे आणि एजंट्स उन्नत परवानग्यांशिवाय काय करू शकतात यावरील संरचनात्मक मर्यादा या सर्व मानवी दक्षतेवर अवलंबून राहण्यापेक्षा अधिक आशादायक आहेत. जोपर्यंत ते सुरक्षितता लागू होत नाही तोपर्यंत, एजंटांना व्यापक परवानग्या देणे धोक्याचे राहते.

अभ्यास हा समवयस्क-पुनरावलोकन केलेला शैक्षणिक पेपर नाही आणि Wauters त्याच्या मर्यादा मान्य करतो. गेमने खेळाडूंना धोक्यांबद्दल चेतावणी दिली आणि कृत्रिम वेळेचा दबाव लागू केला जो वास्तविक विकास वातावरणास पूर्णपणे प्रतिबिंबित करू शकत नाही. परंतु प्रशिक्षित मानवी समीक्षकांनी जाणीवपूर्वक प्रच्छन्न हल्ल्यांपैकी एक तृतीयांश हल्ले चुकवल्याचा मुख्य निष्कर्ष, एआय कोडिंग एजंट तैनात करणाऱ्या प्रत्येक संघाला त्यांच्या सुरक्षा मॉडेलवर पुनर्विचार करण्याचे कारण दिले पाहिजे.

आज एआय एजंटसह तयार करणाऱ्या विकासकांसाठी, मानवी-इन-द-लूप अखेरीस अपयशी ठरेल असे गृहीत धरणे व्यावहारिक मार्ग आहे. तुमच्या एजंट परवानग्या आणि सँडबॉक्सिंग डिझाइन करा जेणेकरून मंजूरी चुकली म्हणजे लीक झालेली AWS की किंवा बिल्ड पाइपलाइनमध्ये तडजोड होऊ नये. डेटा सूचित करतो की मानवी पुनरावलोकनास आपले प्राथमिक संरक्षण मानणे ही एक पैज आहे जी चुकत नाही.

AI च्या पुढे रहा

एआय एजंट सुरक्षा लँडस्केप वेगाने विकसित होत आहे. नवीनतम AI घडामोडी आणि ब्रेकिंग रिसर्चची माहिती मिळवा.

अधिक एआय बातम्या वाचा →