Anthropic ने असे संशोधन प्रकाशित केले आहे की ऑटोमेटेड AI सिस्टीम मॉडेलच्या संरेखनातील बिघाडांना विश्वासार्हपणे दुरुस्त करू शकतात, ज्यामुळे AI उद्योगाच्या केंद्रस्थानी सुरक्षिततेचे कार्य कसे केले जाते हे पुन्हा आकार देऊ शकते. "ऑटोमेटेड रिसर्चर्स कॅन रिलायबली मिटिगेट अलाइनमेंट फेलर्स" या शीर्षकाचा पेपर शुक्रवारी प्रसिद्ध करण्यात आला आणि टेकक्रंचने तपशीलवार माहिती दिली.

हे संशोधन अँथ्रोपिकच्या फेलो प्रोग्राममधून बाहेर आले आहे आणि चेन युह-हान यांच्या नेतृत्वाखाली आहे. त्याचा मध्यवर्ती दावा धक्कादायक आहे: जेव्हा कंपनीच्या स्वयंचलित संशोधन प्रणालींना विशिष्ट चुकीच्या संरेखित वर्तणुकीचे मोजमाप करणाऱ्या दहा बेंचमार्कवर निदर्शनास आणले गेले, तेव्हा त्यांनी मॉडेलच्या एकूण क्षमतांना कमी न करता - प्रत्येक एकावर कार्यप्रदर्शन सुधारले. ज्या फील्डने सुरक्षिततेचे काम मॉडेल स्केलसह टप्प्याटप्प्याने ठेवण्यासाठी संघर्ष केला आहे, तो एक उल्लेखनीय परिणाम आहे. For more context on this story, see our ongoing latest AI developments.

AI सुरक्षितता कव्हरेजसाठी व्यस्त ताणादरम्यान ही कथा उतरली. ओपनएआयच्या रिवॉर्ड-हॅकिंग एजंट्सच्या अंतर्गत अहवालापासून ते हगिंग फेस भंगाच्या स्वतंत्र तपासासाठी आवाहन करण्यापर्यंत ज्या उन्हाळ्यात एजंटिक गैरवर्तनाने ठळक बातम्यांवर वर्चस्व गाजवले आहे. अँथ्रोपिकचा नवीन पेपर विरुद्ध दिशेने समस्येकडे जातो: एजंट कसे गैरवर्तन करतात हे विचारण्याऐवजी, ते निराकरण करण्यासाठी इतर एजंटांवर विश्वास ठेवला जाऊ शकतो का हे विचारले जाते.

पेपर प्रत्यक्षात काय अहवाल देतो

पेपरमध्ये वर्णन केलेल्या सिस्टमला ऑटोमेटेड अलाइनमेंट रिसर्चर किंवा एएआर म्हणतात. संशोधन प्रक्रिया बदलण्याऐवजी, AAR त्याची पुष्कळ प्रतिकृती बनवते: प्रत्येक स्वयंचलित प्रणाली उपलब्ध साहित्य शोधते, एक पद्धत सुचवते आणि अंदाजे 30 मिनिटांसाठी ती पद्धत वापरून मॉडेलला प्रशिक्षण देते. प्रक्रिया नंतर अनेक पुनरावृत्तींमध्ये पुनरावृत्ती होते.

निवड यंत्रणा सोपी आहे. बेंचमार्क हलविणाऱ्या पद्धती जतन केल्या जातात; ज्या पद्धती टाकल्या जात नाहीत. ते लूप सिस्टीमला त्वरीत कार्य करू देते आणि कोणत्याही मानवी संघाशी जुळू शकत नाही, समांतरपणे अनेक संशोधन दिशानिर्देशांची चाचणी घेते आणि जे कार्य करते तेच ठेवते.

पेपरनुसार, निकाल संपूर्ण बोर्डात सातत्यपूर्ण होते. विशिष्ट संरेखित वर्तणूक कव्हर करणाऱ्या सर्व दहा बेंचमार्कवर, ऑटोमेटेड सिस्टमने एकूण मॉडेल कार्यप्रदर्शनाला धक्का न लावता मोजता येण्यायोग्य सुधारणा घडवून आणल्या - नेहमीच्या ट्रेड-ऑफमुळे संरेखन कार्य कठीण होते.

"एकूणच, हे परिणाम लवकर पुरावे देतात की स्वयंचलित संरेखन पोस्ट-ट्रेनिंग नजीकच्या काळात व्यावहारिक होऊ शकते," पेपर म्हणते.

मानवांना मारहाण, 1/37 वी किंमत

पेपरमध्ये सर्वाधिक उद्धृत केलेले परिच्छेद हे आहेत जेथे ते AAR ची थेट मानवी समकक्षांशी तुलना करते. एन्थ्रोपिकने तुलना केली नाही.

"सर्वोत्तम AAR पद्धत अनुभवी मानवांनी सुचवलेल्या गोष्टींवर मात करते, सरासरी सहा तासांत," पेपर वाचतो. हे स्पष्टपणे जोडते की, "मानवी मार्गदर्शित संशोधन दिशानिर्देश मजबूत कामगिरीकडे नेत नाहीत."

अर्थशास्त्र तसे बोथट आहे. "आम्ही आमच्या मानवी संशोधकांना देत असलेल्या $150 प्रति तासाच्या तुलनेत API अनुमानानुसार AAR ची किंमत सुमारे $4 प्रति तास आहे," लेखक लिहितात. हे जवळजवळ 40 पट खर्चाचे अंतर आहे आणि हे स्पष्ट करते की प्रयोगशाळा स्वयंचलित संशोधनाला उत्सुकतेपेक्षा अधिक गांभीर्याने का घेत आहेत.

खर्चातील तफावत का महत्त्वाची आहे

संरेखन संशोधन कमी लेखणे सोपे आहे अशा प्रकारे महाग आहे. प्रत्येक उमेदवाराच्या हस्तक्षेपाची अंमलबजावणी, प्रशिक्षित आणि बेंचमार्कच्या विरूद्ध मूल्यमापन करणे आवश्यक आहे आणि बहुतेक उमेदवार अयशस्वी होतात. एपीआय कॉल्सच्या किमतीसाठी एखादे सिस्टम शोध लूप सतत चालवू शकत असल्यास, आणखी एक कल्पना वापरून पाहण्याची किरकोळ किंमत शून्यावर येते. मर्यादा हेडकाउंटवरून गणनेकडे बदलते.

मर्यादा मानववंशीय स्वतः ध्वजांकित

निकाल काय सिद्ध करत नाही याबद्दल पेपर स्पष्ट आहे. स्वयंचलित प्रणाली केवळ अंतरावरच कार्य करते कारण बेंचमार्क खरोखर महत्त्वाची संरेखन उद्दिष्टे प्रतिबिंबित करतात — आणि वास्तविक-जगातील गैरवर्तन कॅप्चर करणारे बेंचमार्क तयार करणे आणि राखणे ही या क्षेत्रातील एक खुली समस्या आहे.

एक अवलंबित्व देखील आहे जे चुकणे सोपे आहे: स्वयंचलित संशोधक पद्धतींचे विद्यमान साहित्य तयार करतात. हे साहित्य टिकवून ठेवणे आणि त्याचा विस्तार करणे हे स्वतःच महत्त्वाचे काम आहे आणि केवळ ज्ञात तंत्रांचे रिमिक्स करणारी प्रणाली मानवी सर्जनशीलतेची कमाल मर्यादा गाठू शकते.

त्या सूचना महत्त्वाच्या आहेत कारण संशोधनाचे दीर्घकालीन महत्त्व त्यांच्यावर अवलंबून आहे. जर बेंचमार्क चुकीच्या गोष्टी मोजतात, तर एएआर मजबूत आकड्यांकडे जाण्याचा मार्ग ऑप्टिमाइझ करू शकतो आणि मूलभूत जोखीम अस्पर्श राहतात. अँथ्रोपिकची रचना - "प्रारंभिक पुरावे," उपाय नाही - ती अनिश्चितता प्रतिबिंबित करते.

पुनरावर्ती स्व-सुधारणेच्या दिशेने एक पाऊल

या पेपरमध्ये पुनरावृत्ती होणाऱ्या आत्म-सुधारणेबद्दल मोठ्या वादविवादाला देखील खतपाणी घालण्यात आले आहे, ही कल्पना आहे की AI सिस्टीम अखेरीस त्यांना तयार करणाऱ्या प्रशिक्षण प्रक्रियेत सुधारणा करू शकतात. इतर AI मॉडेल्ससह AI मॉडेल्सना प्रशिक्षण देणे हे फ्रंटियर लॅबसाठी एक लोकप्रिय उद्दिष्ट बनले आहे आणि अँथ्रोपिकचा परिणाम हा अरुंद डोमेनमध्ये कसा दिसतो यावर लवकर, ठोस देखावा आहे.

तर्क सरळ आहे. जर मॉडेल्स त्यांच्या स्वत: च्या संरेखन प्रशिक्षणामध्ये विश्वासार्हपणे सुधारणा करू शकतील, तर तीच यंत्रणा प्रशिक्षण पद्धतींकडे अधिक व्यापकपणे सूचित केले जाऊ शकते — क्षमता कार्य समाविष्ट आहे. मानवी AI संशोधक अखेरीस प्रक्रियेत कमी मध्यवर्ती होऊ शकतात, ही शक्यता टेकक्रंचने नोंदवली आहे, ही शक्यता टाळण्याऐवजी पेपर स्वतःच गुंतलेली आहे.

पुढे काय पहावे

हा निकाल सामान्य होतो की नाही हे तीन प्रश्न ठरवतील. प्रथम, अँथ्रोपिक चाचणी केलेल्या दहा बेंचमार्कच्या बाहेर दृष्टीकोन धारण करतो की नाही, अयशस्वी मोडवर जे गोंधळलेले आणि कमी चांगले परिभाषित आहेत. दुसरे, स्वयंचलित संशोधन प्रामाणिक ठेवण्यासाठी बेंचमार्क-देखभाल समस्या जलद सोडवता येईल का. तिसरे, इतर प्रयोगशाळा तुलनात्मक परिणाम प्रकाशित करतात की नाही, जे एकच पेपर उद्योगाच्या दिशेने बदलेल.

आत्तासाठी, शोध अरुंद परंतु वास्तविक आहे: मानववंशीय चाचणी केलेल्या विशिष्ट संरेखन कार्यांवर, स्वयंचलित संशोधकांनी अनुभवी मानवांना मागे टाकले, जलद आणि खूप स्वस्त. AI उद्योगाची सुरक्षितता ही पहिली जागा असू शकते जिथे AI संशोधक - मानवी नव्हे - बहुतेक काम करतात.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →