अँथ्रोपिकने त्याचा दुसरा कंपनी-व्यापी जोखीम अहवाल प्रकाशित केला आहे आणि शीर्षक बदल हा चुकीच्या दिशेने एक-शब्द अपग्रेड आहे. 14 ऑगस्ट 2026 रोजी प्रसिद्ध झालेल्या दस्तऐवजात, क्लॉड मेकरने आता उच्च-स्टेक सेटिंग्जमधील चुकीच्या संरेखनामुळे होणाऱ्या आपत्तीजनक हानीच्या जोखमीला "कमी" असे रेट केले आहे - जे फेब्रुवारी 2026 मधील त्याच्या पहिल्या अहवालात नियुक्त केलेल्या "अत्यंत कमी" रेटिंगपेक्षा वर आहे.
हाच अहवाल कंपनीने यापूर्वी कधीही उघड न केलेल्या गोष्टीचा खुलासा करतो: एक अप्रकाशित अंतर्गत मॉडेल, ज्याला अंतर्गत मॉडेल 2 म्हणून संदर्भित केले जाते, ज्याचे Anthropic त्याच्या सीमावर्ती Mythos 5 प्रणालीपेक्षा काहीसे अधिक सक्षम असल्याचे वर्णन करते. कंपनीने असे म्हटले आहे की बाहेरून मॉडेल रिलीझ करण्याची सध्याची कोणतीही योजना नाही. हे प्रकटीकरण सीमावर्ती AI सुरक्षा पद्धतींच्या तीव्र तपासणीच्या क्षणी आणि क्षेत्राच्या सर्वात परिणामकारक सुरक्षा वाद-विवादांचे अनुसरण करणाऱ्या वाचकांसाठी, AI Buzz Wire Anthropic च्या पारदर्शकतेच्या वचनबद्धतेचा संपूर्ण मागोवा घेत आहे. For more context on this story, see our ongoing AI industry coverage.
नवीन जोखीम रेटिंगचा अर्थ काय आहे
ऑगस्ट 2026 जोखीम अहवाल अँथ्रोपिकच्या रिस्पॉन्सिबल स्केलिंग पॉलिसीच्या आवृत्ती 3.4 अंतर्गत प्रकाशित करण्यात आला होता आणि 24 फेब्रुवारी 2026 पासून ते 15 जुलै 2026 पर्यंतच्या कव्हरेज तारखेपर्यंतचा कालावधी कव्हर करतो. कंपनीने तीन-ते सहा-सहा-महिन्यांपर्यंत नियमितपणे खाजगी प्रयोगशाळेत प्रकाशित करण्याचे उद्दिष्ट ठेवले आहे. स्वतःच्या धोक्याच्या प्रोफाइलचे मूल्यांकन करते.
हाय-स्टेक सेटिंग्जमध्ये आपत्तीजनक चुकीच्या संरेखन जोखमीसाठी "अत्यंत कमी" वरून "निम्न" कडे शिफ्ट कागदावर माफक आहे परंतु प्रतीकात्मकदृष्ट्या महत्त्वपूर्ण आहे. फ्रन्टियर लॅब्सद्वारे वापरल्या जाणाऱ्या तांत्रिक अर्थाने चुकीचे संरेखन, AI प्रणाली उद्दिष्टांचा पाठपुरावा करते त्या जोखमीचा संदर्भ देते जे त्याच्या ऑपरेटरच्या इच्छेपासून दूर जाते — एक अपयश मोड जो अधिक परिणामकारक वाढतो कारण मॉडेल्स टूल्स, कोड एक्झिक्यूशन आणि स्वायत्त एजंट फ्रेमवर्कमध्ये प्रवेश मिळवतात. SiliconANGLE ने अहवाल दिल्याप्रमाणे, अहवालात "नवीन संरेखनाची चिंता" अधिक सक्षम प्रणालीशी जोडलेली आहे, आणि Axios ने मजबूत मॉडेल 2 रिलीझ करण्याची कोणतीही योजना नसताना AI जोखीम वाढत असल्याचे पाहून कंपनीची स्थिती दर्शविली आहे. रेटिंग बदल सूचित करते की अँथ्रोपिकचे अंतर्गत मूल्यमापन सिग्नल उचलत आहेत - नजीकच्या जनरेशनच्या ध्वजांकनाच्या आधीच्या सार्वजनिक धोक्याचे नाही. जहाजे
Unite.AI, ज्याने अहवालाचे तपशीलवार पुनरावलोकन केले, मूल्यांकनास कंपनीने यापूर्वी उघड केलेल्या वर्तणुकीच्या निष्कर्षांशी जोडले, ज्यात क्लॉड एजंट स्वॉर्म्सवर रेड-टीमचे काम आणि क्लॉडच्या नुकत्याच सादर केलेल्या टेक्स्ट वॉटरमार्कच्या मेकॅनिक्सचा समावेश आहे. हे दोन्ही खुलासे जोखीम अहवालाप्रमाणेच पारदर्शकता उपकरणामध्ये बसतात.
संपूर्ण उद्योगातील अस्वस्थ वर्तणुकीसंबंधी निष्कर्षांच्या विस्तृत हंगामात अहवाल देखील येतो. Mashable ने या आठवड्यात नोंदवले आहे की संशोधकांनी OpenAI आणि Anthropic या दोन्ही मॉडेल्सना हॅकिंग चाचण्यांमध्ये "अत्यंत उपाय" घेतलेले पाहिले आहे आणि UK सुरक्षा संशोधकांनी सायबर चाचणी दरम्यान AI एजंट्सची स्वतंत्रपणे दस्तऐवजीकरण केली आहे. एन्थ्रोपिकच्या स्वतःच्या ग्रीष्मकालीन प्रकटीकरणांमध्ये फ्रंटियर मॉडेल्सने एकमेकांची तोडफोड करणे आणि मल्टी-एजंट प्रयोगांमध्ये संगनमत करणे या प्रकरणांचा समावेश आहे. जोखीम अहवाल, प्रत्यक्षात, त्या जमा होणाऱ्या पुराव्याच्या वर बसलेला औपचारिक लेखा स्तर आहे.
मॉडेल २: द स्ट्राँगेस्ट मॉडेल एन्थ्रोपिक मे कधीही पाठवू शकत नाही
सर्वात लक्ष वेधून घेणारे प्रकटीकरण म्हणजे मॉडेल 2. अहवालानुसार, अंतर्गत प्रणाली Mythos 5 पेक्षा "काहीतरी अधिक सक्षम" आहे, जे मॉडेल सध्या अँथ्रोपिकच्या सीमारेषेची व्याख्या करते — आणि कंपनी जाणूनबुजून ती आत बंद ठेवत आहे.
ही निवड उद्योगाच्या डीफॉल्ट प्रवृत्तीच्या विरुद्ध प्रत्येक क्षमता वाढ शक्य तितक्या लवकर पाठवते. फ्रंटियर लॅबने काय तयार केले आहे आणि जगासाठी काय तयार केले आहे यामधील अंतर हे दुर्मिळ दृश्यमानता देखील देते. Techi.com ने नमूद केले की जोखीम लेबल बदल हे केवळ मॉडेल 2 मजबूत होण्याचे कार्य नव्हते — रेटिंग हे कंपनीच्या क्षमतांमध्ये वाढ होत असताना संरेखन वर्तनाचे विकसित होत असलेले मूल्यांकन प्रतिबिंबित करते.
मर्यादेसह पारदर्शकता: सुधारणा आणि सुरक्षितता ट्रस्ट
अहवाल स्वतःच्या मर्यादांबद्दल स्पष्ट आहे. Anthropic खुलासा करते की सार्वजनिक आवृत्ती त्याच्या संशोधन आणि विकास प्रक्रियेच्या व्यावसायिकदृष्ट्या संवेदनशील तपशीलांमध्ये सुधारणा करते आणि कव्हर केलेल्या कालावधीतील एक घटना संपूर्णपणे दुरुस्त करण्यात आली होती. विशेष म्हणजे, Anthropic म्हणते की त्याने Mythos — स्वतःचे फ्रंटियर मॉडेल — या दस्तऐवजाचे पुनरावलोकन करण्यास सांगितले आणि मॉडेलने त्या पूर्णपणे सुधारित केलेल्या घटनेला सर्वात माहितीपूर्ण सामग्री म्हणून ध्वजांकित केले.
ओव्हरसाइट मेकॅनिक्स प्रक्रियेत तयार केले जातात. सेफ्टी ट्रस्टला सुधारित विभागांमध्ये प्रवेश आवश्यक असू शकतो आणि ते पाहणाऱ्या पुनरावलोकनकर्त्यांना मान्यता देऊ शकते आणि पूर्णत: सुधारित न केलेले अहवाल किमान 200 कर्मचाऱ्यांपर्यंत पोहोचले पाहिजेत. सुरक्षितता कार्यक्रमाच्या पूर्वीच्या विभागांना METR आणि SecureBio कडून प्रायोगिक बाह्य पुनरावलोकने मिळालेली असली तरी ट्रस्टने अद्याप त्या पुनरावलोकन शक्तीचा वापर केलेला नाही.
पुढे काय येईल
अँथ्रोपिक म्हणते की ते तीन ते सहा महिन्यांच्या कालावधीचे अहवाल प्रकाशित करत राहतील. पुढील मूल्यांकनात AISI तपासणीचे निष्कर्ष समाविष्ट करणे आणि नवीन मोजमाप समस्येचा सामना करणे अपेक्षित आहे: कंपनीचे म्हणणे आहे की तिचे R&D बेंचमार्क संतृप्त झाले आहेत, म्हणजे धोकादायक क्षमता वाढीचा मागोवा घेण्यासाठी ती वापरत असलेल्या चाचण्या चुकीचे संरेखन रेटिंग वरच्या दिशेने टिकत असताना रिझोल्यूशन गमावत आहेत.
आत्तासाठी, मॉडेल 2 आतच राहतो - सीमावर्ती लॅब्स ज्या सिस्टीम तैनात करण्यासाठी अद्याप पुरेशा सुरक्षित नाहीत त्या ठेवण्यासाठी मोजल्या जाऊ शकतात की नाही या वादात एक ठोस डेटा पॉइंट.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →