Anthropic ने शनिवारी स्व-मापनांचा तपशीलवार संच प्रकाशित केला ज्याचा उद्देश जनता, पत्रकार आणि सरकार किती वेगाने फ्रंटियर AI विकसित होत आहे याचा मागोवा घेण्याच्या उद्देशाने — कंपनीचे स्वतःचे किती संशोधन AI द्वारे केले जात आहे याच्या पहिल्या प्रकारच्या निर्देशांकासह, आणि अंदाजे 30,000 AI एजंट्स कंपनीच्या आत काम करत आहेत हे उघड करणे.
"फ्रंटियर लॅबमध्ये एआय विकासाची गती समजून घेण्यासाठी मोजमाप" शीर्षक असलेले पोस्ट, उद्योगातील सर्वात परिणामकारक युक्तिवादाच्या केंद्रस्थानी येते: सीमा विकास जाणूनबुजून मंद केला पाहिजे की नाही. Dario Amodei यांनी "सीमेला गती देण्यासाठी" समन्वयाची मागणी केली आहे, ज्याने बाजारपेठेला हादरवून सोडले आहे, प्रमुख प्रयोगशाळांमधील पेसिंग मिलीभगतचा आरोप करणारा ग्राहक खटला काढला आहे आणि अध्यक्ष ट्रम्प यांना कोणतीही मंदी रोखण्यासाठी समर्पित "AI फोर्स" ची घोषणा करण्यास प्रवृत्त केले आहे. अँथ्रोपिकचे फ्रेमिंग त्या संदर्भाविषयी स्पष्ट आहे: "जशी सीमावर्ती एआय विकासाची गती कमी करणे हे जग मानत आहे, जनतेला अधिक माहितीची आवश्यकता आहे."
AI प्रगतीचा मागोवा घेण्यासाठी तीन मोजमाप
कंपनीने तीन मोजमाप क्षेत्रे मांडली आहेत ज्याचा तर्क आहे की कोणतीही फ्रंटियर लॅब नियमितपणे प्रकाशित करू शकते:
१. AI R&D चा किती भाग AI द्वारेच केला जातो. Anthropic ने कंपनीमध्ये केलेल्या प्रत्येक प्रकारच्या AI संशोधन आणि विकास कार्याचे कॅटलॉग करून, सध्या प्रत्येक कार्य किती स्वयंचलित आहे याचे रेटिंग देऊन आणि परिणाम एकत्रित करून "Anthropic R&D ऑटोमेशन इंडेक्स" हा प्रोटोटाइप तयार केला आहे. रेटिंग Epoch AI च्या सार्वजनिक "ऑटोमेशन लेव्हल" स्केलचा वापर करतात, जे AL0 (कोणतेही AI सहभाग नाही) ते AL5 पर्यंत चालते (एआय लूपमध्ये मनुष्य नसताना पूर्णपणे स्वायत्तपणे कार्य करते). या स्केलवर, AL3 म्हणजे AI "सहयोग करते" — जवळच्या मानवी मार्गदर्शनाखाली मोठ्या प्रमाणात काम करत आहे — तर AL4 म्हणजे AI "नेतृत्व करतो", मानव पर्यवेक्षण करत असताना उच्च-स्तरीय प्रॉम्प्टवरून बहुतेक टास्क पूर्ण करतो.निर्देशांकाचा मुद्दा हा आहे की कोणतीही प्रयोगशाळा पुनरावृत्तीच्या स्वयं-सुधारणेच्या किती जवळ येत आहे - एक मॉडेल पूर्णपणे स्वायत्तपणे स्वतःचा उत्तराधिकारी तयार करते. एन्थ्रोपिक नोट करते की एआय विकासाला गती देणारी मॉडेल्स "मानवांसाठी या प्रणाली समजून घेणे किंवा नियंत्रित करणे अधिक आव्हानात्मक बनवू शकते."
२. एआय एजंट्सच्या कृतींवर किती चांगल्या प्रकारे देखरेख केली जाते. येथे 30,000 आकृती दिसते. ऑगस्ट 2026 पर्यंत, अंदाजे 30,000 एजंट अँथ्रोपिकच्या सर्वाधिक वापरल्या जाणाऱ्या अंतर्गत व्यासपीठावर कोणत्याही वेळी संशोधन आणि अभियांत्रिकी कार्य करत होते, एकमेकांना कार्ये सोपवत होते आणि दीर्घकाळापर्यंत अर्ध-स्वायत्तपणे काम करत होते. कंपनी त्या एजंटच्या देखरेखीबद्दल तीन गोष्टी मोजते: कव्हरेज (एजंट क्रियांचा वाटा जो मॉनिटरमधून अंमलात आणण्यापूर्वी किंवा नंतर जातो), लेटन्सीचे पुनरावलोकन (फ्लेग केलेल्या क्रियांचे किती लवकर पुनरावलोकन केले जाते, प्रथम स्वयंचलित मॉनिटरद्वारे आणि नंतर मानवाद्वारे), आणि वाढीचा दर (अवरोधित, पुनर्निर्देशित किंवा पुनरावलोकनासाठी ध्वजांकित केलेल्या क्रियाकलापांचा वाटा).अँथ्रोपिकच्या मॉनिटरिंग डेटावरून असे सूचित होते की वैयक्तिक एजंट क्वचितच गैरवर्तन करतात - परंतु कंपनी चेतावणी देते की "जेव्हा अर्थव्यवस्थेत लाखो किंवा अब्जावधी एजंट कार्यरत असतात, तेव्हा अगदी दुर्मिळ घटना देखील नियमितपणे घडू शकतात."
३. गणनेचे वाटप कसे केले जाते. तिसरे मोजमाप लॅबची संगणकीय संसाधने कशी वितरीत केली जातात याचा मागोवा घेते — कच्चा इनपुट जो मॉडेल क्षमतेशी संबंधित आहे. इतर दोन मेट्रिक्ससह, अँथ्रोपिकने असा युक्तिवाद केला आहे की यामुळे बाहेरील लोकांना मॉडेल आउटपुटसह मॉडेल इनपुट सहसंबंधित करण्याचा एक मार्ग मिळतो, कंपनीने त्याच्या जबाबदार स्केलिंग पॉलिसी जोखीम अहवालांद्वारे आधीच प्रकाशित केलेल्या क्षमता मूल्यांकनांना पूरक आहे.संख्या मंदगतीने पुढे जाईल
पोस्टमधील सर्वात राजकीयदृष्ट्या टोकदार ओळ थेट पेसिंग वादविवादावर उद्दीष्ट आहे: अँथ्रोपिकने म्हटले आहे की "अँथ्रोपिकचे सीईओ डारियो अमोदेई यांनी मागितल्याप्रमाणे, सीमारेषेवर समन्वय साधला असता तर ही संख्या बदलण्याची अपेक्षा करेल." दुसऱ्या शब्दांत, जर उद्योग खरोखरच मंदावला तर, हे मेट्रिक्स लोक ते कसे सत्यापित करू शकतात - आणि जर कंपन्या त्यांची संख्या वाढत असताना वेगवान असल्याचा दावा करतात, तर मोजमाप ते देखील उघड करेल.
स्वतंत्र पडताळणी हा गहाळ तुकडा आहे
एन्थ्रोपिक स्वयं-रिपोर्ट केलेल्या मेट्रिक्सच्या मध्यवर्ती कमकुवतपणाची कबुली देते: ते स्वतःच्या सिस्टमचे मूल्यांकन करण्यासाठी स्वतःचे मॉडेल वापरत आहे, याचा अर्थ "न्यायाधीश" मॉडेल तपासल्या जाणाऱ्या मॉडेलचे अंध स्थान सामायिक करू शकते. कंपनी लॅबमध्ये सामान्य पद्धतीचा अभाव देखील नोंदवते, ज्यामुळे तुलना करणे कठीण होते.
त्याचा प्रस्तावित उपाय म्हणजे एन्थ्रोपिकमधील अनेक संस्थांकडून स्वतंत्र तृतीय-पक्ष मूल्यमापनकर्त्यांना एम्बेड करणे, त्यांना अंतर्गत प्रक्रिया, प्रणाली आणि अंतर्गत जोखीम मूल्यांकन संघ जे पाहतात त्या तुलनेत डेटामध्ये प्रवेश देणे. ते तृतीय पक्ष सुरक्षा पद्धतींची पडताळणी करतील, घटनांचा अहवाल देतील आणि नवीन मेट्रिक्सचे निरीक्षण करतील. कंपनी म्हणते की METR, मूल्यमापन नानफा, पूर्वी स्वतंत्रपणे त्याच्या ऑफलाइन मॉनिटरिंग प्लॅटफॉर्मवर रेड-टीम केले आहे आणि ते हे मोजमाप नियमितपणे इतरांनी सत्यापित करू शकतील अशा स्वरूपात प्रकाशित करण्याची योजना आखली आहे.
मोजमाप अँथ्रोपिकच्या विस्तृत प्रगत AI फ्रेमवर्क प्रस्तावाशी जोडलेले आहे, जे सीमावर्ती मॉडेल रिलीजसाठी "रस्त्याचे नियम" मांडते, ज्यामध्ये सरकारला आवश्यक असलेल्या पारदर्शकतेच्या दायित्वांचा समावेश आहे — जसे की प्रमाणित जोखीम अहवाल.
संपूर्ण उद्योगासाठी एक चाचणी
पदाचे सखोल महत्त्व स्पर्धात्मक असू शकते. "कोणताही फ्रंटियर डेव्हलपर सार्वजनिक कार्यपद्धती वापरून हे उपाय नियमितपणे प्रकाशित करू शकतो" असा युक्तिवाद करत मानववंशशास्त्र प्रत्येक सीमावर्ती प्रयोगशाळेला समान संख्या प्रकाशित करण्यासाठी प्रभावीपणे आव्हान देत आहे. प्रतिस्पर्ध्यांनी नकार दिल्यास, कॉन्ट्रास्ट सुरक्षा वादात स्वतःचा डेटा पॉइंट बनतो; जर ते सहमत असतील तर, AI खरोखर किती वेगाने पुढे जात आहे यासाठी उद्योगाला प्रथम सामान्य मापदंड प्राप्त होतो.
आत्तासाठी, पेसिंग संभाषणात स्पष्ट स्वारस्य असलेल्या कंपनीद्वारे नंबर स्वतःच नोंदवले जातात. परंतु ते वादात उणीव असलेल्या गोष्टीचे प्रतिनिधित्व करतात: ठोस, पुनरावृत्ती करता येण्याजोगे मोजमाप जे दर्शवेल की सीमा वेगवान आहे, स्थिर आहे किंवा प्रत्यक्षात मंद होत आहे.
AI च्या पुढे रहा
याप्रमाणे फ्रंटियर लॅब प्रकटीकरण एक जमीन साप्ताहिक. अधिक ब्रेकिंग AI संशोधन आणि उद्योग कव्हरेजसाठी, AI Buzz Wire फॉलो करा.
ताज्या एआय बातम्या वाचा →