बेंचमार्किंग फर्म आर्टिफिशियल ॲनालिसिसने 4 सप्टेंबर 2026 रोजी त्याच्या इंटेलिजेंस इंडेक्सची आवृत्ती 4.2 जारी केली, एक अंतरिम अपडेट जे फ्रंटियर AI मॉडेल्सचे मोजमाप कसे केले जाते यावर पुनर्रचना करते — आणि नवीन लीडरबोर्डनुसार, Anthropic's Claude Fable 5.1 ने अव्वल स्थान धारण केले आहे, OpenAI च्या GPT-6 Astra नंतर GPT-6 Astra- GPT-6 वर दुसऱ्या स्थानावर- 5 वर दुसऱ्या स्थानावर आहे.

जानेवारीमध्ये इंडेक्स v4 लाँच झाल्यानंतर फक्त आठ महिन्यांनी हे अपडेट आले आहे, अलीकडील फ्रंटियर रिलीझच्या गतीला फर्मचे विलक्षण जलद टर्नअराउंड. "गेल्या आठवड्यांमध्ये सीमारेषा इतक्या वेगाने पुढे जात असताना, आम्हाला वाटते की आमचा निर्देशांक नेहमीप्रमाणेच संबंधित आणि उपयुक्त राहील याची खात्री करण्यासाठी तात्काळ अंतरिम अपडेट देणे महत्वाचे आहे," कंपनीने आपल्या घोषणेमध्ये लिहिले आहे.

हेडलाइन रँकिंग

प्रकाशित परिणामांनुसार, Anthropic's Claude Fable 5.1 निर्देशांकात आघाडीवर आहे, त्यानंतर OpenAI चा GPT-6 Astra आहे, ज्याने GPT-5.6 सोलपेक्षा चार गुणांची सुधारणा केली आहे. मेटा लीडरबोर्डवरील तिसरी-सशक्त लॅब म्हणून स्थान घेते, त्यानंतर SpaceXAI, Moonshot/Kimi, Z.AI आणि Google यांचा क्रमांक लागतो.

एन्थ्रोपिक आणि ओपनएआय देखील अद्ययावत किमती-कार्यक्षमतेचे चित्र सामायिक करतात: मेटा आणि Z.AI सोबत, दोन कंपन्या निर्देशांकाच्या "कॉस्ट प्रति टास्क" पॅरेटो फ्रंटियरवर कब्जा करतात, म्हणजे इतर कोणतीही प्रयोगशाळा सध्या पूर्ण केलेल्या कार्यासाठी समान किंमतीसाठी कठोरपणे चांगली बुद्धिमत्ता प्रदान करत नाही.

टोकन कार्यक्षमतेवर, क्लॉड फेबल 5.1, ग्रोक 4.5, आणि जेमिनी 3.5 फ्लॅश-लाइट वक्रच्या दोन्ही टोकाला बसलेले असलेले GPT-6 Astra "इंटेलिजन्स फ्रंटियरजवळील जवळजवळ प्रत्येक मॉडेलपेक्षा अधिक टोकन कार्यक्षम" कृत्रिम विश्लेषणास आढळले. फर्मने सहचर विश्लेषणामध्ये नमूद केले आहे की, Astra चा कमी टोकन वापर त्याच्या उच्च किमतींमुळे जास्त आहे - एक स्मरणपत्र आहे की कच्ची कार्यक्षमता आणि एकूण खर्च नेहमी एकत्र येत नाहीत.

v4.2 मध्ये काय बदलले

सर्वात लक्षणीय संरचनात्मक बदल म्हणजे बेंचमार्क गेमिंग विरुद्ध जाणीवपूर्वक पुश करणे. इंडेक्सचे चाळीस टक्के वेटिंग आता खाजगी, आयोजित केलेल्या चाचणी संचांमधून येते — v4.1 मधील वाटा दुप्पट — AA-Briefcase, AA-Omniscience आणि CritPt साठी उपायांसह. फर्मने म्हटले आहे की निर्देशांक v5 मध्ये आकडा आणखी वाढेल.

दोन नवीन मूल्यमापन अपडेटला अँकर करतात:

  • AA-ब्रीफकेस, खाजगी होल्ड-आउट चाचणी सेटसह इन-हाउस एजंटिक ज्ञान कार्य बेंचमार्क. मॉडेल्सचे मूल्यमापन बहु-आठवड्याच्या व्यावसायिक प्रकल्पांवर केले जाते, प्रत्येकामध्ये अनेक जोडलेली कार्ये आणि हजारो इनपुट स्त्रोत फायली असतात, आणि रूब्रिक स्कोअरिंग आणि जोडीने तुलना करून पडताळणीयोग्य कार्य यश, विश्लेषणात्मक गुणवत्ता आणि सादरीकरण गुणवत्ता यांच्या संयोजनाद्वारे श्रेणीबद्ध केली जाते.
  • GDP.pdf, सर्ज AI द्वारे तयार केले गेले आहे, जे संपूर्ण व्यावसायिक दस्तऐवजांवर एकल-वळण तर्काची चाचणी करते: 100 पीडीएफ, दहा डोमेन व्यापलेले, मजकूर, सारण्या, चार्ट आणि तळटीपांच्या 4,592 पृष्ठांवर वितरीत केलेल्या पुराव्यासह. प्रतिसादांना 1,275 तज्ञ-लेखक अणु निकषांनुसार श्रेणीबद्ध केले जाते आणि सर्व-पास दर हेडलाइन प्रत्येक निकष पूर्ण झाल्यावरच कार्याचे श्रेय देते.

एक दीर्घकालीन बेंचमार्क बाहेर पडण्याच्या मार्गावर आहे: GPQA डायमंड, पदवी-स्तरीय विज्ञान तर्क चाचणी काढून टाकण्यात आली आहे कारण ती फ्रंटियर मॉडेल्सद्वारे प्रभावीपणे संतृप्त झाली आहे.

फर्मने आपली ग्रेडिंग इन्फ्रास्ट्रक्चर देखील अपग्रेड केली, नवीन ग्रेडिंग सिस्टम प्रॉम्प्टसह AA-LCR v1.1 जारी केले आणि उत्तर की दुरुस्त केल्या, GDPval-AA v2 आणि AA-ब्रीफकेससाठी Elo स्केल पुन्हा अँकर केले जेणेकरून नवीन मॉडेल्स येताच रेटिंग स्थिर राहतील आणि SciCode चे कठोर केले जाईल जेणेकरुन संथ-ग्रेडिंग कोड-कोड-कॉउंट धीमे होत नाहीत. अपयश

नवीन चाचण्या काय उघड करतात

नवीन मूल्यमापनावरील परिणाम सीमावर्ती प्रयोगशाळा प्रत्यक्षात कोठे उभ्या आहेत याचे अधिक विस्तृत चित्र देतात.

AA-ब्रीफकेसवर, Anthropic's Claude Fable 5.1 आणि Opus 5 लीड, त्यानंतर OpenAI चे GPT-6 Astra आणि Meta's Muse Spark 1.3. त्याच मूल्यांकनावर GPT-6 Astra ने GPT-5.6 Sol वर अंदाजे 85 Elo पॉईंट्स स्कोअर केले - ओपनएआयच्या लागोपाठच्या पिढ्यांमधील एक महत्त्वपूर्ण उडी.

GDP.pdf वर, चित्र पलटते: OpenAI GPT-6 Astra सह 33.2% ऑल-पास दराने आघाडीवर आहे, त्यानंतर GPT-5.6 Sol 28.2% आणि क्लॉड फेबल 5.1 26.2% वर आहे. भिन्नता सूचित करते की बर्याच मोठ्या संदर्भांवर दीर्घ-दस्तऐवज संश्लेषण हे OpenAI च्या नवीन मॉडेलसाठी एक सापेक्ष शक्ती आहे, जरी Anthropic चे मॉडेल संपूर्ण निर्देशांक आणि एजंटिक कार्याचे नेतृत्व करतात.

खाजगी चाचणी सेट महत्वाची का आहे

धरून ठेवलेल्या मूल्यमापनाकडे होणारे शिफ्ट AI बेंचमार्किंगमधील एक व्यापक विश्वासार्हतेची समस्या दर्शवते. मॉडेल्सनी अधिक सार्वजनिक चाचणी डेटा आत्मसात केल्यामुळे, लॅब आणि स्वतंत्र निरीक्षकांना चिंता वाढली आहे की सुप्रसिद्ध बेंचमार्कवरील हेडलाइन स्कोअर अस्सल क्षमतेऐवजी स्मरणशक्ती किंवा लक्ष्यित प्रशिक्षण प्रतिबिंबित करतात. त्याच्या चाचणी सेटचा वाढता वाटा खाजगी ठेवून आणि त्यांना अधिक वजन देऊन, कृत्रिम विश्लेषण सार्वजनिक लीडरबोर्ड गमावत आहेत हे सिग्नल जपण्याचा प्रयत्न करत आहे.

फर्मने म्हटले आहे की ती "महिन्यांपासून" निर्देशांक v5 चे घटक तयार करत आहे आणि अलीकडील प्रमुख मॉडेल लॉन्चच्या लाँचद्वारे निर्देशांक स्थिर ठेवण्यासाठी जाणूनबुजून अद्यतने मागे ठेवली आहेत. अंतरिम v4.2 रिलीझच्या पलीकडे, ते नजीकच्या भविष्यात अधिक वाढीव अद्यतनांची योजना करते कारण ते v5 संक्रमण पूर्ण करते.

फ्रंटियर मॉडेल्समधून निवड करणाऱ्या खरेदीदारांसाठी, v4.2 मधून व्यावहारिक टेकअवे हे आहे की बाजाराच्या शीर्षस्थानी Anthropic आणि OpenAI मधील दोन घोड्यांची शर्यत राहिली आहे, Meta ने अंतर कमी केले आहे — आणि गेमिंगला प्रतिरोधक होण्यासाठी डिझाइन केलेले मूल्यमापन आता रँकिंगचे अधिक काम करत आहेत. मॉडेल निवड निर्णयांचा मागोवा घेणारे वापरकर्ते v5 रोलआउट जवळ येत असताना नवीनतम AI घडामोडींचे अनुसरण करू शकतात.

AI च्या पुढे रहा

यासारखे बेंचमार्क अपडेट्स इंडस्ट्रीच्या प्रगतीचा न्याय कसा करतात हे बदलतात. अधिक AI बातम्या वाचा आणि प्रत्येक मॉडेल रिलीजच्या पुढे रहा.

अधिक एआय बातम्या वाचा →