बेंचमार्किंग फर्म आर्टिफिशियल एनालिसिस ने 4 सितंबर, 2026 को अपने इंटेलिजेंस इंडेक्स का संस्करण 4.2 जारी किया, एक अंतरिम अपडेट जो बताता है कि फ्रंटियर एआई मॉडल को कैसे मापा जाता है - और, नए लीडरबोर्ड के अनुसार, एंथ्रोपिक का क्लाउड फैबल 5.1 शीर्ष स्थान पर है, ओपनएआई का जीपीटी -6 एस्ट्रा जीपीटी-5.6 सोल पर चार अंकों की बढ़त के बाद दूसरे स्थान पर है।

यह अपडेट जनवरी में इंडेक्स वी4 लॉन्च होने के ठीक आठ महीने बाद आया है, कंपनी ने इसका श्रेय हालिया फ्रंटियर रिलीज की गति को एक असामान्य रूप से त्वरित बदलाव को दिया है। कंपनी ने अपनी घोषणा में लिखा, "पिछले हफ्तों में सीमा इतनी तेजी से आगे बढ़ने के साथ, हमें लगता है कि हमारा सूचकांक हमेशा की तरह प्रासंगिक और उपयोगी बना रहे, यह सुनिश्चित करने के लिए तत्काल अंतरिम अपडेट देना महत्वपूर्ण है।"

हेडलाइन रैंकिंग

प्रकाशित परिणामों के अनुसार, एंथ्रोपिक का क्लाउड फैबल 5.1 सूचकांक में सबसे आगे है, इसके बाद ओपनएआई का जीपीटी-6 एस्ट्रा है, जिसने जीपीटी-5.6 सोल से चार अंक का सुधार किया है। लीडरबोर्ड पर मेटा तीसरी सबसे मजबूत प्रयोगशाला है, इसके बाद स्पेसएक्सएआई, मूनशॉट/किमी, जेड.एआई और गूगल हैं।

एंथ्रोपिक और ओपनएआई भी अद्यतन लागत-दक्षता तस्वीर साझा करते हैं: मेटा और जेड.एआई के साथ दोनों कंपनियां सूचकांक के "प्रति कार्य लागत" पैरेटो सीमा पर हैं, जिसका अर्थ है कि कोई भी अन्य प्रयोगशाला वर्तमान में प्रति पूर्ण कार्य के लिए समान कीमत के लिए कड़ाई से बेहतर बुद्धिमत्ता प्रदान नहीं करती है।

टोकन दक्षता पर, आर्टिफिशियल एनालिसिस ने GPT-6 एस्ट्रा को "खुफिया सीमा के पास लगभग हर दूसरे मॉडल की तुलना में अधिक टोकन कुशल" पाया, जिसमें क्लाउड फैबल 5.1, ग्रोक 4.5 और जेमिनी 3.5 फ्लैश-लाइट वक्र के दोनों छोर पर बैठे थे। हालाँकि, कंपनी ने एक साथी विश्लेषण में उल्लेख किया है कि एस्ट्रा का कम टोकन उपयोग इसकी उच्च कीमतों से अधिक है - एक अनुस्मारक कि कच्ची दक्षता और कुल लागत हमेशा एक साथ नहीं चलती है।

##v4.2 में क्या परिवर्तन हुआ

सबसे महत्वपूर्ण संरचनात्मक परिवर्तन बेंचमार्क गेमिंग के खिलाफ जानबूझकर किया गया धक्का है। सूचकांक का चालीस प्रतिशत भार अब निजी, आयोजित-आउट परीक्षण सेटों से आता है - v4.1 में हिस्सेदारी दोगुनी - जिसमें एए-ब्रीफकेस, एए-ऑम्निसाइंस और क्रिटपीटी के समाधान शामिल हैं। फर्म ने कहा कि इंडेक्स v5 में यह आंकड़ा और बढ़ेगा।

दो नए मूल्यांकन अद्यतन की पुष्टि करते हैं:

  • एए-ब्रीफकेस, एक निजी हेल्ड-आउट टेस्ट सेट के साथ एक इन-हाउस एजेंटिक नॉलेज वर्क बेंचमार्क। मॉडल का मूल्यांकन बहु-सप्ताह की व्यावसायिक परियोजनाओं पर किया जाता है, प्रत्येक में कई जुड़े हुए कार्य और हजारों इनपुट स्रोत फ़ाइलें होती हैं, और सत्यापन योग्य कार्य सफलता, विश्लेषणात्मक गुणवत्ता और प्रस्तुति गुणवत्ता को कवर करते हुए रूब्रिक स्कोरिंग और जोड़ीवार तुलना के संयोजन के माध्यम से वर्गीकृत किया जाता है।
  • जीडीपी.पीडीएफ, सर्ज एआई द्वारा निर्मित, जो पेशेवर दस्तावेजों में सिंगल-टर्न रीजनिंग का परीक्षण करता है: दस डोमेन में फैले 100 पीडीएफ, पाठ, तालिकाओं, चार्ट और फ़ुटनोट के 4,592 पृष्ठों में वितरित साक्ष्य के साथ। प्रतिक्रियाओं को 1,275 विशेषज्ञ-लिखित परमाणु मानदंडों के अनुसार वर्गीकृत किया गया है, और शीर्षक ऑल-पास रेट किसी कार्य को तभी श्रेय देता है जब प्रत्येक मानदंड संतुष्ट होता है।

एक लंबे समय से चला आ रहा बेंचमार्क खत्म होने जा रहा है: जीपीक्यूए डायमंड, स्नातक स्तर का विज्ञान तर्क परीक्षण, हटा दिया गया है क्योंकि इसे फ्रंटियर मॉडल द्वारा प्रभावी ढंग से संतृप्त किया गया है।

फर्म ने अपने ग्रेडिंग इंफ्रास्ट्रक्चर को भी अपग्रेड किया, एक नए ग्रेडिंग सिस्टम प्रॉम्प्ट और सही उत्तर कुंजी के साथ AA-LCR v1.1 जारी किया, GDPval-AA v2 और AA-ब्रीफ़केस के लिए Elo स्केल को फिर से एंकर किया ताकि नए मॉडल आने पर रेटिंग स्थिर रहे, और SciCode के ग्रेडिंग सैंडबॉक्स को सख्त किया जा सके ताकि धीमा-लेकिन-सही कोड अब विफलता के रूप में गिना न जाए।

नए परीक्षणों से क्या पता चलता है

नए मूल्यांकनों के नतीजे इस बात की अधिक विस्तृत तस्वीर पेश करते हैं कि सीमांत प्रयोगशालाएँ वास्तव में कहाँ खड़ी हैं।

एए-ब्रीफ़केस पर, एंथ्रोपिक के क्लाउड फैबल 5.1 और ओपस 5 आगे हैं, इसके बाद ओपनएआई के जीपीटी-6 एस्ट्रा और मेटा के म्यूज़ स्पार्क 1.3 हैं। GPT-6 एस्ट्रा का स्कोर समान मूल्यांकन पर GPT-5.6 Sol से लगभग 85 Elo अंक अधिक है - क्रमिक OpenAI पीढ़ियों के बीच एक पर्याप्त उछाल।

GDP.pdf पर, चित्र पलटता है: OpenAI 33.2% ऑल-पास दर पर GPT-6 एस्ट्रा के साथ आगे है, इसके बाद GPT-5.6 Sol 28.2% और क्लाउड फैबल 5.1 26.2% पर है। विचलन से पता चलता है कि बहुत बड़े संदर्भों में लंबे दस्तावेज़ संश्लेषण ओपनएआई के नवीनतम मॉडल के लिए एक सापेक्ष ताकत बनी हुई है, भले ही एंथ्रोपिक के मॉडल समग्र सूचकांक और एजेंटिक कार्य कार्यों का नेतृत्व करते हैं।

निजी परीक्षण सेट क्यों मायने रखते हैं

आयोजित-आउट मूल्यांकन की ओर बदलाव एआई बेंचमार्किंग में व्यापक विश्वसनीयता समस्या को दर्शाता है। जैसे-जैसे मॉडलों ने अधिक सार्वजनिक परीक्षण डेटा को अवशोषित किया है, प्रयोगशालाओं और स्वतंत्र पर्यवेक्षकों की चिंता बढ़ गई है कि प्रसिद्ध बेंचमार्क पर हेडलाइन स्कोर वास्तविक क्षमता के बजाय याद रखने या लक्षित प्रशिक्षण को दर्शाते हैं। अपने परीक्षण सेटों की बढ़ती हिस्सेदारी को निजी रखकर और उन्हें अधिक महत्व देकर, कृत्रिम विश्लेषण उस संकेत को संरक्षित करने का प्रयास कर रहा है जिसे सार्वजनिक लीडरबोर्ड खो रहे हैं।

फर्म ने कहा कि वह "महीनों से" इंडेक्स v5 के तत्वों का निर्माण कर रही है और प्रमुख मॉडल लॉन्च की हालिया लहर के दौरान इंडेक्स को स्थिर रखने के लिए जानबूझकर अपडेट को रोक दिया है। अंतरिम v4.2 रिलीज़ के अलावा, यह निकट भविष्य में और अधिक वृद्धिशील अपडेट की योजना बना रहा है क्योंकि यह v5 संक्रमण को पूरा करता है।

फ्रंटियर मॉडल के बीच चयन करने वाले खरीदारों के लिए, v4.2 से व्यावहारिक निष्कर्ष यह है कि बाजार के शीर्ष पर एंथ्रोपिक और ओपनएआई के बीच दो-घोड़ों की दौड़ बनी हुई है, जिसमें मेटा अंतर को कम कर रहा है - और गेमिंग के प्रतिरोधी होने के लिए डिज़ाइन किए गए मूल्यांकन अब अधिक रैंकिंग कार्य कर रहे हैं। मॉडल चयन निर्णयों पर नज़र रखने वाले उपयोगकर्ता v5 रोलआउट के निकट आने पर नवीनतम AI विकास का अनुसरण कर सकते हैं।

एआई से आगे रहें

इस तरह के बेंचमार्क अपडेट उद्योग की प्रगति को आंकने के तरीके को नया आकार देते हैं। अधिक एआई समाचार पढ़ें और हर मॉडल रिलीज से आगे रहें।

अधिक AI समाचार पढ़ें →