Anthropic च्या Claude Opus 5 ने ARC-AGI-3 बेंचमार्कवर वर्चस्व गाजवल्यानंतर OpenAI मागे ढकलत आहे, त्याचे स्वतःचे GPT-5.6 Sol मॉडेल 38.3 टक्के दर्शवणारे परिणाम प्रकाशित करत आहे — जर तुम्ही अधिकृत चाचणी हार्नेस ऐवजी OpenAI ची पसंतीची सेटिंग्ज वापरत असाल तर.

30 जुलै 2026 रोजी सुरू झालेला हा वाद AI मूल्यमापनातील वाढत्या समस्येच्या केंद्रस्थानी आहे: बेंचमार्क यापुढे केवळ मॉडेलचे मोजमाप करत नाहीत, तर संपूर्ण तांत्रिक मचान त्याभोवती गुंडाळले गेले आहे. नवीनतम AI घडामोडी आणि मॉडेल रिलीजच्या सखोल विश्लेषणासाठी, AI Buzz Wire कथेचा मागोवा घेत आहे.

संख्या आणि पकड

OpenAI ने अहवाल दिला की GPT-5.6 Sol ने ARC-AGI-3 वर 38.3 टक्क्यांपर्यंत पोहोचले आहे, ज्याने अँथ्रोपिकच्या क्लॉड ओपस 5ला मागे टाकले आहे, ज्याने यापूर्वी बेंचमार्कच्या विक्रमाच्या चौपटीने 30.2 टक्के गुण मिळवले आहेत. चेतावणी महत्त्वपूर्ण आहे: ती 38.3 टक्के संख्या OpenAI च्या प्रतिसाद API च्या दोन विशिष्ट वैशिष्ट्यांवर अवलंबून आहे.

पहिले रिटेन्ड रिझनिंग आहे, जे प्रत्येक क्रियेनंतर मॉडेलच्या विचारांची साखळी स्टेप्समध्ये जपून ठेवते. दुसरे म्हणजे कॉम्पॅक्शन, जे जुने संदर्भ कापण्याऐवजी सारांशित करते, मॉडेलला पूर्वीचे तर्क न गमावता दीर्घ समस्यांवर काम करत राहण्याची परवानगी देते.

ARC प्राइजच्या अधिकृत प्रमाणित हार्नेसद्वारे चालवा — जे सफरचंद-ते-सफरचंद तुलना सुनिश्चित करण्यासाठी प्रदाता-विशिष्ट सेटिंग्ज जाणूनबुजून टाळतात — GPT-5.6 Sol फक्त 7.8 टक्के व्यवस्थापित केले. ओपनएआयचे म्हणणे असे आहे की, अधिकृत सेटअप प्रत्येक पायरीनंतर मॉडेलचे तर्क टाकून देते, ज्यामुळे सतत बहु-चरण विचारांची आवश्यकता असलेल्या कार्यांची कार्यक्षमता कमी होते.

शुद्धतेसाठी तयार केलेला बेंचमार्क

ARC-AGI-3 ची रचना François Chollet आणि ARC पारितोषिक टीमने याआधी कधीही न पाहिलेली नवीन तर्कशुद्ध कोडी सोडवण्याच्या मॉडेलच्या क्षमतेची तपासणी करण्यासाठी केली होती - लक्षात ठेवलेल्या ज्ञानापेक्षा सामान्य बुद्धिमत्तेची चाचणी. तुलना निष्पक्ष ठेवण्यासाठी, अधिकृत हार्नेस तटस्थ वातावरणात कच्च्या मॉडेल क्षमतेचे मोजमाप करून, प्रदाता-विशिष्ट वैशिष्ट्ये जाणूनबुजून काढून टाकतात.

OpenAI चे प्रतिवाद असा आहे की ही तटस्थता एक अपंग बनू शकते. कंपनीचे म्हणणे आहे की अधिकृत हार्नेस जुन्या "ओपनएआय-शैलीच्या पूर्णता API" वर अवलंबून आहे ज्यामध्ये क्लॉड APIने आधीच ऑफर केलेल्या क्षमतांचा अभाव आहे, मूळ तुलनेत ओपनएआयला अँथ्रोपिकच्या तुलनेत संरचनात्मक गैरसोयीमध्ये प्रभावीपणे टाकले आहे.

थोडक्यात, OpenAI म्हणत आहे: तुम्ही आमचे मॉडेल त्याच्या पाठीमागे एक हात बांधून मोजले.

चोलेटचा प्रतिसाद

ARC पुरस्काराचे सह-संस्थापक François Chollet यांनी दोन प्रकारच्या चाचणी सेटअपमध्ये स्पष्ट रेषा रेखाटून प्रतिसाद दिला. "बेंचमार्क सोडवण्यासाठी सानुकूल बनवलेले किंवा बेंचमार्क स्वरूपाचे ज्ञान असलेले" वापरणे ही मर्यादा नाही, तो म्हणाला. परंतु सामान्य-उद्देश API सेटिंग्ज "जे ARC-AGI-3 साठी विकसित केले गेले नाहीत आणि जे सर्व API वापरकर्त्यांसाठी उपलब्ध आहेत" हे योग्य गेम आहे.

प्रत्यक्षात, चोलेटने कबूल केले की एआरसी प्राइजच्या स्वतःच्या GPT-5.6 सोल स्कोअरने ओपनएआयला तोटा दिला. त्यांनी नमूद केले की संस्थेने "त्यांच्या मॉडेल्सची सर्वोत्तम चाचणी कशी करावी, विशेषत: कॉम्पॅक्शनच्या संदर्भात" ओपनएआय बरोबर बरेच काही केले आहे आणि "उत्तर शोधून काढणे सुरू केल्याने" कंपनीचे स्वागत केले.

Chollet एक उर्वरित चिंता ध्वजांकित केले. भिन्न सेटिंग्ज वापरणारे भिन्न प्रदाते ज्याला "संभाव्य समता समस्या" म्हणतात ते तयार करतात — परंतु तो "सेटिंग्ज आणि किंमत स्पष्टपणे नोंदवल्या जाईपर्यंत" ते स्वीकार्य मानतो.

हे लीडरबोर्डच्या पलीकडे का महत्त्वाचे आहे

एपिसोड एक तणाव अधोरेखित करतो जो एआय उद्योग प्रगतीचे मूल्यांकन कसे करतो हे बदलत आहे. स्टँडअलोन सिस्टीम ऐवजी वैशिष्ट्यपूर्ण API द्वारे मॉडेल्स वाढत्या प्रमाणात तैनात केले जात असल्याने, मॉडेलची अंतर्निहित क्षमता आणि त्याच्या सभोवतालची अभियांत्रिकी यांच्यातील रेषा अस्पष्ट होत राहते. स्कॅफोल्डिंगकडे दुर्लक्ष करणारा बेंचमार्क वास्तविक-जगातील कामगिरीला कमी लेखू शकतो; ज्याने ते स्वीकारले ते चाचणी गेमिंगसाठी कंपन्यांना बक्षीस देऊ शकते.

ARC-AGI-3 वादविवाद शेवटचा असण्याची शक्यता नाही. प्रस्थापित बेंचमार्कच्या शीर्षस्थानी फ्रंटियर मॉडेल्स क्लस्टर असल्याने, वाजवी मोजमाप म्हणून काय मोजले जाते यावरील मतभेद — आणि कोणाच्या हार्नेसने मानक सेट केले — आणखी तीव्र होतील.

AI च्या पुढे रहा

मॉडेल, बेंचमार्क आणि ते तयार करणाऱ्या लॅबवर ब्रेकिंग एआय न्यूज फॉलो करू इच्छिता? एआय बझ वायरने तुम्हाला कव्हर केले आहे.

अधिक AI बातम्या वाचा