एंथ्रोपिक के क्लाउड ओपस 5 के एआरसी-एजीआई-3 बेंचमार्क पर हावी होने के बाद ओपनएआई पीछे हट रहा है, ऐसे परिणाम प्रकाशित कर रहा है जो अपने स्वयं के जीपीटी-5.6 सोल मॉडल को 38.3 प्रतिशत तक पहुंचाते हैं - बशर्ते कि आप आधिकारिक परीक्षण हार्नेस के बजाय ओपनएआई की पसंदीदा सेटिंग्स का उपयोग करें।

यह विवाद, जो 30 जुलाई, 2026 को चला, एआई मूल्यांकन में बढ़ती समस्या की जड़ में है: बेंचमार्क अब केवल एक मॉडल को नहीं मापते, बल्कि इसके चारों ओर लिपटे पूरे तकनीकी ढांचे को मापते हैं। नवीनतम एआई विकास और मॉडल रिलीज के गहन विश्लेषण के लिए, एआई बज़ वायर कहानी पर नज़र रख रहा है।

नंबर और पकड़

ओपनएआई ने बताया कि जीपीटी-5.6 सोल एआरसी-एजीआई-3 पर 38.3 प्रतिशत तक पहुंच गया है, जो एंथ्रोपिक के क्लाउड ओपस 5 से आगे निकल गया है, जिसने पहले बेंचमार्क के रिकॉर्ड को चौगुना करने के बाद 30.2 प्रतिशत स्कोर किया था। चेतावनी महत्वपूर्ण है: 38.3 प्रतिशत का आंकड़ा ओपनएआई के रिस्पॉन्स एपीआई की दो विशिष्ट विशेषताओं पर निर्भर करता है।

पहला है रिटेन्ड रीजनिंग, जो प्रत्येक क्रिया के बाद इसे त्यागने के बजाय चरणों के बीच मॉडल की विचार श्रृंखला को संरक्षित करता है। दूसरा है कॉम्पैक्शन, जो पुराने संदर्भ को छोटा करने के बजाय सारांशित करता है, जिससे मॉडल को पहले के तर्क को खोए बिना लंबी समस्याओं पर काम करना जारी रखने की अनुमति मिलती है।

एआरसी पुरस्कार के आधिकारिक मानकीकृत हार्नेस के माध्यम से चलाएं - जो जानबूझकर सेब-से-सेब की तुलना सुनिश्चित करने के लिए प्रदाता-विशिष्ट सेटिंग्स से बचता है - जीपीटी-5.6 सोल केवल 7.8 प्रतिशत ही प्रबंधित हुआ। OpenAI का तर्क है कि इसका कारण यह है कि आधिकारिक सेटअप हर चरण के बाद मॉडल के तर्क को खारिज कर देता है, जिससे उन कार्यों पर प्रदर्शन कम हो जाता है जिनके लिए निरंतर बहु-चरणीय सोच की आवश्यकता होती है।

शुद्धता के लिए बनाया गया एक बेंचमार्क

एआरसी-एजीआई-3 को फ्रांकोइस चॉलेट और एआरसी पुरस्कार टीम द्वारा डिजाइन किया गया था ताकि एक मॉडल की उपन्यास तर्क पहेली को हल करने की क्षमता की जांच की जा सके जो उसने पहले कभी नहीं देखी थी - याद किए गए ज्ञान के बजाय सामान्य बुद्धि का परीक्षण। तुलनाओं को निष्पक्ष बनाए रखने के लिए, आधिकारिक हार्नेस जानबूझकर प्रदाता-विशिष्ट सुविधाओं को हटा देता है, तटस्थ वातावरण में कच्चे मॉडल की क्षमता को मापता है।

ओपनएआई का प्रतिवाद यह है कि यह तटस्थता एक बाधा बन सकती है। कंपनी का तर्क है कि आधिकारिक हार्नेस पुराने "ओपनएआई-स्टाइल पूर्णता एपीआई" पर निर्भर था, जिसमें पहले से ही पेश की गई क्लाउड एपीआई की क्षमताओं का अभाव था, जिससे मूल तुलना में ओपनएआई को एंथ्रोपिक के सापेक्ष संरचनात्मक नुकसान में डाल दिया गया था।

संक्षेप में, OpenAI कह रहा है: आपने हमारे मॉडल को उसकी पीठ के पीछे एक हाथ बांधकर मापा।

चॉलेट की प्रतिक्रिया

एआरसी पुरस्कार के सह-संस्थापक फ्रांकोइस चॉलेट ने दो प्रकार के परीक्षण सेटअपों के बीच एक स्पष्ट रेखा खींचकर जवाब दिया। उन्होंने कहा, "बेंचमार्क को हल करने के लिए कस्टम-निर्मित या जिसमें बेंचमार्क प्रारूप के बारे में ज्ञान होता है" हार्नेस सीमा से बाहर हैं। लेकिन सामान्य प्रयोजन एपीआई सेटिंग्स "जो एआरसी-एजीआई-3 के लिए विकसित नहीं की गई थीं और जो सभी एपीआई उपयोगकर्ताओं के लिए उपलब्ध हैं" उचित खेल हैं।

वास्तव में, चॉलेट ने स्वीकार किया कि एआरसी पुरस्कार के अपने जीपीटी-5.6 सोल स्कोर ने ओपनएआई को नुकसान में डाल दिया। उन्होंने कहा कि संगठन ने "अपने मॉडलों का सर्वोत्तम परीक्षण कैसे किया जाए, विशेष रूप से संघनन के संबंध में, इसके बारे में ओपनएआई के साथ काफी बातचीत की है," और कंपनी का स्वागत किया "उत्तर का पता लगाना शुरू कर दिया है।"

चॉलेट ने एक शेष चिंता को चिह्नित किया। अलग-अलग प्रदाता अलग-अलग सेटिंग्स का उपयोग करके उसे "संभावित समता समस्या" कहते हैं - लेकिन वह इसे स्वीकार्य मानते हैं "जब तक सेटिंग्स और लागत स्पष्ट रूप से रिपोर्ट की जाती है।"

यह लीडरबोर्ड से परे क्यों मायने रखता है

यह एपिसोड उस तनाव को रेखांकित करता है जो एआई उद्योग की प्रगति का मूल्यांकन करने के तरीके को नया आकार दे रहा है। जैसे-जैसे मॉडलों को स्टैंडअलोन सिस्टम के बजाय सुविधा-संपन्न एपीआई के माध्यम से तैनात किया जा रहा है, मॉडल की अंतर्निहित क्षमता और उसके आसपास की इंजीनियरिंग के बीच की रेखा धुंधली होती जा रही है। एक बेंचमार्क जो मचान को नजरअंदाज करता है वह वास्तविक दुनिया के प्रदर्शन को कम आंक सकता है; जो इसे अपनाता है वह परीक्षण में गेमिंग के लिए कंपनियों को पुरस्कृत कर सकता है।

ARC-AGI-3 बहस आखिरी होने की संभावना नहीं है। जैसे-जैसे फ्रंटियर मॉडल स्थापित बेंचमार्क के शीर्ष के करीब पहुंचते हैं, निष्पक्ष माप के रूप में क्या गिना जाता है - और मानक निर्धारित करने के लिए किसका उपयोग होता है - इस पर असहमति केवल तीव्र होगी।

एआई से आगे रहें

क्या आप मॉडल, बेंचमार्क और उन्हें बनाने वाली प्रयोगशालाओं पर [ब्रेकिंग एआई न्यूज़] (https://aibuzzwire.news) का अनुसरण करना चाहते हैं? एआई बज़ वायर ने आपको कवर किया है।

अधिक AI समाचार पढ़ें