OpenAI च्या GPT-6 Astra ने ARC-AGI-3 वर अत्याधुनिक परिणाम पोस्ट केले आहेत, एजंटिक बुद्धिमत्ता मोजण्यासाठी डिझाइन केलेले अमूर्त तर्क बेंचमार्क, ARC प्राइज फाउंडेशनने बुधवारी प्रकाशित केलेल्या निकालांनुसार. फाउंडेशनच्या स्टँडर्ड हार्नेस अंतर्गत बेंचमार्कच्या सेमी-प्रायव्हेट सेटवर मॉडेलने 62.7% गुण मिळवले आणि 99.9% प्रोव्हायडर ॲडॉप्टर हार्नेससह मूल्यमापन केले जे विनंत्यांच्या दरम्यान मॉडेलच्या अंतर्गत तर्क स्थितीचे रक्षण करते.
OpenAI ने Astra चे स्टेज रोलआउट सुरू केल्यानंतर एक दिवसानंतर निकाल आले, हे फ्लॅगशिप मॉडेल कंपनीने नवीन युगाची सुरुवात म्हणून तयार केले आहे. फ्रंटियर लॅबच्या ट्रेड बेंचमार्कचा स्कोअर चालू ठेवण्याचा प्रयत्न करणाऱ्या वाचकांसाठी, नवीनतम AI घडामोडी पेज प्रत्येक मोठ्या रिलीझचा मागोवा घेते.
दोन हार्नेस, दोन अतिशय भिन्न स्कोअर
Astra च्या दोन शीर्षक क्रमांकांमधील अंतर हा अहवालातील सर्वात महत्त्वाचा तपशील आहे. एआरसी प्राइज वेगवेगळ्या हार्नेस अंतर्गत एजंटचे मूल्यांकन करते आणि प्रत्येक मॉडेलला त्याच्या स्वतःच्या संदर्भानुसार काय करण्याची परवानगी आहे ते बदलते.
स्टँडर्ड हार्नेस अंतर्गत, एखादे मॉडेल वातावरणात कार्य करत असताना ते ठेवण्यासाठी निवडलेल्या नोट्स पुढे नेऊ शकते. त्या सेटअपसह, Astra ने जास्तीत जास्त तर्कशक्तीच्या प्रयत्नात 62.7% गुण मिळवले, मूल्यमापन रनसाठी एकूण $26,098 खर्च. विरुद्ध टोकाला, तर्क बंद करून समान हार्नेस चालवण्याने केवळ 35.2% उत्पादन केले तर जास्त किंमत - $49,791 — कारण मॉडेलला प्रगती करण्यासाठी आणखी अनेक क्रियांची आवश्यकता आहे.
प्रदाता अडॅप्टर हार्नेस अधिक उदार आहे: ते विनंत्यांमधील मॉडेलची अपारदर्शक तर्क स्थिती जपते आणि दीर्घ संभाषणांसाठी कॉम्पॅक्शन वापरते, Astra ला पूर्वीच्या कामाचा पुन्हा वापर करू देते. त्या हार्नेस अंतर्गत, Astra ने $18,817 साठी उच्च तर्काच्या प्रयत्नात 99.9% आणि $17,332 साठी जास्तीत जास्त प्रयत्नात 98.6% गुण मिळवले. अगदी सर्वात कमी तर्क सेटिंग 96.7% पर्यंत पोहोचली.
दुस-या शब्दात सांगायचे तर, आंशिक स्कोअर आणि जवळपास-परिपूर्ण स्कोअर मधील फरक हा एकटा कच्चा क्षमता नाही - हे मॉडेलची कार्यशील स्थिती पायऱ्यांदरम्यान किती टिकते.
कृती कार्यक्षमतेवर मानवांना मारहाण
ARC-AGI-3 हे कादंबरी, अमूर्त, टर्न-आधारित गेम वातावरणाभोवती तयार केले आहे. एजंटांनी निर्देशांशिवाय एक्सप्लोर करणे आवश्यक आहे, जग कसे कार्य करते याचा अंदाज लावला पाहिजे, विरळ पुरस्कारांमधून लक्ष्ये ओळखणे आणि अनेक-चरण क्रियांची योजना करणे आवश्यक आहे. वातावरण कॅलिब्रेट केले जाते जेणेकरून मानव त्यापैकी 100% सोडवू शकतील, ज्यामुळे मानवी कार्यक्षमतेला आधारभूत बेंचमार्क उपाय बनतात.
Astra ने फक्त बहुतेक स्तर सोडवले नाही - ते कार्यक्षमतेने सोडवले. ARC प्राइजनुसार, मॉडेलने 96% स्तरांवर सरासरी चाचणी केलेल्या मानवापेक्षा कमी क्रिया वापरल्या, संपूर्ण संचातील कृती कार्यक्षमतेमध्ये मानवी बेसलाइनला मागे टाकले.
तुलनेचे अर्थशास्त्र कठोर आहे. मानवी चाचणी सहभागींना $115 प्रति 90-मिनिट सत्र अधिक $5 प्रति पूर्ण गेम, अंदाजे $12.78 प्रति गेम प्रयत्न केले गेले. संपूर्ण Astra मूल्यमापन रनची किंमत कॉन्फिगरेशनवर अवलंबून, पाच आकडे असते. परंतु एआरसी प्राइजने एक काउंटरइंट्युटिव्ह सुरकुत्या लक्षात घेतल्या: उच्च तर्कशक्तीच्या प्रयत्नांना साधारणपणे कमी खर्च येतो, कारण ॲस्ट्राने कमी कृतींमध्ये गेम सोडवले, ज्यामुळे मॉडेल कॉलची एकूण संख्या आणि प्रति रन बर्न केलेले टोकन कमी केले.
स्वतःची भाषा तयार करणारे मॉडेल
स्कोअरच्या पलीकडे, एआरसी पुरस्काराने संघाने निरीक्षण केलेल्या गुणात्मक वर्तनावर प्रकाश टाकला. Astra ने सातत्याने अपरिचित वातावरणांना कॉम्पॅक्ट सिम्बॉलिक वर्ल्ड मॉडेल्समध्ये रूपांतरित केले — गेम मेकॅनिक्सचे तार्किक नियम म्हणून प्रतिनिधित्व करणे आणि राज्य आणि योजना क्रियांचा मागोवा घेण्यासाठी स्वतःचे डोमेन-विशिष्ट लघुलेख विकसित करणे.
हेच कौशल्य ARC-AGI-3 तपासण्यासाठी तयार करण्यात आले होते. जिथे बेंचमार्कच्या आधीच्या पिढ्यांनी कादंबरी नमुन्यांवर द्रव तर्क तपासले, तिसरी पिढी एजंट कधीही न पाहिलेल्या वातावरणात एक्सप्लोर करू शकतो, मॉडेल करू शकतो, ध्येय सेट करू शकतो आणि योजना राबवू शकतो की नाही याची चाचपणी करतो — ARC बक्षीस हे घटक एक्सप्लोरेशन, मॉडेलिंग, ध्येय-सेटिंग आणि नियोजन आणि अंमलबजावणी म्हणून सूचीबद्ध करतात.
एजीआय-युग पार्श्वभूमी
OpenAI कडूनच जास्तीत जास्त वक्तृत्वाच्या दरम्यान बेंचमार्क निकाल आले. गुरुवारच्या लाँचपूर्वी एका पत्रकार परिषदेत, कंपनीचे अध्यक्ष ग्रेग ब्रॉकमन म्हणाले की, "आम्ही आता एजीआय युगात आहोत असे वाटणे अवास्तव नाही," तर औपचारिक घोषणा थांबवताना, नवीन स्टॅकच्या लॉन्चच्या कव्हरेजनुसार. त्यांनी AGI चे वर्णन कॉन्ट्रॅक्टिकल ट्रिगर ऐवजी "मिशन संकल्पना किंवा आध्यात्मिक संकल्पना" म्हणून केले.
OpenAI संशोधक एडन क्लार्क यांनी सांगितले की, Astra हे कंपनीचे आजपर्यंतचे सर्वात मोठे प्रशिक्षण आहे - टेक्सासमधील Stargate साइटवर 100,000 हून अधिक GPUs वर प्री-ट्रेन केलेले पहिले - आणि पहिले OpenAI प्रकाशन ज्यामध्ये प्रशिक्षण प्रक्रियेचे पर्यवेक्षण करण्यात पूर्वीच्या मॉडेलने महत्त्वपूर्ण भूमिका बजावली होती. ॲक्सेस स्टेजवर राहते: डेब्रेक प्रोग्राममधील एंटरप्राइझ ग्राहकांसह रोलआउटची सुरुवात होते, प्लस, प्रो, बिझनेस आणि एंटरप्राइझची उपलब्धता अधिक API आणि AWS ऍक्सेस येण्याचे वचन दिले आहे.
स्कोअरवरील तारांकन
अनेक आघाड्यांवर सावधगिरी बाळगणे आवश्यक आहे. Astra चे ARC-AGI-3 कार्यप्रदर्शन हार्नेस कॉन्फिगरेशनवर मोठ्या प्रमाणात अवलंबून असते, जसे की दोन हेडलाइन नंबर दर्शवतात, आणि सानुकूल हार्नेस जे मॉडेल स्थिती टिकवून ठेवतात ते बेंचमार्क विवादांमध्ये वारंवार विवादाचे बिंदू आहेत. नवीन स्टॅकच्या लॉन्चच्या विश्लेषणात असे नमूद केले आहे की Astra "विशिष्ट कार्यांवर मोठे नफा मिळवते, परंतु ते प्रीमियमवर येते आणि कोडिंग पॅकमध्ये स्पष्टपणे नेतृत्व करत नाही" - एक स्मरणपत्र आहे की एजंटिक कोडे बेंचमार्क आणि दररोजचे व्यावसायिक वर्कलोड वेगवेगळ्या गोष्टी मोजतात.
एआरसी प्राइज स्वतःच सध्याच्या AI आणि AGI मधील "अवशिष्ट अंतर" मोजण्यासाठी व्यायामाला फ्रेम करते, AGI ची व्याख्या मानव करू शकणारे कोणतेही कौशल्य आत्मसात करण्याची क्षमता, मानव करू शकते तितक्या कार्यक्षमतेने करते. अनुकूल परिस्थितीत जवळपास-परिपूर्ण स्कोअर हे अंतर स्वतःहून कमी करत नाही. आणि प्रत्येक मूल्यमापनासाठी $17,000 ते $50,000 पर्यंत, या प्रमाणात बेंचमार्क चालवण्यास केवळ सुसंस्कारित प्रयोगशाळाच परवडतात — जरी ARC प्राइजचा खर्च डेटा दाखवतो की हुशार तर्क प्रत्यक्षात बिल कमी करू शकतो.
हे महत्त्वाचे का आहे
कृती कार्यक्षमता ही तुलना करण्याचा एक वास्तविक नवीन अक्ष आहे. एक मॉडेल जे प्रत्येक स्तरावर निराकरण करते परंतु हजारो कॉल वाया घालवते ते कमी उपयुक्त आहे — आणि अधिक महाग — जे Astra येथे केले त्यापेक्षा: मुद्दाम एक्सप्लोर करणे, जे शिकते ते संकुचित करणे आणि त्यावर कार्य करणे. एजीआय वादविवादाचा निष्कर्ष काहीही असो, एआरसी प्राइज डेटा दर्शवितो की फ्रंटियर एजंट आता केवळ नवीन समस्या सोडवू शकतात की नाही यावर नव्हे तर ते आर्थिकदृष्ट्या ते कसे सोडवतात यावर मानवांशी जुळत आहेत.
AI च्या पुढे रहा
प्रत्येक बेंचमार्क परिणाम, मॉडेल लॉन्च आणि सुरक्षा वादविवाद, जसे घडते तसे ट्रॅक केले जाते — अधिक एआय बातम्या वाचा →
