OpenAI चे GPT-6 Astra कोडिंग आघाडीवर वापरकर्ता-विश्वास समस्यांशी झुंज देत आहे, परंतु नवीन रोबोटिक्स बेंचमार्कवर ते संख्या पोस्ट करत आहे ज्यात संशोधक गुणात्मक झेपबद्दल बोलत आहेत. StationeryBench वर, सामान्य डेस्क वस्तूंभोवती तयार केलेली चाचणी, Astra ने 100 पैकी 7 कार्ये पूर्ण केली, तर Ai2 च्या MolmoAct2, ज्या मॉडेलच्या विरोधात उभे होते, ते शून्य पूर्ण केले.
द डिकोडरने वर्णन केलेले बेंचमार्क, दोन मॉडेल्सना पाच डेस्क-ऑब्जेक्ट टास्कमध्ये एकमेकांच्या विरुद्ध उभे करतात — मार्कर अनकॅप करणे, पेपर क्लिप ओतणे किंवा दोन रोबोट हातांमधून शासक पास करणे. दोन्ही मॉडेल्सने 200 चाचण्यांमध्ये समान ड्युअल-आर्म YAM रोबोट्स नियंत्रित केले, एक नियंत्रण डिझाइन ज्याचा अर्थ हार्डवेअर फरकांपासून मॉडेल क्षमता वेगळे करणे आहे. सर्व परिणाम, व्हिडिओ आणि कोड GitHub वर प्रकाशित केले गेले आहेत. यासारख्या अधिक संशोधन कव्हरेजसाठी, आमचे AI न्यूज हब पहा.
एक 'स्टेप चेंज', संशोधकांच्या मते
कॉर्नेल आणि Google DeepMind मधील AI संशोधक Yoav Artzi यांनी Astra च्या कार्यप्रदर्शनाला "स्थानिक तर्कामध्ये एक टप्पा बदल" असे म्हटले - ज्या प्रकारचे भाषा बेंचमार्क परिणाम क्वचितच मिळतात. REMAP नावाच्या अद्याप-अप्रकाशित बेंचमार्कवर, Astra मानवी पातळीच्या अगदी जवळ पोहोचते, जरी आर्टझीने नमूद केले की "इतर परिस्थितींमध्ये मानव काय करतात ते Astra देखील प्राप्त करत नाही."
Astra च्या सरासरी प्रगती स्कोअरने 100 पैकी 46 गुण मिळवले, ज्याच्या तुलनेत MolmoAct2 साठी 12 - हे अंतर जे हेडलाइन पूर्ण करण्याच्या आकड्यांपेक्षा जास्त महत्त्वाचे आहे. रोबोटिक्सची कार्ये आंशिक प्रगती तसेच पूर्ण यशावर श्रेणीबद्ध केली जातात आणि प्रतिस्पर्ध्याच्या सरासरी स्कोअरच्या तिप्पट करणे हे सूचित करते की मूठभर चाचण्यांमध्ये नशिबाने यशस्वी होण्याऐवजी मॅनिपुलेशन सीक्वेन्सद्वारे मॉडेल सातत्याने पुढे जात आहे.
अवकाशीय तर्क अचानक महत्त्वाचा का होतो
परिणाम एस्ट्राला कसे प्रशिक्षित केले गेले याचे संकेत देते. Artzi संशयित आहे की OpenAI ने मॉडेलला मोठ्या प्रमाणात 3D डेटा, जसे की ब्लेंडर दृश्ये, 3D कार्यांवर मॉडेलच्या विशिष्ट सामर्थ्यानुसार प्रशिक्षित केले. जर ते वाचन योग्य असेल, तर ते सूचित करते की सिंथेटिक 3D वातावरण — वास्तविक-जगातील डेटा संकलनापेक्षा स्वस्त आणि सुरक्षित — भौतिक-जागतिक सक्षमतेसाठी एक व्यवहार्य मार्ग बनत आहेत, रोबोटिक्समधील सर्वात दीर्घकालीन अडथळ्यांपैकी एक.
बेंचमार्कचे डिझाइन रोबोटिक्सचे मूल्यांकन कोठे जात आहे याबद्दल काहीतरी सांगते. स्टेशनरीबेंचची कामे जाणूनबुजून सांसारिक आहेत — मार्कर अनकॅप करणे, पेपर क्लिप ओतणे, शासक सोपवणे — कारण रोजच्या फेरफार, सिनेमॅटिक पराक्रम नव्हे, हे लॅब डेमोला उपयुक्त मशीनपासून वेगळे करते. 200 चाचण्यांमध्ये एकाच ड्युअल-आर्म YAM हार्डवेअरवर दोन्ही मॉडेल्सचे ग्रेडिंग करणे आणि प्रत्येक व्हिडिओ प्रकाशित करणे, हे फ्रंटियर लॅबच्या फ्लॅगशिपचा समावेश असलेल्या क्षमतेच्या दाव्यासाठी असामान्यपणे पारदर्शक सेटअप आहे.
MolmoAct2, ॲलन इन्स्टिट्यूट फॉर AI (Ai2) चे तुलनात्मक मॉडेल, कोणतेही कार्य पूर्ण न करणे हा स्वतःचा प्रकार आहे: हे सूचित करते की सामान्य-उद्देशीय सीमा मॉडेल आणि उद्देश-निर्मित रोबोटिक्स मॉडेल्समधील अंतर आता केवळ बंद होत नाही तर उलट होत आहे, कमीतकमी तर्क-हेवी मॅनिपुलेशनवर.
हे OpenAI च्या नमूद केलेल्या महत्त्वाकांक्षेशी देखील जुळते: डीकोडरने उद्धृत केलेल्या अहवालानुसार, कंपनीने स्वतःचे ग्राहक रोबोट तयार करण्याच्या दीर्घकालीन योजना आहेत. एक फ्रंटियर लँग्वेज मॉडेल जे वस्तू, हात आणि प्रक्षेपण बद्दल तर्क करू शकते हे त्या खेळपट्टीचा अर्धा सॉफ्टवेअर आहे. हार्डवेअरचा अर्धा भाग अनसुलझा राहिला आहे, परंतु स्टेशनरीबेंच सारखे बेंचमार्क ही कथा कशी मोजली जाते.
संदर्भ: एक जटिल आठवडा असलेले मॉडेल
परिणाम OpenAI साठी एक विचित्र बातम्या चक्रात उतरतो. या बेंचमार्कच्या मध्यभागी असलेल्या समान मॉडेलने लाँच झाल्यापासून वापरकर्त्याच्या तक्रारींचा सामना करत आठवडा घालवला आहे - कोडेक्स वापर मर्यादा रीसेट करण्यापूर्वी, ओपनएआयने चुकीच्या कौशल्यापासून ते चुकीच्या वर्तणुकीच्या संदर्भ प्रयोगापर्यंत तीन नामांकित दोष शोधले आहेत. प्रयोगशाळेत स्टेप-चेंज परिणाम पोस्ट करताना उत्पादनात अडखळणारे मॉडेल हे सध्याच्या AI उद्योगाचे वैशिष्ट्य आहे: क्षमता आणि विश्वासार्हता वेगवेगळ्या घड्याळांवर प्रगती करत आहे.
ओपनएआयचे स्वतःचे नेतृत्व सामील झाल्याच्या सुरक्षिततेच्या चर्चेदरम्यान देखील हे उतरले. कंपनीच्या मुख्य शास्त्रज्ञाने चेतावणी दिली आहे की कोणत्याही प्रयोगशाळेने वाढत्या स्वायत्त प्रणालींचे नियंत्रण सोडवले नाही आणि अँथ्रोपिकच्या सीईओने उद्योगाला संपूर्णपणे सीमावर्ती विकास कमी करण्याचे आवाहन केले आहे. भौतिक जगामध्ये फेरफार करणारे मॉडेल दर्शविणारे बेंचमार्क — जरी जग हे फक्त स्टेशनरीमध्ये झाकलेले एक डेस्क असले तरीही — दोन्ही अधिकारी जेव्हा ते सांगतात की प्रगतीचा वेग निरिक्षणापेक्षा जास्त आहे तेव्हा ते असेच निकाल देतात.
तळ ओळ
100 पैकी सात पूर्ण पूर्ण झालेली कामे उद्या तुमच्या डेस्कवर रोबोट ठेवणार नाहीत. परंतु प्रतिस्पर्ध्याच्या शून्यावरून सातवर जाणे, सरासरी प्रगती स्कोअर तीनपट जास्त आहे, ही एक प्रकारची खंडितता आहे जी दोन वर्षांपूर्वी भाषा समजण्याच्या क्षमतेचे चार्ट पुन्हा तयार करते. विकसक देय देण्यास तयार असलेल्या किमतीवर, बेंचमार्कच्या बाहेर, समान मॉडेल ती क्षमता भरवशावर देऊ शकते का हा खुला प्रश्न आहे.
एआयच्या पुढे राहा
बेंचमार्क, यश आणि कृती करणाऱ्या मशीन्सची शर्यत — दररोज अनुसरण करतात.
अधिक एआय बातम्या वाचा →