OpenAI का GPT-6 एस्ट्रा कोडिंग के मोर्चे पर उपयोगकर्ता-विश्वास की समस्याओं से जूझ रहा हो सकता है, लेकिन एक नए रोबोटिक्स बेंचमार्क पर यह संख्याएँ पोस्ट कर रहा है जिससे शोधकर्ता गुणात्मक छलांग के बारे में बात कर रहे हैं। स्टेशनरीबेंच पर, सामान्य डेस्क ऑब्जेक्ट्स के आसपास बनाया गया एक परीक्षण, एस्ट्रा ने 100 में से 7 कार्यों को पूरी तरह से पूरा किया, जबकि एआई2 के मोल्मोएक्ट2, जिस मॉडल के खिलाफ उसे खड़ा किया गया था, उसने शून्य को पूरा किया।

डिकोडर द्वारा वर्णित बेंचमार्क, पांच डेस्क-ऑब्जेक्ट कार्यों में दो मॉडलों को एक-दूसरे के खिलाफ खड़ा करता है - एक मार्कर को अनकैप करना, पेपर क्लिप डालना, या दो रोबोट हथियारों के बीच एक शासक को पास करना। दोनों मॉडलों ने 200 परीक्षणों में समान दोहरे हाथ वाले YAM रोबोटों को नियंत्रित किया, एक नियंत्रण डिज़ाइन का उद्देश्य मॉडल क्षमता को हार्डवेयर अंतर से अलग करना था। सभी परिणाम, वीडियो और कोड GitHub पर प्रकाशित किए गए हैं। इस तरह के अधिक शोध कवरेज के लिए, हमारे एआई न्यूज हब को देखें।

शोधकर्ताओं के अनुसार, एक 'कदम परिवर्तन'

कॉर्नेल और गूगल डीपमाइंड के एआई शोधकर्ता योव आर्टज़ी ने एस्ट्रा के प्रदर्शन को "स्थानिक तर्क में एक कदम बदलाव" कहा - जिस तरह के भाषा बेंचमार्क परिणाम शायद ही कभी मिलते हैं। REMAP नामक अभी भी अप्रकाशित बेंचमार्क पर, एस्ट्रा मानव स्तर के करीब सटीकता तक पहुंचता है, हालांकि आर्टज़ी ने कहा कि "यहां तक ​​​​कि एस्ट्रा को वह नहीं मिलता जो मनुष्य अन्य परिदृश्यों में करते हैं।"

एस्ट्रा का औसत प्रगति स्कोर 100 में से 46 तक पहुंच गया, जबकि मोल्मोएक्ट2 के लिए यह 12 था - एक अंतर जो हेडलाइन पूर्णता संख्याओं से अधिक मायने रखता है। रोबोटिक्स कार्यों को आंशिक प्रगति के साथ-साथ पूर्ण सफलता पर वर्गीकृत किया जाता है, और एक प्रतिद्वंद्वी के औसत स्कोर को तीन गुना करना इंगित करता है कि मॉडल मुट्ठी भर परीक्षणों में भाग्य से सफल होने के बजाय लगातार हेरफेर अनुक्रमों के माध्यम से आगे बढ़ रहा है।

स्थानिक तर्क अचानक क्यों मायने रखता है

परिणाम से संकेत मिलता है कि एस्ट्रा को कैसे प्रशिक्षित किया गया था। आर्टज़ी को संदेह है कि ओपनएआई ने मॉडल को बड़ी मात्रा में 3डी डेटा, जैसे कि ब्लेंडर दृश्यों, पर प्रशिक्षित किया है, जो 3डी कार्यों पर मॉडल की विशेष ताकत के अनुरूप होगा। यदि यह पढ़ना सही है, तो यह सुझाव देता है कि सिंथेटिक 3डी वातावरण - वास्तविक दुनिया के डेटा संग्रह की तुलना में सस्ता और सुरक्षित - भौतिक-दुनिया की क्षमता के लिए एक व्यवहार्य मार्ग बन रहा है, जो रोबोटिक्स में सबसे लंबे समय से चली आ रही बाधाओं में से एक है।

बेंचमार्क का डिज़ाइन इस बारे में भी कुछ कहता है कि रोबोटिक्स मूल्यांकन किस दिशा में जा रहा है। स्टेशनरीबेंच के कार्य जानबूझकर सांसारिक हैं - एक मार्कर को खोलना, पेपर क्लिप डालना, एक शासक को सौंपना - क्योंकि रोजमर्रा का हेरफेर, सिनेमाई करतब नहीं, जो लैब डेमो को उपयोगी मशीनों से अलग करता है। 200 परीक्षणों के दौरान एक ही डुअल-आर्म YAM हार्डवेयर पर दोनों मॉडलों की ग्रेडिंग करना और हर वीडियो को प्रकाशित करना, फ्रंटियर लैब के फ्लैगशिप से जुड़े क्षमता दावे के लिए एक असामान्य रूप से पारदर्शी सेटअप है।

मोल्मोएक्ट2, एआई (एआई2) के लिए एलन इंस्टीट्यूट का तुलनात्मक मॉडल, किसी भी कार्य को पूरा करना अपनी तरह का डाटाम नहीं है: यह सुझाव देता है कि सामान्य-उद्देश्य फ्रंटियर मॉडल और उद्देश्य-निर्मित रोबोटिक्स मॉडल के बीच का अंतर अब न केवल बंद हो रहा है, बल्कि कम से कम तर्क-भारी हेरफेर पर भी कम हो रहा है।

द डिकोडर द्वारा उद्धृत रिपोर्ट के अनुसार, यह ओपनएआई की घोषित महत्वाकांक्षाओं के साथ भी फिट बैठता है: कंपनी के पास अपने स्वयं के उपभोक्ता रोबोट बनाने की दीर्घकालिक योजना है। एक सीमांत भाषा मॉडल जो वस्तुओं, हाथों और प्रक्षेप पथों के बारे में तर्क कर सकता है, उस पिच का सॉफ्टवेयर आधा हिस्सा है। हार्डवेयर का आधा हिस्सा अनसुलझा है, लेकिन स्टेशनरीबेंच जैसे बेंचमार्क से उस कहानी को मापा जाता है।

संदर्भ: एक जटिल सप्ताह वाला मॉडल

परिणाम OpenAI के लिए एक अजीब समाचार चक्र में आ गया। इस बेंचमार्क के केंद्र में एक ही मॉडल ने उपयोगकर्ता की शिकायतों का सामना करते हुए सप्ताह बिताया है कि लॉन्च के बाद से यह बेवकूफ हो गया है - कोडेक्स उपयोग सीमा को रीसेट करने से पहले, ओपनएआई ने मिसफायरिंग कौशल से लेकर दुर्व्यवहार संदर्भ प्रयोग तक तीन नामित दोषों का पता लगाया था। एक मॉडल जो प्रयोगशाला में चरण-परिवर्तन परिणाम पोस्ट करते समय उत्पादन में लड़खड़ाता है, वर्तमान एआई उद्योग का एक सारांश है: क्षमता और विश्वसनीयता विभिन्न घड़ियों पर आगे बढ़ रही है।

यह एक सुरक्षा बहस के बीच भी सामने आया है जिसमें OpenAI का अपना नेतृत्व शामिल हुआ है। कंपनी के मुख्य वैज्ञानिक ने चेतावनी दी है कि किसी भी प्रयोगशाला ने तेजी से स्वायत्त प्रणालियों पर नियंत्रण का समाधान नहीं निकाला है, और एंथ्रोपिक के सीईओ ने उद्योग से सीमांत विकास को पूरी तरह से धीमा करने का आह्वान किया है। भौतिक दुनिया में हेरफेर करने वाले मॉडलों को दिखाने वाले बेंचमार्क - भले ही दुनिया स्टेशनरी से ढकी एक डेस्क ही क्यों न हो - बिल्कुल उसी तरह के परिणाम हैं जो दोनों अधिकारी तब उद्धृत करते हैं जब वे तर्क देते हैं कि प्रगति की गति निरीक्षण से अधिक है।

तल - रेखा

100 में से सात पूरी तरह से पूर्ण किए गए कार्य कल आपके डेस्क पर रोबोट नहीं रखेंगे। लेकिन प्रतिद्वंद्वी के शून्य से सात तक जाना, औसत प्रगति स्कोर तीन गुना अधिक के साथ, उस तरह की असंगति है जिसने दो साल पहले भाषा समझ में क्षमता चार्ट को फिर से तैयार किया था। खुला प्रश्न यह है कि क्या वही मॉडल बेंचमार्क के बाहर, डेवलपर्स द्वारा भुगतान की जाने वाली कीमत पर भरोसेमंद रूप से वह क्षमता प्रदान कर सकता है।

एआई से आगे रहें

बेंचमार्क, सफलताएं और काम करने वाली मशीनों की ओर दौड़ - हर दिन अपनाई जाती है।

अधिक AI समाचार पढ़ें →