जॉन शुलमैन, ओपनएआई के सह-संस्थापक, जो अब थिंकिंग मशीन्स में मुख्य वैज्ञानिक के रूप में कार्यरत हैं, ने कहा कि उन्हें लगभग तीन से चार वर्षों में पुनरावर्ती आत्म-सुधार - एआई सिस्टम अपने स्वयं के विकास में तेजी लाने की उम्मीद है, एक समयरेखा जो उन्हें क्षेत्र में अधिक आक्रामक पूर्वानुमानकर्ताओं के बीच रखती है। शुलमैन ने यह अनुमान शुक्रवार को प्रकाशित द्वारकेश पॉडकास्ट के एक गोलमेज एपिसोड के दौरान दिया, जिसमें तीन फ्रंटियर लैब शोधकर्ताओं ने खुले तौर पर बहस की कि उद्योग वास्तव में अपनी सीमा के कितना करीब है।
बातचीत ने इस बात पर एक दुर्लभ नज़र डाली कि सीमा के करीब के शोधकर्ता प्रगति के बारे में कैसे सोच रहे हैं, एक शोर भरे सप्ताह के बीच पहुंचे जिसमें एनवीडिया के सीईओ जेन्सेन हुआंग ने घोषणा की कि "एजीआई आ गया है" और 25 फील्ड मेडलिस्टों के एक समूह ने चेतावनी दी है कि एआई बेंचमार्क-चेज़िंग गणित को नुकसान पहुंचा रही है। नवीनतम एआई विकास पर नज़र रखने वाले पाठकों के लिए, यह एपिसोड एक उपयोगी प्रतिकार है: ये सिस्टम बनाने वाले लोग हैं, और वे एक-दूसरे से पूरी तरह असहमत हैं।
मेज पर कौन था
मेजबान द्वारकेश पटेल ने कहा कि उन्होंने पैनल को इकट्ठा किया क्योंकि मेहमान "कुछ हद तक खुली प्रयोगशालाओं और कंपनियों" में काम करते हैं, जिसका अर्थ है कि वे रिकॉर्ड पर बोल सकते हैं। शुलमैन के साथ ओपन-सोर्स मॉडल विकसित करने वाले स्टार्टअप ज़िफ्रा के मुख्य प्रौद्योगिकी अधिकारी बेरेन मिलिज और बेसटेन में मॉडल प्रशिक्षण के प्रमुख चार्ली ओ'नील शामिल हुए।
शुलमैन की साख उनकी टाइमलाइन चर्चा को विशेष महत्व देती है। उन्होंने ओपनएआई की सह-स्थापना की और थिंकिंग मशीन्स के लिए प्रस्थान करने से पहले, मानव फीडबैक अनुसंधान से सुदृढीकरण सीखने का नेतृत्व किया, जिसने चैटजीपीटी के पीछे की तकनीकों का निर्माण किया, जहां वह अब मुख्य वैज्ञानिक के रूप में कार्य करते हैं।
विलक्षणता के विरुद्ध मामला, स्टीलमैन्ड
पटेल ने एक तीखे प्रश्न के साथ शुरुआत की: यदि 2036 दुनिया को बदलने वाले अरबों सुपरइंटेलिजेंट सिस्टम के बिना आता है, तो तकनीकी कारण क्या होगा? मिलिज ने संशयवाद के लिए सबसे मजबूत मामला पेश किया, जिसमें उन्होंने लगभग मोरावेक के विरोधाभास-शैली पैटर्न का वर्णन किया, जिसमें मॉडल शोधकर्ताओं द्वारा उनके सामने रखे गए किसी भी बेंचमार्क में सफल होते हैं, फिर भी वास्तविक दुनिया का प्रभाव निराश करता है।
मिलिज ने एक ऐसी दुनिया का वर्णन करते हुए कहा, "अभी भी कुछ लगातार सिम-टू-रियल अंतर है जो किसी भी तरह से सब कुछ अवरुद्ध कर रहा है, जहां एआई" उन सभी चीज़ों में बेहद अच्छा हो जाता है जिन्हें लोग बेंचमार्क में डालते हैं। उन्होंने कहा कि वह इस नतीजे को असंभावित मानते हैं, इस सबूत की ओर इशारा करते हुए कि सुदृढीकरण सीखना पहले से ही व्यवहार में सामान्य हो गया है।
शुलमैन काफी हद तक सहमत थे कि प्रगति स्वचालित नहीं है। उन्होंने कहा, मनुष्य आज के मॉडलों की तुलना में वास्तविक लाभ रखता है, और प्रत्येक नए मॉडल की रिलीज कुछ क्षेत्रों में आगे बढ़ती है, जबकि अन्य में बाधा बनी रहती है - वह पैटर्न जिसने पिछले कई उत्पाद चक्रों को परिभाषित किया है।
रैपिड-फायर समयसीमा: दो साल, तीन से चार, पांच से दस
जब पटेल ने संख्या के लिए दबाव डाला तो पैनल विभाजित हो गया। यह पूछे जाने पर कि एआई एक सक्षम सफेदपोश कार्यकर्ता के लिए उत्पादकता में दस गुना वृद्धि कब प्रदान कर सकता है, शुलमैन ने पहले एक भी आंकड़ा देने से इनकार कर दिया, फिर कहा, "मैं दो साल कहूंगा।" मिलिज ने कहा कि वह "वास्तव में इसे देख सकते हैं," यह तर्क देते हुए कि काम की कुछ श्रेणियों के लिए लाभ पहले से ही 10 गुना से अधिक है। ओ'नील सबसे अधिक रूढ़िवादी थे, उन्होंने "5 से 10" वर्षों तक उत्तर दिया।
इसके बाद पटेल ने परिदृश्य को "मूल रूप से सिर्फ एएसआई" बताते हुए आगे बढ़ाया। शुलमैन की प्रतिक्रिया: "मैं कहूंगा कि 3-4 साल," यह कहते हुए कि एआई अनुसंधान को स्वचालित करना "एआई के लिए सबसे कठिन चीजों में से एक नहीं है, क्योंकि इसमें बहुत सारे काम शामिल हैं" जो कि वर्तमान तकनीकें पहले से ही कर सकती हैं। यह आदान-प्रदान इस बात के लिए उल्लेखनीय था कि अनुमान को अन्य शोधकर्ताओं से कितना कम समर्थन मिला।
स्वचालित शोधकर्ताओं को वास्तव में कैसे प्रशिक्षित किया जाएगा
एपिसोड का एक बड़ा हिस्सा उस परिदृश्य के यांत्रिकी से संबंधित है जिसमें शुलमैन मूल्य निर्धारण कर रहा था। यह पूछे जाने पर कि एआई अनुसंधान को स्वचालित करने में सक्षम एआई सिस्टम को कैसे प्रशिक्षित किया जाएगा, शुलमैन ने वर्णन किया "शोधकर्ताओं के स्वाद को अवशोषित करने के लिए मानव प्रतिक्रिया से सीखने का कुछ संयोजन, और बस बहुत सारे अभ्यास वातावरण बनाना जिसमें बहु-चरण अनुसंधान करना शामिल है।"
यह उत्तर इस बात से जुड़ा है कि उद्योग का पैसा कहां जा रहा है। मैकेनाइज़ के लिए Google का हाल ही में पूरा हुआ सौदा, एक स्टार्टअप जो प्रशिक्षण एजेंटों के लिए अनुरूपित कार्य वातावरण बनाता है, बिल्कुल इस शर्त को दर्शाता है कि बेहतर प्रशिक्षण आधार - न कि केवल बड़े मॉडल - क्षमता लाभ के अगले दौर को आगे बढ़ाएंगे। शुलमैन ने एक मुख्य कठिनाई को भी चिह्नित किया: प्राकृतिक डेटा पर निर्मित इनाम कार्यों को निर्दिष्ट करना कठिन है, और सतही संकेत जैसे कि उपयोगकर्ता ने कोड संपादन स्वीकार किया है या नहीं, प्रशिक्षण को गुमराह कर सकता है।
आसवन बनाम केंद्रीकरण
शुलमैन की सबसे ठोस भविष्यवाणियों में से एक उद्योग संरचना से संबंधित है। "मुझे लगता है कि आसवन मुख्य चीज है जो केंद्रीकरण बल के खिलाफ लड़ती है," उन्होंने कहा, यह तर्क देते हुए कि सुदृढीकरण सीखने के माध्यम से सीखी गई क्षमताओं को अपेक्षाकृत आसानी से छोटे मॉडलों में स्थानांतरित किया जा सकता है, कुछ कंपनियों से परे सीमांत-आसन्न क्षमता का प्रसार किया जा सकता है जो सीमांत प्रशिक्षण रन का खर्च उठा सकते हैं।
इस सवाल पर कि मनुष्यों के लिए क्या बचा है, शुलमैन स्पष्टवादी थे। उन्होंने कहा, "मैं कहूंगा कि इंसानों के लिए आखिरी काम, या इंसानों के लिए सबसे लंबे समय तक चलने वाली भूमिका, उद्देश्य को परिभाषित करना और यह तय करना है कि हम वास्तव में क्या चाहते हैं।" जब पटेल ने संक्षेप में बताया कि "संरेखण अंतिम काम है," तो शुलमैन ने सहमति व्यक्त की: "संरेखण एक प्रकार का उत्तर है," जबकि यह ध्यान में रखते हुए कि यह सही उद्देश्य का पता लगाने और फिर वास्तव में इसे प्राप्त करने में विघटित हो जाता है।
जहां एपिसोड टाइमलाइन बहस में फिट बैठता है
एपिसोड का उपशीर्षक - "हम छत के पास कहीं नहीं हैं" - इसके समग्र सार को दर्शाता है: शोधकर्ता जो आगे पर्याप्त रनवे देखते हैं, यहां तक कि वे इस बात पर भी विवाद करते हैं कि रास्ता कितना ऊबड़-खाबड़ होगा। चर्चा इस बात पर हुई कि चीनी प्रयोगशालाओं की प्रगति किस कारण से हो रही है, क्या लंबी-क्षितिज सुदृढीकरण सीखने से सामान्य बुद्धिमत्ता प्राप्त हो सकती है, और आरएल ने पहले की तरह काम करना क्यों शुरू कर दिया है।
इस महीने हर तरफ समयसीमा को लेकर सार्वजनिक बहस तेज हो गई है। ब्लूमबर्ग के अनुसार, हुआंग की "एजीआई आ गई है" उद्घोषणा पर विश्लेषकों ने संदेह व्यक्त किया, जिन्होंने इसे वैज्ञानिक दावे के बजाय एक व्यावसायिक मामले के रूप में पढ़ा, जबकि ओपनएआई के सीईओ सैम ऑल्टमैन ने कर्मचारियों से कहा कि सुरक्षा चिंताओं के बढ़ने के कारण कंपनी अत्याधुनिक विकास को धीमा करने के लिए तैयार है। पुनरावर्ती आत्म-सुधार के लिए शुलमैन की तीन से चार साल की खिड़की विपणन और अधिस्थगन के बीच कहीं बैठती है - तकनीकों के निर्माण के ट्रैक रिकॉर्ड वाले किसी व्यक्ति का कामकाजी अनुमान जो अब क्षेत्र को चला रहा है।
वह सही है या नहीं, यह उन सवालों पर निर्भर करेगा जिन पर पैनल ने केवल विचार किया है: क्या सुदृढीकरण सीखना अपने प्रशिक्षण परिवेशों को सामान्यीकृत करता रहता है, और क्या बेंचमार्क प्रदर्शन और वास्तविक आर्थिक मूल्य के बीच का अंतर कम होता रहता है।
एआई से आगे रहें
फ्रंटियर शोधकर्ता सार्वजनिक रूप से एआई की सीमाओं पर बहस कर रहे हैं - जैसे-जैसे कहानी विकसित होती है, उसका अनुसरण करें।
एआई बज़ वायर पर अधिक एआई समाचार पढ़ें