ओपनएआई के जीपीटी-6 एस्ट्रा ने अपने रिकॉर्ड में एक असामान्य ट्रॉफी जोड़ी है: वाल्व के प्रतिष्ठित प्रथम-व्यक्ति गूढ़ पोर्टल का एक पूर्ण प्लेथ्रू, $571.18 की कुल गणना लागत पर 24 घंटे से कम समय में स्वायत्त रूप से पूरा किया गया। द वर्ज ने 6 सितंबर, 2026 को इस मील के पत्थर की सूचना दी, जिसमें कोज़ीब्लेज़ नाम के एक उपयोगकर्ता को श्रेय दिया गया, जिसने फ्रंटियर मॉडल को गेम से जोड़ा और उसे बाकी का पता लगाने दिया।

पोर्टल अपनी उम्र के बावजूद एआई एजेंट के लिए एक कठिन परीक्षा है। 2007 में वाल्व द्वारा जारी इस गेम में खिलाड़ियों को एक पोर्टल गन का उपयोग करके स्थानिक पहेलियों के बारे में तर्क करने की आवश्यकता होती है - परीक्षण कक्षों के माध्यम से जाने के लिए दीवारों, फर्श और छत में जुड़े हुए खुले स्थान बनाना जो नियमित रूप से अंतर्ज्ञान को चुनौती देते हैं। इसमें सहारा लेने के लिए कोई मुकाबला नहीं है और अनुसरण करने के लिए कोई खोज चिह्न नहीं है; प्रत्येक कक्ष मूलतः एक भौतिकी पहेली है। सीमांत मॉडलों का तनाव-परीक्षण कैसे किया जा रहा है, यह जानने वाले पाठकों के लिए, यह रन हमारे एआई विकास कवरेज में एक ज्वलंत प्रविष्टि है।

डेमो वीडियो से पूर्ण समापन तक

रन कहीं से नहीं आया. इससे पहले 6 सितंबर को, GPT-6 एस्ट्रा को पोर्टल खेलते हुए दिखाने वाला एक YouTube वीडियो हैकर न्यूज़ पर प्रसारित हुआ था, और एक अनुवर्ती पोस्ट में कहा गया था कि मॉडल ने गेम को "स्वचालित रूप से पूरा" कर लिया था, जैसे-जैसे दिन चढ़ता गया, ध्यान आकर्षित होता गया। द वर्ज की रिपोर्ट ने विवरण की पुष्टि की: पूरा गेम, 24 घंटों से कम समय में, $600 से भी कम की गणना में - संशयवादियों के लिए प्रकाशित रन के एक संक्षिप्त वीडियो के साथ।

द वर्ज बिल के पर्यावरणीय पक्ष की मात्रा निर्धारित करने से खुद को रोक नहीं सका, यह देखते हुए कि रन ने संभवतः डेटा सेंटर कूलिंग में लगभग एक छोटे स्विमिंग पूल के बराबर पानी की खपत की। यह एक व्यंग्यात्मक अनुस्मारक है कि एजेंटिक गेमिंग रन उपयोगकर्ता के लिए सस्ते हैं लेकिन ग्रह के लिए मुफ़्त नहीं हैं।

क्यों 2007 का गूढ़ व्यक्ति एक गंभीर बेंचमार्क है

बीटिंग पोर्टल एआरसी-एजीआई या एसडब्ल्यूई-बेंच की तरह एक निर्धारित बेंचमार्क नहीं है, और यही कारण है कि यह आंशिक रूप से प्रतिध्वनित होता है। यह गेम ठीक उसी कौशल की मांग करता है जिसने ऐतिहासिक रूप से मनुष्यों को एआई सिस्टम से अलग किया है:

  • स्थानिक तर्क। समाधान के लिए यह अनुमान लगाने की आवश्यकता होती है कि एक पोर्टल निकास खिलाड़ी के शरीर को कहां लॉन्च करेगा - त्रि-आयामी भौतिकी तर्क जिसने वर्षों से एजेंटों को परेशान किया है।
  • दीर्घ-क्षितिज योजना। कक्ष श्रृंखला कई चरण; अंतिम चरण में विफल होने का अर्थ आमतौर पर प्रारंभ से अनुक्रम को फिर से करना होता है।
  • बिना मदद के विफलता से सीखना। कोई संकेत नहीं हैं। एजेंट को परीक्षण और त्रुटि के माध्यम से खेल के नियमों का अनुमान लगाना चाहिए, फिर उन्हें नए कक्षों में सामान्यीकृत करना चाहिए।

इस साल की शुरुआत में, OpenAI का GPT-6 एस्ट्रा एजेंटिक रीजनिंग पर केंद्रित ARC-AGI-3 बेंचमार्क में शीर्ष पर रहा, और मॉडल ने कंप्यूटर-उपयोग क्षमताओं के लिए ध्यान आकर्षित किया है - सॉफ्टवेयर इंटरफेस को एक व्यक्ति की तरह संचालित करने की क्षमता। पोर्टल रन उसी कौशल सेट का एक चंचल लेकिन वास्तविक प्रदर्शन है: धारणा, योजना और नियंत्रण, मानव हस्तक्षेप के बिना घंटों तक अनियंत्रित।

एक व्यापक लहर का हिस्सा

यह दौड़ इस बात का भी संकेत है कि 2026 में एआई गेमिंग कहां पहुंच गई है। बेंचमार्क स्कोर अब सांस्कृतिक मील के पत्थर के साथ स्थान साझा करते हैं: मॉडल बाख कोरल की रचना करते हैं, हस्तलिखित-सुधार पहचान परीक्षणों को हराते हैं, और उन खेलों को पूरा करते हैं जो एक बार वाक्यांश "कंप्यूटर ऐसा कभी नहीं करेंगे" के लिए खड़े थे। प्रत्येक पास एक पुरानी निश्चितता से छुटकारा दिलाता है और यह सवाल उठाता है कि अगला क्या होगा।

इसके व्यावहारिक निहितार्थ भी हैं। वही लूप जो कोज़ीब्लेज़ के सेटअप को कुछ सौ डॉलर की लागत पर पोर्टल चलाने देता है - स्क्रीनशॉट अंदर, निर्णय बाहर - सॉफ्टवेयर परीक्षण, रोबोटिक्स और कंप्यूटर-उपयोग सहायकों के लिए लूप का उत्पादन किया जा रहा है। एक मॉडल जो गेम के भौतिकी को पूरी तरह से ध्यान में रख सकता है, वह सिद्धांत रूप में, लंबे, गंदे सॉफ़्टवेयर कार्यों को पूरा कर सकता है जो छोटे-संदर्भ प्रणालियों को हरा सकते हैं।

हालाँकि, अभी के लिए, टेकअवे सरल है। एक एआई ने गेमिंग की सबसे प्रिय पहेलियों में से एक को शुरू से अंत तक, एक नए जीपीयू की जमा राशि की कीमत पर हरा दिया - और वीडियो पोस्ट किया। एपर्चर विज्ञान के परीक्षण कक्ष मनुष्यों को चतुर महसूस कराने के लिए डिज़ाइन किए गए थे। इस सप्ताहांत, उन्होंने एक मॉडल को धाराप्रवाह दिखाया।

रन कैसे प्राप्त हुआ

प्रतिक्रिया ने आम तौर पर एआई गेमिंग मील के पत्थर के आर्क को ट्रैक किया: पहले अविश्वास, फिर वीडियो, फिर स्वीकृति। हैकर न्यूज़ पर, रन ने टिप्पणीकारों की एक सतत धारा को आकर्षित किया जो यह बता रहे थे कि सेटअप कैसे काम करता है और एजेंटिक एआई के बारे में इसका क्या मतलब है - कई लोगों ने नोट किया कि कुल बिल कई लोगों की तुलना में कम था, जो इस तरह के रन की लागत होगी। समापन के संक्षिप्त वीडियो ने संशयवादियों को स्वयं दावे को सत्यापित करने का एक तरीका दिया, जो कि अधिकांश बेंचमार्क परिणामों की पेशकश से कहीं अधिक है।

इसने पहले आए मील के पत्थर के साथ तुलना को भी आमंत्रित किया। बोर्ड गेम से लेकर रीयल-टाइम रणनीति से लेकर ओपन-एंडेड सैंडबॉक्स तक, गेमिंग ने दशकों से इस क्षेत्र के सार्वजनिक साबित मैदान के रूप में काम किया है। हर बार जब कोई गेम गिरता है, तो तर्क बदल जाता है: आज के संशयवादी इस बात पर जोर देते हैं कि यह उपलब्धि संकीर्ण, विशिष्ट या किसी तरह से सामान्यीकरण योग्य नहीं थी। उस इतिहास में पोर्टल के संचालन को उल्लेखनीय बनाने वाली बात यह है कि सेटअप कितना सामान्य था - एक व्यावसायिक रूप से उपलब्ध फ्रंटियर मॉडल, एक उपभोक्ता गेम और गेम के लिए विशेष रूप से प्रशिक्षित एक विशेष अनुसंधान प्रणाली के बजाय कुछ सौ डॉलर की गणना।

---

एआई से आगे रहें

नवीनतम एआई समाचार, विश्लेषण और सफलताएँ प्राप्त करें - सभी एक ही स्थान पर।

अधिक AI समाचार पढ़ें →