OpenAI کے GPT-6 Astra نے اپنے ریکارڈ میں ایک غیر معمولی ٹرافی کا اضافہ کیا ہے: والو کے مشہور فرسٹ پرسن پزلر پورٹل کا مکمل پلے تھرو، 24 گھنٹے سے کم وقت میں $571.18 کی کل کمپیوٹ لاگت پر خود مختاری سے مکمل ہوا۔ The Verge نے 6 ستمبر 2026 کو اس سنگ میل کی اطلاع دی، جس میں ایک صارف کو کریڈٹ دیا گیا جسے cozyblaze کہا جاتا ہے، جس نے فرنٹیئر ماڈل کو گیم تک وائرڈ کیا اور اسے باقی کا پتہ لگانے دیا۔

پورٹل ایک AI ایجنٹ کے لیے اس کی عمر کے باوجود ایک مشکل امتحان ہے۔ والو کے ذریعہ 2007 میں جاری کیا گیا، اس گیم کے لیے کھلاڑیوں کو پورٹل گن کا استعمال کرتے ہوئے مقامی پہیلیاں کے بارے میں استدلال کرنے کی ضرورت ہوتی ہے - دیواروں، فرشوں اور چھتوں میں منسلک سوراخوں کو ٹیسٹ چیمبر میں منتقل کرنے کے لیے جو معمول کے مطابق وجدان کی خلاف ورزی کرتے ہیں۔ اس پر جھکنے کے لیے کوئی جنگی پیسنے کی ضرورت نہیں ہے اور اس کی پیروی کرنے کے لیے کوئی کوسٹ مارکر نہیں ہے۔ ہر چیمبر بنیادی طور پر ایک طبیعیات کی پہیلی ہے۔ قارئین کے لیے کہ کس طرح فرنٹیئر ماڈلز کو تناؤ سے آزمایا جا رہا ہے، یہ دوڑ ہماری AI ڈیولپمنٹ کوریج میں ایک واضح اندراج ہے۔

ڈیمو ویڈیوز سے مکمل تکمیل تک

بھاگ دوڑ کہیں سے نہیں نکلی۔ اس سے پہلے 6 ستمبر کو، ہیکر نیوز پر GPT-6 Astra پلے پورٹل کو چلانے والی یوٹیوب کی ویڈیو گردش کر رہی تھی، اور ایک فالو اپ پوسٹ جس میں نوٹ کیا گیا تھا کہ ماڈل نے "خود مختار طور پر مکمل" کر لیا ہے، دن کے ساتھ ساتھ گیم نے توجہ حاصل کی۔ دی ورج کی رپورٹ نے تفصیلات کی تصدیق کی ہے: مکمل گیم، جو 24 گھنٹے سے کم میں مارا گیا، کمپیوٹ میں $600 سے بھی کم میں - اس رن کی گاڑھی ویڈیو کے ساتھ جو شک کرنے والوں کے لیے شائع ہوئی۔

دی ورج بل کے ماحولیاتی پہلو کو درست کرنے میں مزاحمت نہیں کر سکتا تھا، یہ نوٹ کرتے ہوئے کہ رن نے ڈیٹا سینٹر کولنگ میں تقریباً ایک چھوٹے سے سوئمنگ پول کا پانی کھایا تھا۔ یہ ایک یاد دہانی ہے کہ ایجنٹ گیمنگ رنز صارف کے لیے سستے ہیں لیکن سیارے کے لیے مفت نہیں ہیں۔

کیوں ایک 2007 پزلر ایک سنجیدہ معیار ہے۔

بیٹنگ پورٹل ARC-AGI یا SWE-bench کی طرح طے شدہ بینچ مارک نہیں ہے، اور اسی وجہ سے جزوی طور پر یہ گونجتا ہے۔ گیم بالکل وہی مہارتیں مانگتی ہے جس نے تاریخی طور پر انسانوں کو AI سسٹمز سے الگ کیا ہے:

  • مقامی استدلال۔ حل کے لیے یہ پیشین گوئی کی ضرورت ہوتی ہے کہ ایک پورٹل ایگزٹ کھلاڑی کے جسم کو کہاں سے شروع کرے گا — تین جہتی طبیعیات کا استدلال جو برسوں سے ایجنٹوں کو ٹرپ کر رہا ہے۔
  • طویل افق کی منصوبہ بندی۔ چیمبرز متعدد مراحل کا سلسلہ؛ حتمی مرحلے میں ناکام ہونے کا مطلب عام طور پر شروع سے ترتیب کو دوبارہ کرنا ہے۔
  • ہاتھ پکڑے بغیر ناکامی سے سیکھنا۔ کوئی اشارے نہیں ہیں۔ ایجنٹ کو آزمائش اور غلطی کے ذریعے گیم کے اصولوں کا اندازہ لگانا چاہیے، پھر انہیں نئے چیمبرز میں عام کرنا چاہیے۔

اس سال کے شروع میں، OpenAI کا GPT-6 Astra ARC-AGI-3 بینچ مارکس میں سرفہرست رہا جو ایجنٹی استدلال پر مرکوز ہے، اور ماڈل نے کمپیوٹر کے استعمال کی صلاحیتوں پر توجہ مبذول کرائی ہے - سافٹ ویئر انٹرفیس کو چلانے کی صلاحیت جس طرح سے کوئی شخص کرے گا۔ پورٹل رن اسی مہارت کے سیٹ کا ایک چنچل لیکن حقیقی مظاہرہ ہے: ادراک، منصوبہ بندی، اور کنٹرول، بغیر کسی انسانی مداخلت کے گھنٹوں تک انرول۔

ایک وسیع تر لہر کا حصہ

یہ دوڑ اس بات کی بھی علامت ہے کہ AI گیمنگ 2026 میں کہاں پہنچی ہے۔ بینچ مارک اسکورز اب ثقافتی سنگ میل کے ساتھ جگہ کا اشتراک کرتے ہیں: Bach chorales کمپوز کرنے والے ماڈلز، ہاتھ سے لکھے ہوئے تصحیح کی شناخت کے ٹیسٹوں کو شکست دیتے ہیں، اور گیمز کو مکمل کرتے ہیں جو کہ ایک زمانے میں "کمپیوٹر کبھی ایسا نہیں کریں گے۔" ہر پاس ایک پرانے یقین کو دور کرتا ہے اور یہ سوال اٹھاتا ہے کہ اگلا کیا ہوگا۔

عملی مضمرات بھی ہیں۔ وہی لوپ جو cozyblaze کے سیٹ اپ کو پورٹل کو چلانے دیتا ہے — چند سو ڈالر کی لاگت سے اسکرین شاٹس، فیصلے آؤٹ — کیا یہ لوپ سافٹ ویئر ٹیسٹنگ، روبوٹکس، اور کمپیوٹر کے استعمال کے معاونین کے لیے تیار کیا جا رہا ہے۔ ایک ایسا ماڈل جو گیم کی فزکس کو ایک مکمل پلے تھرو کے لیے ذہن میں رکھ سکتا ہے، اصولی طور پر، لمبے، گندے سافٹ وئیر کے کاموں کو پیس سکتا ہے جو مختصر سیاق و سباق کے نظام کو شکست دیتے ہیں۔

ابھی کے لیے، اگرچہ، ٹیک وے آسان ہے۔ ایک AI نے گیمنگ کی سب سے پسندیدہ پہیلیوں میں سے ایک کو ہرا دیا، ایک نئے GPU کے ڈپازٹ کی قیمت کے لیے ختم کرنا شروع کر دیا — اور ویڈیو پوسٹ کی۔ اپرچر سائنس کے ٹیسٹ چیمبرز کو انسانوں کو ہوشیار محسوس کرنے کے لیے ڈیزائن کیا گیا تھا۔ اس ہفتے کے آخر میں، انہوں نے ایک ماڈل کو روانی سے دیکھا۔

رن کیسے موصول ہوا۔

جواب نے عام طور پر AI گیمنگ سنگ میل کے آرک کو ٹریک کیا: پہلے کفر، پھر ویڈیو، پھر قبولیت۔ ہیکر نیوز پر، رن نے تبصرہ کرنے والوں کا ایک مستقل سلسلہ کھینچا کہ سیٹ اپ کس طرح کام کرتا ہے اور اس کا ایجنٹ AI کے بارے میں کیا مطلب ہے - بہت سے لوگوں نے نوٹ کیا کہ کل بل بہت سے لوگوں کے خیال سے کم تھا کہ اس طرح کی رن لاگت آئے گی۔ تکمیل کی گاڑھی ویڈیو نے شکوک و شبہات کو خود دعوی کی تصدیق کرنے کا ایک طریقہ فراہم کیا، جو کہ زیادہ تر بینچ مارک نتائج کی پیشکش سے زیادہ ہے۔

اس نے پہلے آنے والے سنگ میلوں کے ساتھ موازنہ کی بھی دعوت دی۔ گیمنگ نے کئی دہائیوں سے فیلڈ کے عوامی ثابت کرنے کے میدان کے طور پر خدمات انجام دی ہیں، بورڈ گیمز سے لے کر ریئل ٹائم حکمت عملی تک اوپن اینڈڈ سینڈ باکسز تک۔ ہر بار جب کوئی کھیل گرتا ہے، دلیل بدل جاتی ہے: آج کے شکوک و شبہات کا اصرار ہے کہ یہ کارنامہ تنگ، تخصصی، یا کسی طرح سے خصوصی تھا جو عام نہیں تھا۔ اس تاریخ میں جو چیز پورٹل کو چلانے کے قابل بناتی ہے وہ یہ ہے کہ سیٹ اپ کتنا عام تھا — ایک تجارتی طور پر دستیاب فرنٹیئر ماڈل، ایک صارف گیم، اور چند سو ڈالر کی کمپیوٹ، بجائے اس کے کہ اس گیم کے لیے خصوصی طور پر تربیت یافتہ تحقیقی نظام۔

---

AI سے آگے رہیں

تازہ ترین AI خبریں، تجزیہ اور کامیابیاں حاصل کریں — سب ایک جگہ پر۔

مزید AI خبریں پڑھیں →