GPT-6 Astra از OpenAI یک جایزه غیرمعمول را به رکورد خود اضافه کرده است: نمایش کامل پورتال گیج کننده اول شخص نمادین Valve، که به صورت خودکار در کمتر از 24 ساعت با هزینه محاسباتی کل 571.18 دلار تکمیل شد. The Verge این نقطه عطف را در 6 سپتامبر 2026 گزارش کرد و به کاربری معروف به cozyblaze اعتبار داد که مدل مرزی را به بازی متصل کرد و اجازه داد بقیه چیزها را بفهمد.

پورتال یک آزمایش سخت برای یک عامل هوش مصنوعی با وجود سن آن است. این بازی که توسط Valve در سال 2007 منتشر شد، از بازیکنان می‌خواهد تا در مورد پازل‌های فضایی با استفاده از یک تفنگ پورتال استدلال کنند - ایجاد دهانه‌های مرتبط در دیوارها، کف‌ها و سقف‌ها برای حرکت در اتاق‌های آزمایش که به طور معمول از شهود سرپیچی می‌کنند. هیچ مبارزه ای برای تکیه کردن وجود ندارد و هیچ نشانگر جستجویی برای دنبال کردن وجود ندارد. هر اتاق در اصل یک معمای فیزیک است. برای خوانندگانی که نحوه تست استرس مدل‌های مرزی را دنبال می‌کنند، این اجرا یک مدخل واضح در [پوشش توسعه‌های هوش مصنوعی] (https://aibuzzwire.news) است.

از ویدئوهای آزمایشی تا تکمیل کامل

فرار از ناکجاآباد نبود. پیشتر در 6 سپتامبر، ویدیویی از یوتیوب که GPT-6 Astra را در حال پخش پورتال نشان می‌داد در هکر نیوز منتشر شد و یک پست بعدی که اشاره می‌کرد این مدل به طور خودکار بازی را تکمیل کرده بود، توجه را به خود جلب کرد. گزارش The Verge جزئیات را تایید کرد: بازی کامل، در کمتر از 24 ساعت شکست خورده، برای محاسبه کمتر از 600 دلار - با یک ویدیوی فشرده از اجرا که برای افراد شکاک منتشر شد.

The Verge نتوانست در کمیت کردن جنبه‌های زیست‌محیطی این صورت‌حساب مقاومت کند، و خاطرنشان کرد که اجرای احتمالاً تقریباً به اندازه یک استخر کوچک آب در خنک‌کننده مرکز داده مصرف می‌کند. این یک یادآوری بداخلاقی است که اجرای بازی‌های عاملی برای کاربر ارزان هستند اما برای کره زمین رایگان نیستند.

چرا یک پازل 2007 یک معیار جدی است

Beating Portal یک معیار برنامه ریزی شده مانند ARC-AGI یا SWE-bench نیست و تا حدی به همین دلیل است که طنین انداز می شود. این بازی دقیقاً به مهارت هایی نیاز دارد که در طول تاریخ انسان ها را از سیستم های هوش مصنوعی جدا کرده است:

  • استدلال فضایی. راه حل ها مستلزم پیش بینی جایی هستند که خروجی پورتال بدن بازیکن را راه اندازی می کند - استدلال فیزیک سه بعدی که سال ها عوامل را تحت تأثیر قرار داده است.
  • برنامه ریزی افق بلند. چندین مرحله زنجیره ای اتاق ها. شکست در مرحله نهایی معمولاً به معنای انجام مجدد دنباله از ابتدا است.
  • آموزش از شکست بدون دست نگه داشتن. هیچ اشاره ای وجود ندارد. عامل باید قوانین بازی را از طریق آزمون و خطا استنباط کند، سپس آنها را به اتاق های جدید تعمیم دهد.

در اوایل سال جاری، GPT-6 Astra از OpenAI در صدر معیارهای ARC-AGI-3 متمرکز بر استدلال عاملی قرار گرفت و این مدل توجه قابلیت‌های استفاده از رایانه را به خود جلب کرد - توانایی کارکردن رابط‌های نرم‌افزاری به روشی که یک شخص انجام می‌دهد. اجرای پورتال نمایشی بازیگوش اما واقعی از همان مجموعه مهارت است: ادراک، برنامه ریزی و کنترل، که ساعت ها بدون دخالت انسان باز می شود.

بخشی از یک موج گسترده تر

این اجرا همچنین نشانه‌ای از جایگاه بازی‌های هوش مصنوعی در سال 2026 است. امتیازات معیار اکنون فضا را با نقاط عطف فرهنگی تقسیم می‌کنند: مدل‌هایی که آهنگ‌های باخ را می‌سازند، آزمون‌های تشخیص تصحیح دست‌نویس را شکست می‌دهند و بازی‌هایی را که زمانی عبارت «کامپیوترها هرگز این کار را نمی‌کنند» انجام می‌دهند. هر پاس یک اطمینان قدیمی را تسکین می دهد و این سوال را مطرح می کند که پاس بعدی چه خواهد بود.

مفاهیم عملی نیز وجود دارد. همان حلقه‌ای که به راه‌اندازی Cozyblaze اجازه می‌دهد پورتال را هدایت کند - عکس‌های صفحه‌نمایش، تصمیم‌گیری‌ها با هزینه چند صد دلاری - حلقه‌ای است که برای تست نرم‌افزار، روباتیک و دستیارهای استفاده از رایانه تولید می‌شود. مدلی که می‌تواند فیزیک بازی را برای یک بازی کامل در ذهن نگه دارد، مدلی است که در اصل می‌تواند کارهای نرم‌افزاری طولانی و نامرتب را که سیستم‌های با زمینه کوتاه‌تر را شکست می‌دهند، حل کند.

در حال حاضر، هر چند، غذای آماده ساده تر است. یک هوش مصنوعی یکی از محبوب‌ترین معماهای بازی را از شروع تا پایان تقریباً به قیمت سپرده یک GPU جدید شکست داد - و ویدیو را پست کرد. اتاق‌های آزمایش Aperture Science به گونه‌ای طراحی شده‌اند که انسان احساس باهوشی کند. این آخر هفته، آنها یک مدل را روان نشان دادند.

چگونه اجرا دریافت شد

پاسخ به طور کلی نقاط عطف بازی هوش مصنوعی را دنبال کرد: ابتدا ناباوری، سپس ویدیو، سپس پذیرش. در هکر نیوز، این اجرا جریان ثابتی از نظر دهندگان را به خود جلب کرد که نحوه عملکرد این راه‌اندازی و مفهوم آن را در مورد هوش مصنوعی عاملی تشریح می‌کردند – با چند نفر اشاره کردند که کل صورت‌حساب کمتر از آن چیزی است که بسیاری تصور می‌کردند چنین اجرائی هزینه دارد. ویدئوی فشرده از تکمیل، راهی را به شکاکان داد تا خودشان این ادعا را تأیید کنند، که بیشتر از آن چیزی است که اکثر نتایج معیار ارائه می‌دهند.

همچنین خواستار مقایسه با نقاط عطف قبلی شد. بازی برای دهه‌ها به‌عنوان میدان آزمایش عمومی در این زمینه خدمت کرده است، از بازی‌های رومیزی گرفته تا استراتژی زمان واقعی و جعبه‌های شنی با پایان باز. هر بار که یک بازی سقوط می‌کند، بحث تغییر می‌کند: شک‌گرایان امروزی اصرار دارند که این شاهکار محدود، تخصصی یا تخصصی بوده است که به نوعی قابل تعمیم نیست. چیزی که پورتال را در آن تاریخ قابل توجه می کند این است که نصب آن چقدر معمولی بود - یک مدل مرزی در دسترس تجاری، یک بازی مصرف کننده و چند صد دلار محاسبه، به جای یک سیستم تحقیقاتی سفارشی که به طور خاص برای بازی آموزش داده شده است.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →