GPT-6 Astra از OpenAI یک جایزه غیرمعمول را به رکورد خود اضافه کرده است: نمایش کامل پورتال گیج کننده اول شخص نمادین Valve، که به صورت خودکار در کمتر از 24 ساعت با هزینه محاسباتی کل 571.18 دلار تکمیل شد. The Verge این نقطه عطف را در 6 سپتامبر 2026 گزارش کرد و به کاربری معروف به cozyblaze اعتبار داد که مدل مرزی را به بازی متصل کرد و اجازه داد بقیه چیزها را بفهمد.
پورتال یک آزمایش سخت برای یک عامل هوش مصنوعی با وجود سن آن است. این بازی که توسط Valve در سال 2007 منتشر شد، از بازیکنان میخواهد تا در مورد پازلهای فضایی با استفاده از یک تفنگ پورتال استدلال کنند - ایجاد دهانههای مرتبط در دیوارها، کفها و سقفها برای حرکت در اتاقهای آزمایش که به طور معمول از شهود سرپیچی میکنند. هیچ مبارزه ای برای تکیه کردن وجود ندارد و هیچ نشانگر جستجویی برای دنبال کردن وجود ندارد. هر اتاق در اصل یک معمای فیزیک است. برای خوانندگانی که نحوه تست استرس مدلهای مرزی را دنبال میکنند، این اجرا یک مدخل واضح در [پوشش توسعههای هوش مصنوعی] (https://aibuzzwire.news) است.
از ویدئوهای آزمایشی تا تکمیل کامل
فرار از ناکجاآباد نبود. پیشتر در 6 سپتامبر، ویدیویی از یوتیوب که GPT-6 Astra را در حال پخش پورتال نشان میداد در هکر نیوز منتشر شد و یک پست بعدی که اشاره میکرد این مدل به طور خودکار بازی را تکمیل کرده بود، توجه را به خود جلب کرد. گزارش The Verge جزئیات را تایید کرد: بازی کامل، در کمتر از 24 ساعت شکست خورده، برای محاسبه کمتر از 600 دلار - با یک ویدیوی فشرده از اجرا که برای افراد شکاک منتشر شد.
The Verge نتوانست در کمیت کردن جنبههای زیستمحیطی این صورتحساب مقاومت کند، و خاطرنشان کرد که اجرای احتمالاً تقریباً به اندازه یک استخر کوچک آب در خنککننده مرکز داده مصرف میکند. این یک یادآوری بداخلاقی است که اجرای بازیهای عاملی برای کاربر ارزان هستند اما برای کره زمین رایگان نیستند.
چرا یک پازل 2007 یک معیار جدی است
Beating Portal یک معیار برنامه ریزی شده مانند ARC-AGI یا SWE-bench نیست و تا حدی به همین دلیل است که طنین انداز می شود. این بازی دقیقاً به مهارت هایی نیاز دارد که در طول تاریخ انسان ها را از سیستم های هوش مصنوعی جدا کرده است:
- استدلال فضایی. راه حل ها مستلزم پیش بینی جایی هستند که خروجی پورتال بدن بازیکن را راه اندازی می کند - استدلال فیزیک سه بعدی که سال ها عوامل را تحت تأثیر قرار داده است.
- برنامه ریزی افق بلند. چندین مرحله زنجیره ای اتاق ها. شکست در مرحله نهایی معمولاً به معنای انجام مجدد دنباله از ابتدا است.
- آموزش از شکست بدون دست نگه داشتن. هیچ اشاره ای وجود ندارد. عامل باید قوانین بازی را از طریق آزمون و خطا استنباط کند، سپس آنها را به اتاق های جدید تعمیم دهد.
در اوایل سال جاری، GPT-6 Astra از OpenAI در صدر معیارهای ARC-AGI-3 متمرکز بر استدلال عاملی قرار گرفت و این مدل توجه قابلیتهای استفاده از رایانه را به خود جلب کرد - توانایی کارکردن رابطهای نرمافزاری به روشی که یک شخص انجام میدهد. اجرای پورتال نمایشی بازیگوش اما واقعی از همان مجموعه مهارت است: ادراک، برنامه ریزی و کنترل، که ساعت ها بدون دخالت انسان باز می شود.
بخشی از یک موج گسترده تر
این اجرا همچنین نشانهای از جایگاه بازیهای هوش مصنوعی در سال 2026 است. امتیازات معیار اکنون فضا را با نقاط عطف فرهنگی تقسیم میکنند: مدلهایی که آهنگهای باخ را میسازند، آزمونهای تشخیص تصحیح دستنویس را شکست میدهند و بازیهایی را که زمانی عبارت «کامپیوترها هرگز این کار را نمیکنند» انجام میدهند. هر پاس یک اطمینان قدیمی را تسکین می دهد و این سوال را مطرح می کند که پاس بعدی چه خواهد بود.
مفاهیم عملی نیز وجود دارد. همان حلقهای که به راهاندازی Cozyblaze اجازه میدهد پورتال را هدایت کند - عکسهای صفحهنمایش، تصمیمگیریها با هزینه چند صد دلاری - حلقهای است که برای تست نرمافزار، روباتیک و دستیارهای استفاده از رایانه تولید میشود. مدلی که میتواند فیزیک بازی را برای یک بازی کامل در ذهن نگه دارد، مدلی است که در اصل میتواند کارهای نرمافزاری طولانی و نامرتب را که سیستمهای با زمینه کوتاهتر را شکست میدهند، حل کند.
در حال حاضر، هر چند، غذای آماده ساده تر است. یک هوش مصنوعی یکی از محبوبترین معماهای بازی را از شروع تا پایان تقریباً به قیمت سپرده یک GPU جدید شکست داد - و ویدیو را پست کرد. اتاقهای آزمایش Aperture Science به گونهای طراحی شدهاند که انسان احساس باهوشی کند. این آخر هفته، آنها یک مدل را روان نشان دادند.
چگونه اجرا دریافت شد
پاسخ به طور کلی نقاط عطف بازی هوش مصنوعی را دنبال کرد: ابتدا ناباوری، سپس ویدیو، سپس پذیرش. در هکر نیوز، این اجرا جریان ثابتی از نظر دهندگان را به خود جلب کرد که نحوه عملکرد این راهاندازی و مفهوم آن را در مورد هوش مصنوعی عاملی تشریح میکردند – با چند نفر اشاره کردند که کل صورتحساب کمتر از آن چیزی است که بسیاری تصور میکردند چنین اجرائی هزینه دارد. ویدئوی فشرده از تکمیل، راهی را به شکاکان داد تا خودشان این ادعا را تأیید کنند، که بیشتر از آن چیزی است که اکثر نتایج معیار ارائه میدهند.
همچنین خواستار مقایسه با نقاط عطف قبلی شد. بازی برای دههها بهعنوان میدان آزمایش عمومی در این زمینه خدمت کرده است، از بازیهای رومیزی گرفته تا استراتژی زمان واقعی و جعبههای شنی با پایان باز. هر بار که یک بازی سقوط میکند، بحث تغییر میکند: شکگرایان امروزی اصرار دارند که این شاهکار محدود، تخصصی یا تخصصی بوده است که به نوعی قابل تعمیم نیست. چیزی که پورتال را در آن تاریخ قابل توجه می کند این است که نصب آن چقدر معمولی بود - یک مدل مرزی در دسترس تجاری، یک بازی مصرف کننده و چند صد دلار محاسبه، به جای یک سیستم تحقیقاتی سفارشی که به طور خاص برای بازی آموزش داده شده است.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →