GPT-6 Astra від OpenAI додала незвичайний трофей до свого списку: повне проходження культової головоломки від першої особи Valve Portal, завершене автономно менш ніж за 24 години із загальною вартістю обчислення 571,18 доларів США. 6 вересня 2026 року The Verge повідомило про цю віху, згадавши користувача, відомого як cozyblaze, який підключив передову модель до гри та дозволив їй розібратися з рештою.
Portal є складним випробуванням для агента ШІ, незважаючи на його вік. Гра, випущена Valve у 2007 році, вимагає від гравців міркувати про просторові головоломки за допомогою портальної гармати — створення пов’язаних отворів у стінах, підлозі та стелі для переміщення через тестові камери, які зазвичай не піддаються інтуїції. Немає бойового гринда, на який можна спиратися, і маркера квесту, за яким слідувати; кожна камера - це, по суті, загадка фізики. Для читачів, які слідкують за стрес-тестуванням граничних моделей, цей цикл є яскравим записом у нашому висвітленні розробок ШІ.
Від демонстраційних відео до повного завершення
Біг виник не на порожньому місці. Раніше 6 вересня на Hacker News поширювалося відео YouTube, на якому показано, як GPT-6 Astra грає в Portal, а наступний пост, у якому зазначалося, що модель «автономно завершила» гру, привернув увагу протягом дня. Звіт Verge підтвердив деталі: повна гра, пройдена менш ніж за 24 години, за менше ніж 600 доларів США в обчисленнях — зі стислим відео запуску, опублікованим для скептиків.
The Verge не втримався від кількісної оцінки екологічної сторони рахунку, зазначивши, що цикл, ймовірно, споживає приблизно стільки води, скільки невеликий басейн для охолодження центру обробки даних. Це криве нагадування, що агентські ігри дешеві для користувача, але не безкоштовні для планети.
Чому головоломка 2007 року є серйозним тестом
Beating Portal не є запланованим тестом, як ARC-AGI або SWE-bench, і частково тому він резонує. Гра вимагає саме тих навичок, які історично відокремлювали людей від систем ШІ:
- Просторові міркування. Рішення вимагають передбачення того, куди вихід із порталу запустить тіло гравця — тривимірне фізичне міркування, яке роками збивало з ладу агентів.
- Довгогоризонтне планування. Кілька кроків у ланцюг камер; провал останнього кроку зазвичай означає повторення послідовності з самого початку.
- Вчимося на невдачах, не тримаючись за руки. Немає підказок. Агент повинен визначити правила гри методом проб і помилок, а потім узагальнити їх для нових камер.
На початку цього року GPT-6 Astra від OpenAI перевершила тести ARC-AGI-3, зосереджені на агентному міркуванні, і модель привернула увагу завдяки можливостям використання комп’ютера — здатності працювати з програмними інтерфейсами так, як це робила б людина. Запуск порталу — це грайлива, але справжня демонстрація того самого набору навичок: сприйняття, планування та контролю, які розгортаються годинами без втручання людини.
Частина ширшої хвилі
Цей пробіг також є ознакою того, куди прибули ігри зі штучним інтелектом у 2026 році. Результати бенчмарків тепер поділяють місце з культурними віхами: моделі, які складають хорали Баха, перемагають тести на розпізнавання рукописного виправлення та завершують ігри, які колись заміняли фразу «комп’ютери ніколи цього не зроблять». Кожне проходження знімає стару впевненість і ставить питання про те, яким буде наступний.
Є й практичні наслідки. Той самий цикл, який дозволяв установці cozyblaze керувати порталом — скріншоти, рішення — за кілька сотень доларів — це цикл, створений для тестування програмного забезпечення, робототехніки та помічників у використанні комп’ютера. Модель, яка може тримати в пам’яті фізику гри для повного проходження, це та, яка, в принципі, може виконувати довгі безладні програмні завдання, які перемагають системи з коротшим контекстом.
Наразі, однак, винести простіше. Штучний інтелект переміг одну з найулюбленіших головоломок ігор від початку до кінця приблизно за ціну депозиту нового графічного процесора — і опублікував відео. Тестові камери Aperture Science були розроблені, щоб змусити людей почуватися розумними. Цими вихідними вони змусили модель виглядати вільно.
Як сприйняли пробіг
Відповідь відслідковувала віхи розвитку штучного інтелекту в іграх загалом: спочатку недовіра, потім відео, потім прийняття. На Hacker News цей запуск привернув постійний потік коментаторів, які розбирали, як працювало налаштування та що це означає щодо агентського штучного інтелекту — дехто зазначив, що загальний рахунок був нижчим, ніж багато хто припускав, що такий запуск коштуватиме. Скорочене відео завершення дало скептикам спосіб перевірити твердження самостійно, що більше, ніж пропонують більшість порівняльних результатів.
Це також запрошувало порівняти з віхами, які були раніше. Десятиліттями ігри були публічним полігоном для випробувань, від настільних ігор до стратегій у реальному часі та відкритих пісочниць. Щоразу, коли гра провалюється, аргументи змінюються: сьогоднішні скептики наполягають на тому, що подвиг був вузьким, спеціалізованим або певним чином спеціалізованим, що не підлягає узагальненню. Що робить портал помітним у тій історії, так це те, наскільки звичайним було налаштування — комерційно доступна гранична модель, споживча гра та кілька сотень доларів обчислень, а не спеціальна дослідницька система, навчена спеціально для гри.
---
Будьте попереду ШІОтримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.
Читати більше новин AI →