GPT-6 Astra OpenAI dodał do swojego rekordu niezwykłe trofeum: pełną grę kultowego Portalu z łamigłówkami pierwszoosobowymi firmy Valve, ukończoną autonomicznie w niecałe 24 godziny, przy całkowitym koszcie obliczeniowym wynoszącym 571,18 USD. The Verge poinformowało o kamieniu milowym 6 września 2026 r., przypisując zasługi użytkownikowi znanemu jako Cosyblaze, który podłączył model frontierowy do gry i pozwolił mu wymyślić resztę.

Portal mimo swojego wieku jest wymagającym testem dla agenta AI. Wydana przez Valve w 2007 roku gra wymaga od graczy rozwiązywania zagadek przestrzennych za pomocą pistoletu portalowego — tworzenia połączonych otworów w ścianach, podłogach i sufitach, aby przechodzić przez komory testowe, które zwykle przeczą intuicji. Nie ma tu żadnego grindu bojowego, na którym można by się oprzeć, ani znacznika zadań, za którym można podążać; każda komora jest w zasadzie zagadką fizyki. Dla czytelników śledzących testy modeli granicznych poddawane testom warunków skrajnych ten przebieg będzie ważnym wpisem w naszym relacjonowaniu rozwoju sztucznej inteligencji.

Od filmów demonstracyjnych po pełne ukończenie

Bieg nie wziął się znikąd. Wcześniej, 6 września, w Hacker News krążył film na YouTube pokazujący, jak GPT-6 Astra gra w Portal, a kolejny post informujący, że model „samoczynnie ukończył” grę, wzbudził zainteresowanie w miarę upływu dnia. Raport The Verge potwierdził szczegóły: pełną grę, ukończoną w niecałe 24 godziny, za mniej niż 600 dolarów na obliczenia – wraz ze skróconym filmem z rozgrywki opublikowanym dla sceptyków.

Firma The Verge nie mogła się powstrzymać przed określeniem ilościowego aspektu ochrony środowiska, zauważając, że do chłodzenia centrum danych prawdopodobnie zużyto mniej więcej tyle wody, ile mieści się w małym basenie. To ironiczne przypomnienie, że gry agentowe są tanie dla użytkownika, ale nie bezpłatne dla planety.

Dlaczego Puzzler z 2007 r. to poważny punkt odniesienia

Beating Portal nie jest zaplanowanym benchmarkiem takim jak ARC-AGI czy SWE-bench i częściowo dlatego rezonuje. Gra wymaga dokładnie tych umiejętności, które w przeszłości oddzielały ludzi od systemów AI:

  • Rozumowanie przestrzenne. Rozwiązania wymagają przewidywania, gdzie wyjście z portalu wyrzuci ciało gracza — trójwymiarowe rozumowanie fizyki, które od lat wprawia agentów w zakłopotanie.
  • Planowanie długoterminowe. Komory składają się z kilku etapów; niezaliczenie ostatniego kroku zwykle oznacza powtórzenie sekwencji od początku.
  • Uczenie się na błędach bez trzymania się za rękę. Nie ma żadnych wskazówek. Agent musi wywnioskować zasady gry metodą prób i błędów, a następnie uogólnić je na nowe komnaty.

Na początku tego roku test OpenAI GPT-6 Astra zwyciężył w testach porównawczych ARC-AGI-3 skupiających się na rozumowaniu agentycznym, a model zwrócił uwagę na możliwości wykorzystania komputera — zdolność do obsługi interfejsów oprogramowania w sposób, w jaki zrobiłby to człowiek. Uruchomienie Portalu to zabawna, ale autentyczna demonstracja tego samego zestawu umiejętności: percepcji, planowania i kontroli, rozwijana godzinami bez interwencji człowieka.

Część szerszej fali

Ten bieg jest także oznaką tego, dokąd zmierzają gry oparte na sztucznej inteligencji w roku 2026. Wyniki testów porównawczych dzielą teraz przestrzeń z kamieniami milowymi w kulturze: modelami komponującymi chorały Bacha, przechodzącymi testy rozpoznawania poprawności pisma odręcznego i ukończonymi grami, które kiedyś zastępowały zdanie „komputery nigdy tego nie zrobią”. Każde przejście uwalnia od starej pewności i rodzi pytanie, jaki będzie następny.

Istnieją także implikacje praktyczne. Ta sama pętla, która pozwala konfiguracji Cosyblaze sterować Portalem — wprowadzanie zrzutów ekranu i podejmowanie decyzji, kosztem kilkuset dolarów — to pętla tworzona na potrzeby testowania oprogramowania, robotyki i asystentów obsługi komputera. Model, który pozwala na pamiętanie o fizyce gry podczas całej rozgrywki, to taki, który w zasadzie jest w stanie poradzić sobie z długimi, chaotycznymi zadaniami programowymi, które pokonują systemy o krótszym kontekście.

Na razie jednak jedzenie na wynos jest prostsze. Sztuczna inteligencja rozwiązała jedną z najbardziej lubianych łamigłówek w grach, od początku do końca, za mniej więcej cenę depozytu za nowy procesor graficzny i opublikowała wideo. Komory testowe Aperture Science zostały zaprojektowane tak, aby ludzie czuli się mądrzejsi. W ten weekend sprawili, że modelka wyglądała płynnie.

Jak odebrano bieg

Reakcja ogólnie odzwierciedlała przebieg kamieni milowych w grach AI: najpierw niedowierzanie, potem wideo, a na końcu akceptacja. W serwisie Hacker News cała akcja przyciągnęła ciągły strumień komentatorów analizujących działanie tej konfiguracji i jej konsekwencje dla agentycznej sztucznej inteligencji. Kilku z nich zauważyło, że całkowity rachunek był niższy, niż wielu zakładało, że taka operacja będzie kosztować. Skondensowany film z zakończenia dał sceptykom możliwość samodzielnej weryfikacji twierdzenia, co stanowi więcej niż oferuje większość wyników testów porównawczych.

Zaproponowano także porównanie z kamieniami milowymi, które miały miejsce wcześniej. Gry przez dziesięciolecia służyły jako publiczny poligon doświadczalny w tej dziedzinie, od gier planszowych, przez strategie czasu rzeczywistego, po otwarte piaskownice. Za każdym razem, gdy mecz kończy się niepowodzeniem, argument się zmienia: dzisiejsi sceptycy twierdzą, że wyczyn ten był wąski, wyspecjalizowany lub wyspecjalizowany w jakiś sposób, którego nie można uogólnić. Tym, co wyróżnia Portal w tej historii, jest zwyczajna konfiguracja — dostępny na rynku model frontierowy, gra konsumencka i komputery za kilkaset dolarów, a nie szyty na miarę system badawczy przeszkolony specjalnie pod kątem gry.

---

Wyprzedź sztuczną inteligencję

Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →