OpenAI's GPT-6 Astra heeft een ongebruikelijke trofee aan zijn record toegevoegd: een volledige playthrough van Valve's iconische first-person puzzelspel Portal, autonoom voltooid in minder dan 24 uur voor een totaal rekenbedrag van $ 571,18. The Verge rapporteerde de mijlpaal op 6 september 2026, waarbij een gebruiker werd gecrediteerd die bekend staat als cosyblaze, die het grensmodel aan de game koppelde en het de rest liet uitzoeken.

Portal is ondanks zijn leeftijd een veeleisende test voor een AI-agent. Het spel, uitgebracht door Valve in 2007, vereist dat spelers over ruimtelijke puzzels redeneren met behulp van een portaalgeweer, waarbij ze gekoppelde openingen in muren, vloeren en plafonds creëren om door testkamers te bewegen die routinematig de intuïtie tarten. Er is geen gevechtsgrind om op te leunen en geen zoektochtmarkering om te volgen; elke kamer is in wezen een natuurkundig raadsel. Voor lezers die volgen hoe grensverleggende modellen aan stresstests worden onderworpen, is deze run een levendig bericht in onze reportage over AI-ontwikkelingen.

Van demovideo's tot een volledige voltooiing

De run kwam niet uit het niets. Eerder op 6 september circuleerde een YouTube-video waarin GPT-6 Astra Portal speelde op Hacker News, en een vervolgpost waarin werd opgemerkt dat het model het spel "autonoom had voltooid" trok de aandacht naarmate de dag verstreek. Het rapport van The Verge bevestigde de details: de volledige game, binnen 24 uur uitgespeeld, voor minder dan $ 600 aan rekenkracht – met een verkorte video van de run gepubliceerd voor sceptici.

The Verge kon het niet laten om de milieukant van de rekening te kwantificeren, en merkte op dat de run waarschijnlijk ongeveer de hoeveelheid water van een klein zwembad verbruikte voor de koeling van datacenters. Het is een wrange herinnering dat agentic gaming-runs goedkoop zijn voor de gebruiker, maar niet gratis voor de planeet.

Waarom een puzzelaar uit 2007 een serieuze maatstaf is

Beating Portal is geen geplande benchmark zoals ARC-AGI of SWE-bench, en dat is gedeeltelijk de reden waarom het resoneert. Het spel vereist precies de vaardigheden die historisch gezien mensen van AI-systemen hebben gescheiden:

  • Ruimtelijk redeneren. Oplossingen vereisen voorspellen waar een poortuitgang het lichaam van de speler zal lanceren - een driedimensionale natuurkundige redenering die agenten al jaren laat struikelen.
  • Lange horizonplanning. Kamers keten meerdere stappen; Als je de laatste stap niet haalt, betekent dit meestal dat je de reeks vanaf het begin opnieuw moet uitvoeren.
  • Leren van falen zonder de hand vast te houden. Er zijn geen tips. De agent moet met vallen en opstaan ​​de spelregels afleiden en deze vervolgens generaliseren naar nieuwe kamers.

Eerder dit jaar stond OpenAI's GPT-6 Astra bovenaan de ARC-AGI-3-benchmarks gericht op agentic redeneren, en het model heeft de aandacht gevestigd op de mogelijkheden voor computergebruik: het vermogen om software-interfaces te bedienen zoals een mens dat zou doen. De Portal-run is een speelse maar oprechte demonstratie van diezelfde vaardigheden: perceptie, planning en controle, urenlang uitgerold zonder menselijke tussenkomst.

Onderdeel van een bredere golf

Deze run is ook een teken van waar AI-gaming in 2026 is beland. Benchmarkscores delen nu de ruimte met culturele mijlpalen: modellen die Bach-koralen componeren, herkenningstests voor handgeschreven correcties doorstaan en games voltooien die ooit in de plaats stonden van de uitdrukking 'computers zullen dit nooit doen'. Elke pas verlicht een oude zekerheid en roept de vraag op wat de volgende zal zijn.

Er zijn ook praktische implicaties. Dezelfde lus waarmee de installatie van cosyblaze Portal kan sturen (screenshots erin, beslissingen eruit, voor een paar honderd dollar) is de lus die wordt geproduceerd voor het testen van software, robotica en computerassistenten. Een model dat de fysica van een game in gedachten kan houden voor een volledige playthrough, is er een die in principe lange, rommelige softwaretaken kan doorstaan ​​die systemen met een kortere context verslaan.

Maar voorlopig is de afhaalmaaltijd eenvoudiger. Een AI versloeg een van de meest geliefde puzzels van gaming, van begin tot eind, voor ongeveer de prijs van de aanbetaling van een nieuwe GPU - en plaatste de video. De testkamers van Aperture Science zijn ontworpen om mensen zich slim te laten voelen. Dit weekend lieten ze een model er vloeiend uitzien.

Hoe de run werd ontvangen

De reacties volgden in het algemeen de reeks mijlpalen op het gebied van AI-gaming: eerst ongeloof, dan de video en daarna acceptatie. Op Hacker News trok de run een gestage stroom commentatoren die ontleedden hoe de opzet werkte en wat het inhield over agentische AI ​​– waarbij sommigen opmerkten dat de totale rekening lager was dan velen dachten dat een dergelijke run zou kosten. De verkorte video van de voltooiing gaf sceptici een manier om de claim zelf te verifiëren, wat meer is dan de meeste benchmarkresultaten bieden.

Het nodigde ook uit tot vergelijking met de voorgaande mijlpalen. Gaming fungeert al tientallen jaren als het publieke proefterrein op dit gebied, van bordspellen tot real-time strategie en sandboxes met een open einde. Elke keer dat een game mislukt, verandert het argument: de sceptici van vandaag houden vol dat de prestatie beperkt, gespecialiseerd of op de een of andere manier gespecialiseerd was en niet generaliseerbaar was. Wat de Portal in die geschiedenis opmerkelijk maakt, is hoe gewoon de opzet was: een commercieel verkrijgbaar grensmodel, een consumentenspel en een paar honderd dollar aan rekenkracht, in plaats van een op maat gemaakt onderzoekssysteem dat speciaal voor het spel was getraind.

---

Blijf AI een stap voor

Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.

Lees meer AI-nieuws →