OpenAI:s GPT-6 Astra har lagt till en ovanlig trofé till sitt rekord: ett fullständigt genomspel av Valves ikoniska förstapersonspusselportal, färdigställd autonomt på mindre än 24 timmar till en total beräkningskostnad av $571,18. The Verge rapporterade milstolpen den 6 september 2026, och krediterade en användare känd som cozyblaze, som kopplade frontiermodellen till spelet och lät den räkna ut resten.

Portal är ett krävande test för en AI-agent trots sin ålder. Spelet släpptes av Valve 2007 och kräver att spelarna resonerar kring rumsliga pussel med hjälp av en portalpistol – skapar länkade öppningar i väggar, golv och tak för att röra sig genom testkammare som rutinmässigt trotsar intuitionen. Det finns ingen stridsgrind att luta sig mot och ingen uppdragsmarkör att följa; varje kammare är i grunden en fysikgåta. För läsare som följer hur frontiermodeller stresstestas är den här körningen ett levande inlägg i vår AI-utvecklingstäckning.

Från demovideor till en fullständig komplettering

Löpningen kom inte från ingenstans. Tidigare den 6 september cirkulerade en YouTube-video som visar GPT-6 Astra spela Portal på Hacker News, och ett uppföljande inlägg som noterade att modellen "autonomt hade slutfört" spelet väckte uppmärksamhet allt eftersom dagen gick. Verges rapport bekräftade detaljerna: hela spelet, slagen på under 24 timmar, för mindre än $600 i beräkning — med en komprimerad video av körningen publicerad för skeptiker.

The Verge kunde inte motstå att kvantifiera miljösidan av räkningen, och noterade att körningen förmodligen förbrukade ungefär en liten pools vatten i datacenterkylning. Det är en skev påminnelse om att agenter för spel är billiga för användaren men inte gratis för planeten.

Varför ett pusselspel från 2007 är ett seriöst riktmärke

Beating Portal är inte ett schemalagt riktmärke som ARC-AGI eller SWE-bench, och det är delvis därför det ger resonans. Spelet kräver exakt de färdigheter som historiskt sett har separerat människor från AI-system:

  • Spatialt resonemang. Lösningar kräver att man förutsäger var en portalutgång kommer att starta spelarens kropp – tredimensionella fysikresonemang som har slagit iväg agenter i flera år.
  • Lång horisontplanering. Chambers kedjar flera steg; misslyckas det sista steget innebär vanligtvis att du gör om sekvensen från början.
  • Lära av misslyckanden utan att hålla i handen. Det finns inga tips. Agenten måste härleda spelets regler genom försök och misstag och sedan generalisera dem till nya kamrar.

Tidigare i år toppade OpenAI:s GPT-6 Astra ARC-AGI-3 riktmärken fokuserade på agentiska resonemang, och modellen har uppmärksammats för datoranvändningsförmåga - förmågan att använda programvarugränssnitt på det sätt som en person skulle göra. Portalkörningen är en lekfull men genuin demonstration av samma färdigheter: perception, planering och kontroll, utrullad i timmar utan mänsklig inblandning.

Del av en bredare våg

Körningen är också ett tecken på var AI-spel har landat 2026. Benchmark-poäng delar nu utrymme med kulturella milstolpar: modeller som komponerar Bach-koraler, slår igenkänningstest för handskrivna korrigeringar och slutför spel som en gång stod för frasen "datorer kommer aldrig att göra det här." Varje pass lindrar en gammal visshet och väcker frågan om vad nästa blir.

Det finns också praktiska konsekvenser. Samma slinga som lät cozyblazes installation styra Portal – skärmdumpar in, beslut ut, till en kostnad av några hundra dollar – är slingan som produceras för mjukvarutestning, robotteknik och datoranvändningsassistenter. En modell som kan hålla ett spels fysik i åtanke för en fullständig genomspelning är en som i princip kan slipa igenom långa, röriga mjukvaruuppgifter som besegrar system med kortare sammanhang.

För närvarande är dock takeaway enklare. En AI slog ett av spelets mest älskade pussel, från början till slut, för ungefär priset av en ny GPU:s insättning – och lade upp videon. Testkamrarna i Aperture Science var designade för att få människor att känna sig smarta. I helgen fick de en modell att se flytande ut.

Hur löpningen togs emot

Svaret spårade bågen av AI-spelmilstolpar i allmänhet: misstro först, sedan videon och sedan acceptans. På Hacker News drog körningen en stadig ström av kommentatorer som dissekerade hur installationen fungerade och vad den antydde om agent AI - med flera som noterade att den totala notan var lägre än många antog att en sådan körning skulle kosta. Den sammanfattade videon av slutförandet gav skeptiker ett sätt att verifiera påståendet själva, vilket är mer än de flesta benchmarkresultat erbjuder.

Det bjöd också på jämförelse med de milstolpar som kom innan. Spel har fungerat i decennier som fältets publika provningsplats, från brädspel till realtidsstrategier till öppna sandlådor. Varje gång ett spel faller ändras argumentet: dagens skeptiker insisterar på att bedriften var smal, specialiserad eller specialiserad på något sätt inte generaliserbar. Det som gör portalen anmärkningsvärd inom den historien är hur vanlig installationen var - en kommersiellt tillgänglig gränsmodell, ett konsumentspel och några hundra dollar i datoranvändning, snarare än ett skräddarsytt forskningssystem som utbildats specifikt för spelet.

---

Stay ahead of AI

Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.

Läs mer AI-nyheter →