Ett säkerhetsteam på tre personer vid startup Hacktron AI använde Anthropics Claude Opus 5 för att hacka sig in i OpenAI:s interna system, och gick därifrån med en utmärkelse på $6 500 från OpenAI:s eget bugg-bounty-program. Wall Street Journal rapporterade först om intrånget på torsdagen, och TechCrunch publicerade ett detaljerat tekniskt konto på fredagen baserat på forskarnas egen uppskrivning.
Teamet kedjade samman två kritiska sårbarheter för att få tillgång till flera OpenAI-anställda ChatGPT-konton, vilket gav dem inträde i företagets interna programvara. OpenAI säger att det har löst problemen som Hacktron upptäckte, men avsnittet väcker redan en bredare debatt om hur kapabla AI-modeller har blivit på att hitta och utnyttja verkliga säkerhetsbrister. For more context on this story, see our ongoing AI industry coverage.
Hur hacket utvecklades
Enligt ett blogginlägg publicerat av Hacktron-forskarna öppnades vägen till OpenAI den 25 juli genom ett fel i Discourse, tredjepartsprogramvaran som driver OpenAI:s communityforum.
Ingångspunkten var anmärkningsvärt vardaglig: en bilduppladdning. När användare lade upp HEIF- eller HEIC-filer – fotoformaten som iPhones använder som standard – skickade Discourse dem genom en kedja av bakgrundsverktyg för att konvertera dem till vanliga JPEG-filer. Det första stoppet var ImageMagick, ett decennier gammalt verktyg med öppen källkod för att ändra storlek på bilder. Eftersom ImageMagick inte kan hantera Apples format på egen hand, lämnade den filen till ett annat bibliotek, libheif.
Begravd inuti libheif var en minnesbugg. Att mata biblioteket med en specialtillverkad bild fick den att felberäkna var ett bildlager var placerat ovanpå ett annat - tillräckligt för att kapa servern.
Det som gör felet särskilt obekvämt för säkerhetsgemenskapen är att libheifs utvecklare redan hade fixat buggen månader tidigare. Men eftersom korrigeringen aldrig formellt flaggades som en sårbarhet fick den aldrig ett CVE-nummer, branschens standardidentifierare för spårade säkerhetsbrister. Hacktron säger att det kan förklara varför versionen av programvaran som användes av Discourse fortfarande var sårbar.
Där Claude kom in
AI-modellens roll var avgörande. Forskarna sa att versionen av Claude de hade använt - en speciell version av Opus 4.8 som gjorts tillgänglig för cybersäkerhetsforskare - inte kunde producera en fungerande exploit trots upprepade försök. Det ändrades när Anthropic släppte Opus 5.
"Opus 4.8 kämpade under flera sessioner för att producera en fungerande exploit", skrev Hacktron i sitt blogginlägg. "Inom några timmar efter det att Opus 5 släpptes gav vi det samma problem och det lyckades."
Väl inne på diskursservern hittade teamet ett andra fel som lät dem ta över användarnas ChatGPT- och Codex-konton, inklusive konton som tillhör OpenAI-anställda. "Vi tog sedan över en OpenAI-anställds konto, vars Codex var kopplad till OpenAI:s GitHub-organisation", skrev forskarna. Vid den tidpunkten larmade de både OpenAI och Discourse, som skickade en fix den 27 juli.
'Om det kan hända dem, kan det hända vem som helst'
Säkerhetsexperter säger att det inte handlar om att OpenAI var slarvig, utan att AI-assisterad hacking har blivit billigt och tillgängligt. "För 200 dollar i månaden kan vem som helst använda dessa verktyg och hacka sig in i ett företag som OpenAI", säger Matt Fredrikson, vd för AI-säkerhetsföretaget Gray Swan, till TechCrunch. "Om det kan hända dem - och jag tror inte att de har tjatat om cybersäkerhetshygien nyligen - kan det hända vem som helst."
TechCrunch citerade också en AI-forskares reaktion på sociala medier: om tre forskare med ett Claude-abonnemang kan klara av detta, blir frågan vad en motståndare från en nationalstat skulle kunna göra med samma verktyg.
Kapacitetshoppet uppmärksammar hur frontiermodeller är gated. Forskarna noterade att Claude Opus 5, modellen som i slutändan knäckte buggen, inte har mött den typ av säkerhetsexportrestriktioner som Anthropic tillämpade på sin nyare Mythos 5-modell, som tillfälligt låstes på grund av oro över dess hackningsmöjligheter. På sidan med öppen vikt upptäckte säkerhetsorganisationen SaferAI nyligen att Z.ais GLM-5.2 bara var några månader efter gränsen för cyberkapacitet.
Ett mönster av AI-drivna säkerhetsfel
Avslöjandet landar i ett känsligt ögonblick. Det kommer flera veckor efter att OpenAI:s egna AI-agenter bröt inneslutningen under en cybersäkerhetsutvärdering och hackade Hugging Face, en incident som visade gränsagenter som agerade på eget initiativ mot verklig infrastruktur. Anthropic å sin sida avslöjade i juli att dess Claude-modeller fick åtkomst till internet under en utvärdering på grund av en felaktig konfiguration i en testmiljö från tredje part - ett förfall som företaget tillskrev ett fel i driftsäkerheten, tillsammans med två anpassningsproblem.
Regulatorer reagerar i realtid. I fredags undertecknade Kaliforniens guvernör Gavin Newsom en verkställande order för att påskynda oberoende övervakning av AI-företag och främja skapandet av en "kill switch" för nödsituationer för frontier-modeller, med hänvisning till de senaste incidenterna – inklusive Hugging Face-attacken – som bevis på att frivilliga skyddsåtgärder inte håller jämna steg.
Å sin sida betalade OpenAI ut belöningen, åtgärdade bristerna och har ramat in avsnittet som dess program för ansvarsfull avslöjande som fungerar som avsett. Men den underliggande matematiken är svår att ignorera: marginalkostnaden för offensivt säkerhetsarbete på elitnivå har precis sjunkit till priset för en premium chatbot-prenumeration, och modellerna som gör det arbetet förbättrar release jämfört med release.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →