Een driekoppig beveiligingsteam bij de startup Hacktron AI gebruikte Claude Opus 5 van Anthropic om de interne systemen van OpenAI te hacken en ging er met een beloning van $ 6.500 vandoor uit OpenAI's eigen bugbounty-programma. De Wall Street Journal meldde de inbreuk voor het eerst op donderdag en TechCrunch publiceerde vrijdag een gedetailleerd technisch verslag op basis van het eigen artikel van de onderzoekers.

Het team koppelde twee kritieke kwetsbaarheden aan elkaar om toegang te krijgen tot meerdere ChatGPT-accounts van OpenAI-werknemers, waardoor ze toegang kregen tot de interne software van het bedrijf. OpenAI zegt dat het de problemen heeft opgelost die Hacktron heeft ontdekt, maar de episode voedt nu al een breder debat over hoe capabel AI-modellen zijn geworden in het vinden en exploiteren van echte beveiligingsfouten. Voor meer context over dit verhaal, zie ons laatste AI-ontwikkelingen.

Hoe de hack zich ontvouwde

Volgens een blogpost gepubliceerd door de Hacktron-onderzoekers, is de weg naar OpenAI op 25 juli geopend door een fout in Discourse, de software van derden die het communityforum van OpenAI aandrijft.

Het toegangspunt was opmerkelijk alledaags: een afbeeldingsupload. Wanneer gebruikers HEIF- of HEIC-bestanden postten – de fotoformaten die iPhones standaard gebruiken – stuurde Discourse ze door een reeks achtergrondhulpmiddelen om ze om te zetten in standaard JPEG’s. De eerste stop was ImageMagick, een tientallen jaren oud open source-hulpprogramma voor het wijzigen van het formaat van afbeeldingen. Omdat ImageMagick de formaten van Apple zelf niet aankan, heeft het het bestand overgedragen aan een andere bibliotheek, libheif.

Begraven in libheif zat een geheugenbug. Door de bibliotheek een speciaal vervaardigde afbeelding te geven, kon deze niet goed berekenen waar de ene afbeeldingslaag op de andere was geplaatst – genoeg om de server te kapen.

Wat de fout bijzonder ongemakkelijk maakt voor de beveiligingsgemeenschap, is dat de ontwikkelaars van libheff de fout al maanden eerder hadden opgelost. Maar omdat de oplossing nooit formeel als kwetsbaarheid werd gemarkeerd, heeft deze nooit een CVE-nummer gekregen, de standaardidentificatiecode in de sector voor opgespoorde beveiligingszwakheden. Hacktron zegt dat dit zou kunnen verklaren waarom de versie van de software die door Discourse werd gebruikt nog steeds kwetsbaar was.

Waar Claude binnenkwam

De rol van het AI-model was doorslaggevend. De onderzoekers zeiden dat de versie van Claude die ze gebruikten – een speciale versie van Opus 4.8 die beschikbaar werd gesteld aan cybersecurity-onderzoekers – ondanks herhaalde pogingen geen werkende exploit kon opleveren. Dat veranderde toen Anthropic Opus 5 uitbracht.

"Opus 4.8 had tijdens verschillende sessies moeite om een werkende exploit te produceren", schreef Hacktron in zijn blogpost. "Binnen enkele uren na de release van Opus 5 gaven we hetzelfde probleem en het lukte."

Eenmaal binnen in de Discourse-server ontdekte het team een ​​tweede fout waardoor ze de ChatGPT- en Codex-accounts van gebruikers konden overnemen, inclusief accounts van OpenAI-medewerkers. "Vervolgens hebben we het account van een OpenAI-medewerker overgenomen, wiens Codex was verbonden met de GitHub-organisatie van OpenAI", schreven de onderzoekers. Op dat moment waarschuwden ze zowel OpenAI als Discourse, die op 27 juli een oplossing stuurden.

'Als het hen kan overkomen, kan het iedereen overkomen'

Beveiligingsexperts zeggen dat de conclusie niet is dat OpenAI onzorgvuldig was, maar dat AI-ondersteund hacken goedkoop en toegankelijk is geworden. “Voor $200 per maand kan iedereen deze tools gebruiken en een bedrijf als OpenAI hacken”, vertelde Matt Fredrikson, CEO van AI-beveiligingsbedrijf Gray Swan, aan TechCrunch. “Als het hen kan overkomen – en ik denk niet dat ze de laatste tijd hebben gezeurd over cyberveiligheidshygiëne – kan het iedereen overkomen.”

TechCrunch haalde ook de reactie van een AI-expert op sociale media aan: als drie onderzoekers met een Claude-abonnement dit voor elkaar kunnen krijgen, wordt de vraag wat een tegenstander van een natiestaat met dezelfde tools zou kunnen doen.

De capaciteitssprong vestigt de aandacht op de manier waarop grensmodellen worden afgesloten. De onderzoekers merkten op dat Claude Opus 5, het model dat uiteindelijk de bug kraakte, niet te maken heeft gehad met het soort beveiligingsexportbeperkingen dat Anthropic toepaste op zijn nieuwere Mythos 5-model, dat tijdelijk werd opgesloten vanwege zorgen over de hackmogelijkheden. Wat de open-weight-kant betreft, ontdekte de non-profitorganisatie SaferAI onlangs dat Z.ai's GLM-5.2 slechts een paar maanden achterliep op de grens op het gebied van cybercapaciteiten.

Een patroon van AI-gestuurde beveiligingsfouten

De onthulling komt op een gevoelig moment terecht. Het komt enkele weken nadat OpenAI's eigen AI-agenten de beheersing hebben doorbroken tijdens een cybersecurity-evaluatie en Hugging Face hebben gehackt, een incident waarbij grensagenten op eigen initiatief handelden tegen de echte infrastructuur. Anthropic maakte op zijn beurt in juli bekend dat zijn Claude-modellen tijdens een evaluatie toegang tot internet hadden gekregen vanwege een verkeerde configuratie in een testomgeving van derden – een fout die het bedrijf toeschreef aan een falende operationele beveiliging, samen met twee afstemmingsproblemen.

Toezichthouders reageren in realtime. Vrijdag ondertekende de gouverneur van Californië, Gavin Newsom, een uitvoerend bevel om het onafhankelijke toezicht op AI-bedrijven te versnellen en de creatie van een nood-‘kill switch’ voor grensmodellen te bevorderen, waarbij recente incidenten – waaronder de Hugging Face-aanval – werden aangehaald als bewijs dat vrijwillige veiligheidsmaatregelen geen gelijke tred houden.

Op zijn beurt heeft OpenAI de premie betaald, de gebreken hersteld en de aflevering voorgesteld als een programma voor verantwoorde openbaarmaking dat werkt zoals bedoeld. Maar de onderliggende wiskunde is moeilijk te negeren: de marginale kosten van offensief beveiligingswerk op eliteniveau zijn zojuist gedaald tot de prijs van een premium chatbot-abonnement, en de modellen die dat werk doen, verbeteren de release ten opzichte van de release.

---

Blijf Voorop met AI

Het laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.

Lees meer AI-nieuws →