OpenAI heeft de beloning voor het ontdekken van ‘universele jailbreaks’ in zijn AI-modellen verhoogd naar $50.000. Daarmee is de eerdere beloning ruimschoots verdubbeld. Dit geeft aan dat het bedrijf bepaalde soorten veiligheidsomzeilingen als ernstig genoeg beschouwt om een ​​premie-uitbetaling te rechtvaardigen.

Het bijgewerkte Bio Bug Bounty-programma, aangekondigd door OpenAI op 9 juli 2026, vraagt ​​beveiligingsonderzoekers aanwijzingen te vinden die universeel de veiligheidsrails van het model kunnen doorbreken - omzeilingen die in meerdere gesprekken en contexten werken in plaats van geïsoleerde randgevallen. Het programma richt zich specifiek op jailbreaks die verband houden met biologische bedreigingen, waarbij een AI-model kan worden gedwongen om bruikbare richtlijnen te geven voor het creëren van gevaarlijke ziekteverwekkers of wapens.

Voor meer actueel AI-nieuws en diepgaande analyses gaat u naar AI Buzz Wire.

Waarom $ 50.000?

De hogere beloning weerspiegelt de groeiende bezorgdheid over de kloof tussen wat AI-modellen van grensverleggende modellen niet mogen doen en wat vastberaden gebruikers er daadwerkelijk uit kunnen halen. Een universele jailbreak is bijzonder gevaarlijk omdat het, in tegenstelling tot een eenmalige prompt-injectietruc, een systematische zwakte vertegenwoordigt die kan worden gerepliceerd en gedeeld.

TechRepublic meldde op 10 juli dat de beloningsverhoging het gevolg is van verscherpt onderzoek naar de krachtigste modellen van OpenAI. De regering-Trump heeft OpenAI eerder gevraagd om de release van haar nieuwste cyber-compatibele model te beperken tot een zorgvuldig geselecteerde groep doorgelichte gebruikers, volgens National Technology News, wat de bezorgdheid van de overheid over het offensieve potentieel van grensverleggende AI-systemen weerspiegelt.

UK Agency constateert dat AI-cybermogelijkheden versnellen

De aankondiging van de premie valt samen met een scherpe waarschuwing van het Britse AI Security Institute (AISI), dat sinds 2024 onafhankelijk de cybercapaciteiten van grensmodellen evalueert.

In een evaluatie van OpenAI's GPT-5.5 in april 2026 ontdekte de AISI dat het model een slagingspercentage van 71,4% behaalde voor cyberbeveiligingstaken op expertniveau - het hoogste van alle geteste modellen, en overtrof Anthropic's Claude Mythos Preview met 68,6%, GPT-5.4 met 52,4% en Opus 4.7 met 48,6%.

Eén benchmark was bijzonder opvallend. AISI ontwierp een op maat gemaakte reverse-engineering-uitdaging voor virtuele machines: een taak die uit meerdere stappen bestaat en waarbij een aanvaller een aangepaste instructiedecoder moet bouwen, een authenticator moet reverse-engineeren en een geldig wachtwoord moet herstellen. De deskundige menselijke speltester van Crystal Peak Security loste de uitdaging in ongeveer 12 uur op met behulp van professionele tools. GPT-5.5 loste het op in 10 minuten en 22 seconden en kostte $ 1,73 aan API-gebruik, zonder menselijke hulp.

Elke paar maanden een verdubbeling

In een afzonderlijke analyse die in mei 2026 werd gepubliceerd, constateerde de AISI dat de lengte van de cybertaken die grens-AI-modellen autonoom kunnen uitvoeren sinds eind 2024 elke 4,7 maanden is verdubbeld – een versnelling ten opzichte van de schatting van november 2025 van acht maanden.

“Het huidige tempo van verandering duidt op een groeiend potentieel voor AI-cybercapaciteiten om zich te vertalen in tastbare risico’s – risico’s die Britse organisaties de komende maanden zullen moeten overwinnen”, schreef de AISI.

Claude Mythos Preview en GPT-5.5 overtroffen beide aanzienlijk de vorige verdubbelingstrend, wat de vraag doet rijzen of het tempo nog sneller wordt.

Universele jailbreaks: de hoogste inzet

Het onderscheid tussen een beperkte jailbreak en een universele jailbreak is van cruciaal belang. Een beperkte jailbreak kan een model ertoe verleiden om onder specifieke omstandigheden één enkele niet-toegestane reactie te produceren. Een universele jailbreak vertegenwoordigt daarentegen een fundamentele scheur in de veiligheidsarchitectuur van het model – een methode die op betrouwbare wijze vangrails over een breed scala aan ingangen omzeilt.

Het besluit van OpenAI om 50.000 dollar te bieden voor dergelijke ontdekkingen suggereert dat het bedrijf gelooft dat universele jailbreaks zowel zeldzaam genoeg zijn om een ​​grote premie te rechtvaardigen als gevaarlijk genoeg om de investering te rechtvaardigen. Als een universele jailbreak voor zoekopdrachten die verband houden met biobedreigingen door een kwaadwillende actor wordt ontdekt voordat deze is gepatcht, kunnen de gevolgen ernstig zijn.

Het programma heeft ook een transparantiefunctie. Door externe onderzoekers uit te nodigen om zijn modellen te onderzoeken, kan OpenAI kwetsbaarheden identificeren en oplossen voordat ze in het wild worden uitgebuit – op voorwaarde dat de beloning groot genoeg is om het benodigde talent aan te trekken.

Een race tussen aanval en verdediging

De parallelle ontwikkelingen – de premieverhoging van OpenAI en de capaciteitsbeoordelingen van de AISI – illustreren de centrale spanning in de huidige AI-veiligheid. Modellen worden steeds beter in staat cybertaken uit te voeren, waarbij de tijdshorizon van taken die ze kunnen voltooien elke paar maanden verdubbelt. Tegelijkertijd zijn bedrijven bezig met het patchen van de kwetsbaarheden die hun modellen gevaarlijk maken.

Of premies en red-teaming gelijke tred kunnen houden met de versnellende capaciteitencurve blijft een open vraag. Maar het cijfer van $50.000 geeft een duidelijk signaal af: OpenAI gelooft dat de dreiging ernstig genoeg is om een ​​hoge dollar te betalen aan iedereen die kan bewijzen dat de scheuren bestaan.

Blijf AI een stap voor

Naarmate grensmodellen krachtiger worden, zal de strijd tussen veiligheidsbarrières en degenen die deze proberen te doorbreken alleen maar heviger worden. Volg de laatste ontwikkelingen op AI Buzz Wire.

Lees meer dekking van de AI-industrie op AI Buzz Wire.