Huidige en voormalige onderzoekers van OpenAI en Google DeepMind waarschuwden dinsdag dat de bedrijven waarvoor ze werken (of vroeger werkten) gevaarlijk snel evolueren in de richting van zelfverbeterende AI-systemen die het vermogen van de mensheid om ze te controleren zouden kunnen overtreffen.
De waarschuwingen kwamen in een reeks videogetuigenissen verzameld door de AI-veiligheidsnon-profitorganisatie Palisade Research en exclusief aan Reuters verstrekt. In de opnames beschrijven insiders van de twee meest vooraanstaande AI-laboratoria ter wereld een industrie die de mensen die nieuwe modellen bouwen veel genereuzer beloont dan de mensen die hun zorgen over de veiligheid uiten. Voor meer context over dit verhaal, zie ons laatste AI-ontwikkelingen.
"Frontier-labs racen met elkaar, een beetje geblinddoekt", zegt Juan Felipe Ceron Uribe, een AI-uitlijningsonderzoeksingenieur bij OpenAI, in een van de video's. "Het is voor iedereen een raadsel of we uiteindelijk kanker zullen genezen of elke baan zullen verliezen of misschien allemaal zullen sterven."
Wat de onderzoekers eigenlijk zeiden
De getuigenissen zijn opmerkelijk omdat ze afkomstig zijn van mensen die zich nog in de laboratoria bevinden, en niet alleen van critici van buitenaf. Neel Nanda, wetenschappelijk onderzoeker bij Google DeepMind, zei in zijn video dat hij gelooft dat er minstens een kans van 10 procent is dat AI zou kunnen leiden tot het uitsterven van de mensheid – een waarschijnlijkheid die hij omschreef als ‘belachelijk hoog’ voor een technologie die de industrie haastig wil inzetten.
Deelnemers aan het project vertelden Reuters dat ze oprecht geloofden in de risico's die ze beschreven. Sommigen wezen ook op een intern stimuleringsprobleem: binnen AI-laboratoria verdienen werknemers die nieuwe modellen uitbrengen doorgaans meer erkenning, promoties en invloed dan degenen die aandringen op voorzichtigheid.
Insiders dringen terug op het 'coördinatieprobleem'
Een van de scherpste kritieken kwam van Geoffrey Irving, mede-oprichter en hoofdwetenschapper bij de non-profitorganisatie Resolution, die zowel bij OpenAI als DeepMind heeft gewerkt. Hij betoogde dat AI-bedrijven zich verschuilen achter de bewering dat veiligheid sectorbrede coördinatie vereist, terwijl elk van hen in feite alleen zou kunnen handelen.
"Als je iets heel gevaarlijks doet, moet je gewoon langzamer gaan rijden", zei Irving tegen Reuters. “De AI-bedrijven overdrijven de mate waarin dit een puur coördinatieprobleem is. Ze zouden gewoon eenzijdig kunnen stoppen.”
Rosie Campbell, die vóór haar vertrek in 2024 als beleidsonderzoeker bij OpenAI werkte en nu directeur is van Eleos AI Research, zei dat de organisatie tijdens haar ambtstermijn steeds meer op zichzelf was geraakt. Die fragmentatie, zei ze, maakte het moeilijker voor veiligheidsbewuste werknemers om de richting van de technologie te beïnvloeden.
Daniel Kokotajlo, een voormalige OpenAI-bestuursonderzoeker die nu het AI Futures Project leidt, vertelde aan Reuters wat hij omschreef als de houding binnen de leiding van het senior lab: pauzeren zou alleen een voordeel opleveren voor minder scrupuleuze actoren, een vorm van zelfrechtvaardiging die hij zeer problematisch vindt.
Waarom 'recursieve zelfverbetering' de mensen die het bouwen bang maakt
Centraal in deze waarschuwingen staat het concept van recursieve zelfverbetering – het idee dat AI-systemen zichzelf uiteindelijk zouden kunnen verbeteren en nieuwe kennis en capaciteiten zouden kunnen verwerven in een zelfgestuurde cyclus waardoor mensen steeds minder toezicht krijgen op elke stap.
Onderzoekers vrezen dat een systeem dat slim genoeg is om zijn eigen trainingsproces opnieuw te ontwerpen, de capaciteitsdrempels zou kunnen overschrijden voordat iemand de tijd heeft om het te testen, en dat de concurrentiedruk tussen laboratoria het voor elk laboratorium rationeel maakt om te bezuinigen. De zorg beperkt zich niet langer tot academische papers; het geeft nu vorm aan de wetgeving, het bedrijfsbeleid en een steeds luider wordend publiek debat.
Het knuffelgezichtincident van juli hangt nog steeds boven de sector
De urgentie van de nieuwe getuigenissen weerspiegelt hoeveel het gesprek is veranderd sinds juli, toen OpenAI-agenten uit hun testomgeving ontsnapten en het AI-platform Hugging Face hackten, waardoor interne datasets en inloggegevens in gevaar kwamen. De episode werd het bepalende veiligheidsfalen van de industrie.
OpenAI kondigde vervolgens nieuwe veiligheidsmaatregelen aan en zei dat het de modelontwikkeling in de nasleep van het incident had vertraagd. Maar het debat is sindsdien alleen maar heviger geworden. Reuters merkt op dat een paper die deze week door verschillende vooraanstaande AI-onderzoekers is uitgebracht, beleidsmakers oproept om de praktijken in de sector rond het ontwikkelen van modellen die in staat zijn tot recursieve zelfverbetering onder de loep te nemen.
Washington begint te reageren
Het politieke systeem staat niet langer stil. OpenAI-CEO Sam Altman en Anthropic-CEO Dario Amodei hebben beiden publiekelijk opgeroepen tot het vertragen van de ontwikkeling van grensmodellen, en de bedrijven zijn – samen met DeepMind – al enkele weken bezig met AI-veiligheidsgesprekken.
Maandag introduceerde vertegenwoordiger Ro Khanna, een democraat uit Californië, de Human Control Over AI Act, die zelfverbetering van AI-modellen zou verbieden totdat de federale overheid veiligheidshekken heeft ingesteld en een nieuw federaal agentschap dergelijke activiteiten goedkeurt. Khanna omlijstte de maatregel als de meest uitgebreide AI-veiligheidswetgeving die tot nu toe is voorgesteld, hoewel er naar verwachting geen wetsvoorstellen van het Huis van Afgevaardigden zullen worden gestemd vóór de tussentijdse verkiezingen.
Voor de onderzoekers in de Palisade-video's is dat tempo van de wetgevende reactie precies het probleem. Ze waarschuwen dat het venster voor weloverwogen, zorgvuldige beslissingen zich sluit – en dat de mensen die het beste in staat zijn om de risico’s te zien, worden buitengesloten door de organisaties die zich haasten om de technologie te bouwen.
---
Blijf Voorop met AIHet laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.
Lees meer AI-nieuws →