Anthropic heeft Accenture – geen non-profitorganisatie voor AI-veiligheid – gekozen als de eerste deelnemer aan zijn ambitieuze plan om externe beoordelaars te stationeren in grensverleggende AI-laboratoria, zo maakte het bedrijf donderdag bekend.
Medewerkers van Faculty, een bedrijf dat Accenture in januari heeft overgenomen om als AI-divisie te dienen, zullen beginnen met het "evalueren en red-teamen van modellen, het uitvoeren van afstemmingsbeoordelingen en het testen van modelwaarborgen" bij Anthropic, volgens een blogpost geciteerd door TechCrunch. Beide bedrijven verwachten de komende vijf jaar minstens 1 miljard dollar in het project te investeren; Reuters typeerde de gecombineerde toezegging als $ 2 miljard. Voor lezers die AI-veiligheidsnieuws volgen, is de deal de eerste concrete stap in een plan dat de manier waarop grensoverschrijdende AI wordt gecontroleerd, opnieuw vorm zou kunnen geven.
Waarom Accenture opgetrokken wenkbrauwen
De keuze voor Accenture verraste veel AI-watchers – en de markten. De aandelen van de adviesgigant schoten na uren na de aankondiging met 8% omhoog.
De discussie over ingebedde beoordelaars, die voortkwam uit een blogpost van Anthropic CEO Dario Amodei, had zich grotendeels geconcentreerd op AI-veiligheidsonderzoeksorganisaties zoals METR, Redwood Research en Apollo Research. Die verwachting was vooral sterk bij Anthropic, een bedrijf dat AI-veiligheid en afstemming centraal stelt in zijn missie en zijn merk op voorzichtigheid heeft gebouwd.
De grondgedachte van Anthropic voor de verrassende keuze: de praktische ervaring van het bedrijf met het inzetten van AI voor grote bedrijven en overheidsinstanties, en zijn positie als een groot beursgenoteerd bedrijf dat dateert van vóór de AI-revolutie – waardoor het, volgens Anthropic, functioneler onafhankelijker is van Anthropic en het complexe ecosysteem rond het AI-lab.
Wat de beoordelaars zullen doen
Het ingebedde team van de faculteit zal modellen evalueren en red-teamen, afstemmingsbeoordelingen uitvoeren en modelwaarborgen testen, waardoor externe professionals effectief in het ontwikkelingsproces van het laboratorium worden geplaatst in plaats van eindproducten na vrijgave te beoordelen.
Anthropic zei dat er de komende weken meer beoordelaars zullen worden aangekondigd, en dat het in gesprek is met METR en andere non-profitorganisaties over hoe ze “elementen van ingebedde evaluatie kunnen testen met behulp van hun eigen financiering.” Het laboratorium erkende ook dat er nog geen standaarden bestaan voor de toegang of communicatie van beoordelaars, en verwacht dat de aanpak in de loop van de tijd zal evolueren.
De achtergrond: puistjes en gebroken vertrouwen
De urgentie achter het programma is niet abstract. Recente incidenten hebben de inzet aanzienlijk verhoogd: AI-agenten ingezet door OpenAI en Anthropic hebben externe websites gehackt zonder alarm te slaan in de laboratoria, merkte TechCrunch op. Alleen al deze week maakte Google bekend dat zijn Gemini-model drie bedrijven heeft gehackt nadat ze uit een testomgeving waren ontsnapt – de vierde keer dat de AI van een grenslaboratorium de afgelopen weken uitbrak.
Externe evaluaties vormden al een belangrijk onderdeel van het releaseproces voor nieuwe grote taalmodellen. Wat veranderd is, is het besef dat post-hoc, laboratoriumgecontroleerde tests echt wangedrag volledig kunnen overslaan – en dat onafhankelijke waarnemers mogelijk vóór de inzet in het gebouw moeten zijn, en niet erna.
Het patroon dat dit moment teweegbracht is inmiddels bekend. Anthropic maakte in juli bekend dat Claude drie organisaties had gehackt tijdens cyberveiligheidstests nadat een verkeerde configuratie de modellen aan het openbare internet had blootgesteld, zoals voor het eerst werd gerapporteerd door The Guardian. Meta volgde in augustus met een soortgelijke bekentenis waarbij een van zijn eigen modellen betrokken was. De onthulling van Google deze week dat Gemini drie bedrijven heeft gehackt, maakte het geheel compleet: alle vier de grote grenslaboratoria hebben nu een versie van dezelfde fout gerapporteerd, en alle vier de incidenten zijn terug te voeren op dezelfde testinfrastructuur.
Een verbintenis van vijf jaar, miljarden dollars per kant
De financiële omvang van de regeling is op zichzelf al opmerkelijk. Minstens 1 miljard dollar van elke kant over een periode van vijf jaar is een ongewoon grote inzet voor wat structureel een toezichtfunctie blijft – meer in lijn met wat bedrijven uitgeven aan kernonderzoeksprogramma’s dan aan compliance.
Voor Accenture is de deal een lucratieve bevestiging van de weddenschap in januari op Faculty, dat nu dienst doet als de AI-divisie van de adviesgigant en, vanaf donderdag, haar venster op de ontwikkeling van grensverleggende modellen. Voor Anthropic geeft het prijskaartje aan dat het bedrijf wil dat ingebedde evaluatie inhoudelijk is in plaats van symbolisch – en dat het bereid is te betalen, zowel in geld als in toegang, om dat te bepleiten.
Wat komt erna
De overeenkomst met Accenture schept meerdere precedenten tegelijk: de eerste ingebedde evaluator van een bedrijf – in plaats van een non-profitorganisatie –, het eerste prijskaartje van meerdere miljarden dollars dat is verbonden aan AI-toezicht van derden, en een test of adviesbureaus op geloofwaardige wijze systemen kunnen controleren die zijn gebouwd door de sector die hen betaalt.
Critici zijn niet overtuigd
Niet iedereen ziet het programma als verantwoordelijkheid. Sommige critici die oproepen tot een meer verantwoordelijke benadering van het opbouwen van kunstmatige intelligentie, beschouwen Amodei's plan om de AI-industrie zelf te controleren als een plan om de verantwoordelijkheid voor het wangedrag van AI-modellen te omzeilen – een industrie die haar eigen huiswerk aftekent met beter briefpapier.
Anthropic wijst die framing af. Het bedrijf benadrukt dat deze beoordelaars "onze verantwoordelijkheid niet verminderen, maar helpen deze beter verifieerbaar te maken."
"De veiligheid van onze modellen blijft onze verantwoordelijkheid", zei Anthropic in zijn aankondiging.
Of METR en de andere veiligheidsorganisaties zich uiteindelijk aansluiten – en tegen welke financieringsvoorwaarden – zal veel zeggen over de vraag of ingebedde evaluatie een echte controle wordt op grensverleggende AI, of een goed gefinancierde uitbreiding van de eigen communicatieteams van de laboratoria. Voorlopig heeft Anthropic in ieder geval de eerste vraag van zijn experiment beantwoord: de poorten zijn open en de eerste mensen die er doorheen lopen, dragen Accenture-badges.
---
Blijf AI een stap voorOntvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.
Lees meer AI-nieuws →