Anthropic publiceerde deze week een eerste blik in zijn eigen ontwikkelingspijplijn, waaruit bleek dat zijn Claude-model nu 26% van het AI-onderzoeks- en ontwikkelingswerk bij het bedrijf ‘leidt’ – een stijging ten opzichte van minder dan 1% in februari 2026. De cijfers verschenen in een blogpost van het bedrijf met de titel ‘Measurements for Understanding the tempo of AI development inside frontier labs’, gepubliceerd door Anthropic op 17 september en gerapporteerd door Reuters, The Washington Post en anderen. stopcontacten.
De post is deels een transparantieoefening en deels een argument: Anthropic wil dat andere grenslaboratoria hetzelfde soort cijfers publiceren, zodat het publiek en overheden kunnen volgen hoe snel AI de sleutels krijgt overhandigd voor het bouwen van AI. Voor meer context over dit verhaal, zie ons AI-nieuws.
Drie cijfers om de AI-ontwikkeling te volgen
Het bedrijf stelde drie metingen voor die naar eigen zeggen het tempo van de ontwikkeling binnen grenslaboratoria zouden verduidelijken: hoeveel AI-R&D door AI zelf wordt uitgevoerd, hoe goed toezicht wordt gehouden op de acties van AI-agenten en hoe de rekenkracht wordt verdeeld tussen capaciteitswerk en veiligheidswerk.
Het hoofdnummer komt van wat Anthropic zijn R&D Automation Index noemt. Het bedrijf catalogiseerde alle soorten AI-R&D-werk dat bij het bedrijf werd gedaan, beoordeelde hoe geautomatiseerd elke taak momenteel is en aggregeerde de resultaten met behulp van een schaal ontwikkeld door de onderzoeksgroep Epoch AI. De schaal loopt van AL0 (geen AI-betrokkenheid) tot AL5 (AI werkt volledig autonoom, zonder mens in de lus), waarbij AL3 betekent dat AI 'samenwerkt' aan grote stukken werk onder nauwe menselijke leiding en AL4 betekent dat AI 'leidt', waarbij het grootste deel van een taak end-to-end wordt voltooid vanaf een prompt op hoog niveau terwijl een mens toezicht houdt.
Anthropic meldde dat Claude in augustus 2026 26% van de AI-R&D-werkzaamheden van het bedrijf leidt. Het aandeel werk op of boven het niveau ‘AI werkt samen’ ligt boven de 90%. Claude opereert niet volledig autonoom voor welk deel van het AI-R&D-werk dan ook.
30.000 agenten, één monitor
De tweede meting betreft het toezicht. Anthropic maakte bekend dat er vanaf augustus 2026 ongeveer 30.000 agenten tegelijkertijd onderzoeks- en engineeringwerk verrichtten bij het bedrijf op het meest gebruikte interne platform.
Elke actie die deze agenten ondernemen, passeert een online monitor voordat deze wordt uitgevoerd, meestal binnen enkele seconden, aldus de post. Anthropic zegt dat het in augustus meer dan een miljard beslissingen van zijn onderzoeks- en ingenieursbureaus heeft geanalyseerd en heeft vastgesteld dat het aandeel van de door de monitors geblokkeerde of geëscaleerde activiteiten 0,002% bedroeg.
Wat betreft de toewijzing van computers, de derde meting, zei het bedrijf dat in de onderzochte week ongeveer 6% van de computers die naar AI-R&D gingen, werd toegewezen aan veiligheid.
Bouwen aan zijn eigen opvolger – onder toezicht van mensen
De omlijsting is net zo belangrijk als de figuren. De modellen van Anthropic nemen steeds meer deel aan het bouwen van de volgende generatie van diezelfde modellen – wat onderzoekers recursieve zelfverbetering noemen, en wat de kop van The Washington Post botter omschreef als een chatbot die ‘het werk van het bouwen van zijn eigen opvolger overneemt’.
Anthropic trekt zorgvuldig een grens tussen ‘AI leidt’ en ‘AI vervangt’. Bij AL4 houdt nog steeds een mens toezicht en kan ingrijpen; het bedrijf meldde expliciet dat geen enkele gemeten subset van zijn R&D-werk op AL5 draait. Maar het traject is steil: een stijging van minder dan 1% naar 26% in ongeveer zeven maanden suggereert dat het aandeel van door AI geleid werk ruim vóór het einde van het decennium de helft zou kunnen overschrijden als de huidige trends aanhouden.
De methodologie heeft echte grenzen, en Anthropic zegt dat ook. De automatiseringsbeoordelingen werden verkregen door steekproeven te nemen uit de eigen werkgegevens van het bedrijf (inclusief Slack-berichten en interne documentatie) en door zowel mensen als een jurymodel te laten beoordelen hoe geautomatiseerd elke taak is. In een blinde test beoordeelde het personeel taken zonder te weten welk bewijs de modellen hadden verzameld. Het bedrijf meldde dat zijn modelrechter het ongeveer net zo vaak met mensen eens was als mensen met elkaar: de exacte overeenkomst tussen model en mens was 59%, terwijl de overeenkomst tussen mens en mens slechts 35% was, en de beoordelingen van modellen en mensen kwamen in 97% van de gevallen binnen één niveau van elkaar terecht.
Het bedrijf erkende ook het zelfreferentiële risico in zijn eigen methodologie: Anthropic gebruikte zijn eigen modellen om zijn systemen te helpen evalueren, wat zou kunnen betekenen dat het rechtersmodel dezelfde soort fouten maakt als het model dat het controleert. Verificatie door derden is volgens hem het echte antwoord.
Ogen van buitenaf komen eraan
Daartoe zegt Anthropic dat het van plan is onafhankelijke externe beoordelaars van meerdere organisaties binnen het bedrijf in te bedden, waardoor ze toegang krijgen tot interne processen, systemen en gegevens die vergelijkbaar zijn met wat interne risicobeoordelingsteams hebben. De externe non-profitorganisatie voor AI-onderzoek, METR, heeft eerder het offline monitoringplatform van Anthropic samengesteld.
De onthulling komt te midden van een escalerend debat over tempo. Anthropic CEO Dario Amodei heeft opgeroepen tot coördinatie bij het vertragen van de grens, en het bedrijf merkt op dat de eigen cijfers naar verwachting zouden verschuiven als een dergelijke coördinatie zou bestaan. Deze week waren Anthropic en OpenAI ook het onderwerp van een openbare brief van veiligheidsexperts waarin werd betoogd dat de laboratoria echt onafhankelijke veiligheidsbeoordelaars nodig hebben.
Of rivalen het voorbeeld van Anthropic zullen volgen, is de open vraag. Het bedrijf beweert dat elke grensontwikkelaar deze maatregelen regelmatig zou kunnen publiceren met behulp van een openbare methodologie. Totdat ze dat doen, zijn de enige publieke cijfers over hoe snel AI AI bouwt afkomstig van de laboratoria zelf.
---
Blijf Voorop met AIHet laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.
Lees meer AI-nieuws →