Google DeepMind kondigde op 27 augustus aan wat het 's werelds eerste dubbelblinde evaluatie noemt van een gepatenteerd AI-model van grensklasse - een cryptografische opzet die is ontworpen om externe experts de modellen van Google te laten stresstesten zonder dat een van beide partijen ooit de geheimen van de ander ziet.

De pilot, beschreven in een DeepMind-blogpost door William Isaac, Sol Messing en Kristian Lum, voert een Gemini Flash Lite-model uit via vertrouwelijke benchmarks in een cryptografisch beveiligde omgeving. Google DeepMind werkt hiervoor samen met het Singapore AI Safety Institute, OpenMined, AVERI en MLCommons en heeft een technisch rapport gepubliceerd waarin de methodologie wordt beschreven.

De aankondiging richt zich op een van de meest hardnekkige zwakke punten in AI-evaluatie: benchmarkverontreiniging. Voor lezers die AI-onderzoeksnieuws volgen, vertegenwoordigt dit een van de meer concrete pogingen om het testen van modellen door derden aantoonbaar schoon te maken.

Het besmettingsprobleem uitgelegd

DeepMind opent zijn aankondiging met een klaslokaalanalogie. Als een student vooraf per ongeluk de examenvragen ziet, betekent een perfecte score niets. Dezelfde logica is van toepassing op frontiermodellen: als een model al is blootgesteld aan de vragen in een benchmark – via trainingsgegevens, gelekte evaluatiesets of eerdere optimalisatie – kunnen de resulterende scores de werkelijke capaciteiten enorm overschatten.

Dit is geen hypothetische zorg. Benchmarkvervuiling heeft het veld al jaren achtervolgd, waarbij onderzoekers herhaaldelijk hebben aangetoond dat populaire testsets lekken in trainingscorpora op webschaal, en dat modellen stilletjes kunnen worden afgestemd om goed te presteren op basis van bekende evaluaties. Wanneer overheden en bedrijven benchmarkscores gebruiken om inkoop- en beleidsbeslissingen te nemen, hebben opgeblazen cijfers reële gevolgen.

Naarmate modellen steeds capabeler worden, betoogt DeepMind, is de inzet het hoogst voor gevoelige evaluatiecategorieën – waarvan cybersecuritytests en overheidsbeoordelingen de belangrijkste zijn – waarbij een besmette score niet alleen misleidend maar ook potentieel gevaarlijk is.

De oude afweging: uw aanwijzingen of onze gewichten

Historisch gezien dwongen externe evaluaties met hoge inzet tot een ongemakkelijke keuze. Ofwel overhandigde de evaluator zijn testprompts aan de modelaanbieder – met het risico dat de aanbieder de testvragen van tevoren zou zien – of de aanbieder overhandigde de modelgewichten aan de evaluator – met het risico dat zijn meest waardevolle intellectuele eigendom verloren zou gaan.

Zero-logging-protocollen en strenge contractuele waarborgen hebben externe testprompts lange tijd vertrouwelijk gehouden, schrijft DeepMind, maar dit zijn beloften die eerder door beleid worden afgedwongen dan door wiskunde. Dubbelblinde evaluaties vervangen dat vertrouwen door cryptografisch bewijs.

Hoe de cryptografische box werkt

De pilot maakt gebruik van Confidential Space, onderdeel van het Confidential Computing-portfolio van Google Cloud, om te creëren wat DeepMind beschrijft als een cryptografische ‘doos’. Daarin blijven beide helften van een evaluatie – de vertrouwelijke benchmark en het bedrijfseigen model – privé voor hun respectievelijke eigenaren, en de omgeving verifieert dat feit cryptografisch.

Het resultaat is werkelijk dubbelblind: de externe beoordelaar kan de gewichten van het Gemini-model niet zien, en Google kan de testprompts van de beoordelaar niet zien. Geen van beide partijen hoeft op de beloften van de ander te vertrouwen, omdat de architectuur zelf lekkage in principe onmogelijk maakt. Cruciaal is dat de opzet ook voorkomt dat evaluatiegegevens later worden gebruikt om de modelprestaties te optimaliseren voorafgaand aan toekomstige tests, waardoor de lus wordt gesloten waardoor besmetting doorgaans weer binnensluipt.

Waarom het belangrijk is voor AI-toezicht

De bredere betekenis gaat verder dan één Gemini-model. Onafhankelijke organisaties – AI-veiligheidsinstituten, academische laboratoria, toezichthouders – hebben jarenlang moeite gehad om closed frontier-modellen rigoureus te evalueren, juist omdat aanbieders geen gewichten kunnen overdragen en beoordelaars geen benchmarks willen overhandigen. Elk groot AI-veiligheidsinstituut heeft met versies van dit probleem geworsteld bij het ondertekenen van evaluatieovereenkomsten met grenslaboratoria.

Als de pilot standhoudt, biedt deze een model waarin datasoevereiniteit en intellectueel eigendom het contact met onafhankelijk toezicht overleven. DeepMind zegt dat het hoopt dat de pilot “een nieuwe grens vestigt voor modeltoezicht, waardoor de bredere industrie wordt geholpen veiligere, betrouwbaardere en algemeen vertrouwde AI-systemen te bouwen.”

De partnerlijst is op zichzelf al opmerkelijk. Het Singapore AI Safety Institute is een van de meest actieve nationale evaluatie-instanties; OpenMined bouwt privacybehoudende rekentools; MLCommons standaardiseert branchebenchmarks. AVERI rondt een consortium af dat de overheid, de academische wereld en industriële normalisatie-instellingen omvat – de kiesdistricten die een dubbelblinde evaluatie zouden moeten toepassen om het een norm te laten worden in plaats van een demonstratie.

Een wapenwedloop over evaluatie-integriteit

De aankondiging komt terecht in een periode waarin steeds meer aandacht wordt besteed aan de manier waarop AI-bedrijven zichzelf beoordelen. Labs worden steeds vaker beschuldigd van het uitkiezen van gunstige benchmarks, en onafhankelijke klassementen zijn juist invloedrijk geworden omdat ze buiten de controle van leveranciers vallen. Dubbelblinde evaluatie breidt die onafhankelijkheidsbeweging uit binnen de eigen infrastructuur van de leverancier – een opmerkelijke verschuiving voor bedrijven die er historisch gezien op hebben aangedrongen elk detail te controleren van hoe hun modellen worden getest.

Voorlopig omvat de pilot één model en een reeks vertrouwelijke benchmarks. Maar als cryptografisch geverifieerde, besmettingsvrije evaluatie technisch routine wordt, zou dit de verwachtingen van bedrijven en toezichthouders van elk grenslaboratorium kunnen veranderen – en ‘vertrouw op onze score’ moeilijker kunnen maken in een markt die steeds meer gebaseerd is op verifieerbare claims.

---

Blijf AI een stap voor

Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.

Lees meer AI-nieuws →