Google DeepMind tillkännagav den 27 augusti vad de kallar världens första dubbelblinda utvärdering av en egenutvecklad AI-modell i gränsöverskridande klass – en kryptografisk uppsättning utformad för att låta externa experter stresstesta Googles modeller utan att någon sida någonsin ser den andras hemligheter.

Piloten, som beskrivs i ett DeepMind-blogginlägg av William Isaac, Sol Messing och Kristian Lum, kör en Gemini Flash Lite-modell genom konfidentiella riktmärken i en kryptografiskt säker miljö. Google DeepMind samarbetar med Singapore AI Safety Institute, OpenMined, AVERI och MLCommons om arbetet och har publicerat en teknisk rapport som beskriver metoden.

Tillkännagivandet tar upp en av de mest ihållande svagheterna i AI-utvärdering: benchmark-kontamination. För läsare som spårar AI-forskningsnyheter, representerar det ett av de mer konkreta försöken att göra testning av tredjepartsmodeller verifierbart rena.

Föroreningsproblemet, förklarat

DeepMind öppnar sitt tillkännagivande med en klassrumsanalogi. Om en student av misstag ser provfrågorna i förväg betyder ett perfekt resultat ingenting. Samma logik gäller för gränsmodeller: om en modell redan har exponerats för frågorna i ett benchmark - genom träningsdata, läckta evaluppsättningar eller tidigare optimering - kan de resulterande poängen kraftigt överskatta verklig förmåga.

Detta är inte en hypotetisk oro. Benchmark-kontamination har följt fältet i åratal, med forskare som upprepade gånger visat att populära testset läcker in i webbskaliga träningskroppar och att modeller tyst kan trimmas för att prestera bra på kända utvärderingar. När regeringar och företag använder riktmärken för att fatta upphandlings- och politiska beslut, får uppblåsta siffror verkliga konsekvenser.

När modellerna blir mer kapabla, hävdar DeepMind, är insatserna högst för känsliga utvärderingskategorier – cybersäkerhetstestning och statliga bedömningar främst bland dem – där en kontaminerad poäng inte bara är missvisande utan potentiellt farlig.

Den gamla avvägningen: Dina uppmaningar eller våra vikter

Historiskt sett tvingade externa utvärderingar med hög insats fram ett obekvämt val. Antingen överlämnade utvärderaren sina testuppmaningar till modellleverantören - med risk för att leverantören skulle se testfrågorna i förväg - eller så överlämnade leverantören modellvikter till utvärderaren - och riskerade att förlora sin mest värdefulla immateriella egendom.

Nollloggningsprotokoll och rigorösa avtalsgarantier har länge hållit externa testuppmaningar konfidentiella, skriver DeepMind, men det är löften som upprätthålls av policy snarare än av matematik. Dubbelblinda utvärderingar ersätter det förtroendet med kryptografiska bevis.

Hur den kryptografiska rutan fungerar

Piloten använder Confidential Space, en del av Google Clouds Confidential Computing-portfölj, för att skapa vad DeepMind beskriver som en kryptografisk "låda". Inuti den förblir båda halvorna av en utvärdering - det konfidentiella riktmärket och den proprietära modellen - privata för sina respektive ägare, och miljön verifierar detta faktum kryptografiskt.

Resultatet är verkligen dubbelblindt: den externa utvärderaren kan inte se Gemini-modellens vikter och Google kan inte se utvärderarens testuppmaningar. Ingendera sidan måste lita på den andras löften, eftersom arkitekturen i sig omöjliggör läckage i princip. Kritiskt sett förhindrar installationen också att utvärderingsdata används senare för att optimera modellens prestanda inför framtida tester – vilket stänger slingan genom vilken kontaminering vanligtvis smyger sig in igen.

Varför det är viktigt för AI-övervakning

Den bredare betydelsen går utöver en Gemini-modell. Oberoende organisationer – AI-säkerhetsinstitut, akademiska laboratorier, tillsynsmyndigheter – har kämpat i åratal för att noggrant utvärdera slutna gränsmodeller, just för att leverantörer inte kan lämna över vikter och utvärderare inte kommer att lämna över riktmärken. Alla större AI-säkerhetsinstitut har brottats med versioner av detta problem när de undertecknade utvärderingsavtal med frontier labs.

Om piloten håller i sig erbjuder den en mall under vilken datasuveränitet och immateriella rättigheter överlever kontakt med oberoende granskning. DeepMind säger att de hoppas att piloten "etablerar en ny gräns för modellövervakning, och hjälper den bredare industrin att bygga säkrare, mer pålitliga och allmänt pålitliga AI-system."

Partnerlistan är anmärkningsvärd i sig. Singapore AI Safety Institute är ett av de mest aktiva nationella utvärderingsorganen; OpenMined bygger integritetsbevarande beräkningsverktyg; MLCommons standardiserar industribenchmarking. AVERI avrundar ett konsortium som omfattar myndigheter, akademi och industristandardsorgan – de valkretsar som skulle behöva anta dubbelblind utvärdering för att det ska bli en norm snarare än en demonstration.

En kapprustning över utvärderingsintegritet

Tillkännagivandet landar mitt i ökande granskning av hur AI-företag graderar sig själva. Labs möter växande anklagelser om att välja gynnsamma riktmärken, och oberoende topplistor har blivit inflytelserika just för att de sitter utanför leverantörernas kontroll. Dubbelblind utvärdering utökar den oberoende rörelsen inuti leverantörens egen infrastruktur - en anmärkningsvärd förändring för företag som historiskt har insisterat på att kontrollera varje detalj av hur deras modeller testas.

För närvarande omfattar piloten en modell och en uppsättning konfidentiella riktmärken. Men om kryptografiskt verifierad, kontamineringsfri utvärdering blir tekniskt rutin, kan det förändra vad företag och tillsynsmyndigheter förväntar sig av varje gränslabb – och göra "trust our score" till en svårare försäljning på en marknad som alltmer bygger på verifierbara påståenden.

---

Stay ahead of AI

Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.

Läs mer AI-nyheter →