Google DeepMind a anunțat pe 27 august ceea ce numește prima evaluare dublu-orb din lume a unui model AI proprietar, de clasă de frontieră - o configurație criptografică concepută pentru a permite experților externi să testeze modelele Google fără ca niciuna dintre părți să vadă vreodată secretele celeilalte.
Pilotul, descris într-o postare pe blogul DeepMind de William Isaac, Sol Messing și Kristian Lum, rulează un model Gemini Flash Lite prin benchmark-uri confidențiale într-un mediu securizat criptografic. Google DeepMind este în parteneriat cu Singapore AI Safety Institute, OpenMined, AVERI și MLCommons în acest efort și a publicat un raport tehnic care descrie metodologia.
Anunțul abordează una dintre cele mai persistente puncte slabe în evaluarea AI: contaminarea de referință. Pentru cititorii care urmăresc știrile cercetării AI, aceasta reprezintă una dintre cele mai concrete încercări de a face testarea modelelor de la terți în mod verificabil.
Problema de contaminare, explicată
DeepMind își deschide anunțul cu o analogie în clasă. Dacă un student vede din greșeală întrebările de la examen în avans, un scor perfect nu înseamnă nimic. Aceeași logică se aplică modelelor de frontieră: dacă un model a fost deja expus întrebărilor dintr-un benchmark - prin date de antrenament, seturi de evaluări scurse sau optimizare anterioară - scorurile rezultate pot supraevalua în mod masiv capacitatea reală.
Aceasta nu este o preocupare ipotetică. Contaminarea de referință a afectat domeniul de ani de zile, cercetătorii arătând în mod repetat că seturile de teste populare se scurg în corpurile de antrenament la scară web și că modelele pot fi reglate în liniște pentru a funcționa bine pe evaluările cunoscute. Atunci când guvernele și întreprinderile folosesc scorurile de referință pentru a lua decizii privind achizițiile și politicile, cifrele umflate au consecințe reale.
Pe măsură ce modelele devin mai capabile, susține DeepMind, mizele sunt cele mai mari pentru categoriile de evaluare sensibile - testele de securitate cibernetică și evaluările guvernamentale principale dintre ele - unde un scor contaminat nu este doar înșelător, ci și potențial periculos.
Vechiul compromis: sugestiile tale sau greutățile noastre
Din punct de vedere istoric, evaluările externe cu mize mari au forțat o alegere inconfortabilă. Fie evaluatorul a predat instrucțiunile de testare furnizorului de modele – riscând ca furnizorul să vadă întrebările de testare în avans – fie furnizorul a predat ponderile modelului evaluatorului – riscând pierderea proprietății intelectuale cele mai valoroase.
Protocoalele de zero-logging și garanțiile contractuale riguroase au păstrat de mult timp confidențiale solicitărilor de testare externe, scrie DeepMind, dar acestea sunt promisiuni impuse de politică, mai degrabă decât de matematică. Evaluările dublu-orb înlocuiesc această încredere cu dovezi criptografice.
Cum funcționează cutia criptografică
Pilotul folosește Confidential Space, parte a portofoliului Google Cloud de Confidential Computing, pentru a crea ceea ce DeepMind descrie ca o „cutie” criptografică. În interiorul acesteia, ambele jumătăți ale unei evaluări – benchmarkul confidențial și modelul proprietar – rămân private pentru proprietarii respectivi, iar mediul verifică criptografic acest fapt.
Rezultatul este cu adevărat dublu-orb: evaluatorul extern nu poate vedea greutățile modelului Gemini, iar Google nu poate vedea solicitările de testare ale evaluatorului. Niciuna dintre părți nu trebuie să aibă încredere în promisiunile celeilalte, deoarece arhitectura în sine face scurgerea imposibilă în principiu. În mod critic, configurația împiedică, de asemenea, utilizarea ulterioară a datelor de evaluare pentru a optimiza performanța modelului înainte de testele viitoare - închizând bucla prin care contaminarea revine de obicei.
De ce contează pentru supravegherea AI
Semnificația mai largă depășește un model Gemeni. Organizațiile independente – institute de siguranță AI, laboratoare academice, autorități de reglementare – s-au luptat ani de zile să evalueze riguros modele de frontieră închisă, tocmai pentru că furnizorii nu pot preda ponderile, iar evaluatorii nu vor preda criteriile de referință. Fiecare institut major de siguranță AI sa confruntat cu versiuni ale acestei probleme atunci când semnează acorduri de evaluare cu laboratoarele de frontieră.
Dacă pilotul rezistă, oferă un șablon sub care suveranitatea datelor și proprietatea intelectuală supraviețuiesc contactului cu controlul independent. DeepMind spune că speră că pilotul „stabilește o nouă frontieră pentru supravegherea modelelor, ajutând industria mai largă să construiască sisteme AI mai sigure, mai fiabile și de încredere”.
Lista de parteneri este notabilă în sine. Institutul de Siguranță AI din Singapore este unul dintre cele mai active organisme naționale de evaluare; OpenMined construiește instrumente de calcul care păstrează confidențialitatea; MLCommons standardizează benchmarking-ul industriei. AVERI completează un consorțiu care cuprinde guvern, mediul academic și organisme de standardizare din industrie - circumscripții care ar trebui să adopte evaluarea dublu-orb pentru ca aceasta să devină o normă mai degrabă decât o demonstrație.
O cursă a înarmărilor asupra integrității evaluării
Anunțul ajunge pe fondul unui control din ce în ce mai mare asupra modului în care companiile AI se autoevaluează. Laboratoarele se confruntă cu acuzații din ce în ce mai mari de alegere a unor puncte de referință favorabile, iar clasamentele independente au devenit influente tocmai pentru că nu stau sub controlul vânzătorilor. Evaluarea dublu-orb extinde această mișcare de independență în interiorul infrastructurii proprii a furnizorului - o schimbare notabilă pentru companiile care au insistat istoric să controleze fiecare detaliu al modului în care modelele lor sunt testate.
Deocamdată, pilotul acoperă un model și un set de repere confidențiale. Dar, dacă evaluarea fără contaminare, verificată criptografic, devine din punct de vedere tehnic obișnuit, ar putea schimba ceea ce întreprinderile și autoritățile de reglementare se așteaptă de la fiecare laborator de frontieră – și ar putea face din „încrederea în scorul nostru” o vânzare mai dificilă pe o piață construită din ce în ce mai mult pe afirmații verificabile.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citiți mai multe știri AI →