27 sierpnia firma Google DeepMind ogłosiła pierwszą na świecie podwójnie ślepą ocenę zastrzeżonego, pionierskiego modelu sztucznej inteligencji — konfiguracji kryptograficznej zaprojektowanej w celu umożliwienia zewnętrznym ekspertom testowania modeli Google w warunkach skrajnych tak, aby żadna ze stron nie poznała sekretów drugiej.
Pilot, opisany w poście na blogu DeepMind przez Williama Isaaca, Sola Messinga i Kristiana Luma, przeprowadza model Gemini Flash Lite w poufnych testach porównawczych w kryptograficznie bezpiecznym środowisku. Google DeepMind współpracuje w tym zakresie z Singapurskim Instytutem Bezpieczeństwa AI, OpenMined, AVERI i MLCommons i opublikował raport techniczny opisujący metodologię.
Oświadczenie odnosi się do jednej z najbardziej utrzymujących się słabości oceny sztucznej inteligencji: zanieczyszczenia benchmarków. Dla czytelników śledzących wiadomości z badań nad sztuczną inteligencją stanowi to jedną z bardziej konkretnych prób zapewnienia weryfikowalnej czystości testów modeli stron trzecich.
Wyjaśnienie problemu zanieczyszczenia
DeepMind rozpoczyna swoje ogłoszenie analogią do zajęć. Jeśli student przypadkowo zobaczy wcześniej pytania egzaminacyjne, doskonały wynik nic nie znaczy. Ta sama logika ma zastosowanie do modeli granicznych: jeśli model został już poddany pytaniom w benchmarku – poprzez dane szkoleniowe, zbiory ewaluacyjne, które wyciekły lub wcześniejszą optymalizację – uzyskane wyniki mogą znacznie zawyżać rzeczywiste możliwości.
To nie jest hipotetyczna obawa. Zanieczyszczenie testów porównawczych sprawdza się w tej dziedzinie od lat, a badacze wielokrotnie wykazali, że popularne zestawy testowe przedostają się do korpusów szkoleniowych działających w skali internetowej oraz że modele można po cichu dostroić, aby dobrze radziły sobie ze znanymi ocenami. Kiedy rządy i przedsiębiorstwa korzystają z wyników testów porównawczych przy podejmowaniu decyzji dotyczących zamówień i polityki, zawyżone liczby niosą ze sobą realne konsekwencje.
W miarę zwiększania się możliwości modeli, twierdzi DeepMind, stawka jest najwyższa w przypadku wrażliwych kategorii oceny – wśród nich przede wszystkim testów cyberbezpieczeństwa i ocen rządowych – gdzie zanieczyszczony wynik jest nie tylko mylący, ale także potencjalnie niebezpieczny.
Stary kompromis: Twoje podpowiedzi albo nasze wagi
Historycznie rzecz biorąc, oceny zewnętrzne o wysokiej stawce wymuszały niewygodny wybór. Albo ewaluator przekazał swoje podpowiedzi dostawcy modelu – ryzykując, że dostawca zobaczy z wyprzedzeniem pytania testowe – albo dostawca przekazał ewaluatorowi wagi modeli – ryzykując utratę swojej najcenniejszej własności intelektualnej.
Protokoły zerowego logowania i rygorystyczne zabezpieczenia umowne od dawna zapewniają poufność podpowiedzi testów zewnętrznych, pisze DeepMind, ale są to obietnice egzekwowane przez politykę, a nie matematykę. Podwójnie ślepe oceny zastępują to zaufanie dowodem kryptograficznym.
Jak działa skrzynka kryptograficzna
Pilot wykorzystuje Confidential Space, część portfolio Confidential Computing firmy Google Cloud, do stworzenia czegoś, co DeepMind określa jako „pudełko” kryptograficzne. Wewnątrz obie połowy oceny – poufny benchmark i zastrzeżony model – pozostają prywatne dla ich odpowiednich właścicieli, a środowisko kryptograficznie weryfikuje ten fakt.
Wynik jest rzeczywiście podwójnie ślepy: zewnętrzny oceniający nie może zobaczyć wag modelu Gemini, a Google nie widzi monitów testowych oceniającego. Żadna ze stron nie musi ufać obietnicom drugiej, ponieważ sama architektura w zasadzie uniemożliwia wyciek. Co najważniejsze, konfiguracja zapobiega także późniejszemu wykorzystaniu danych ewaluacyjnych do optymalizacji wydajności modelu przed przyszłymi testami, zamykając w ten sposób pętlę, przez którą zazwyczaj ponownie wkradają się zanieczyszczenia.
Dlaczego ma to znaczenie w przypadku nadzoru nad sztuczną inteligencją
Szersze znaczenie wykracza poza jeden model Gemini. Niezależne organizacje – instytuty bezpieczeństwa sztucznej inteligencji, laboratoria akademickie, organy regulacyjne – od lat walczą o rygorystyczną ocenę modeli zamkniętych granic właśnie dlatego, że dostawcy nie mogą przekazywać wag, a oceniający nie przekazują wzorców. Każdy większy instytut zajmujący się bezpieczeństwem sztucznej inteligencji zmagał się z wersjami tego problemu podczas podpisywania umów oceniających z laboratoriami pionierskimi.
Jeśli projekt pilotażowy wytrzyma, oferuje szablon, zgodnie z którym suwerenność danych i własność intelektualna przetrwają kontakt z niezależną kontrolą. DeepMind wyraża nadzieję, że pilotaż „wyznaczy nową granicę w zakresie nadzoru nad modelami, pomagając szerszej branży w budowaniu bezpieczniejszych, bardziej niezawodnych i cieszących się powszechnym zaufaniem systemów sztucznej inteligencji”.
Lista partnerów jest sama w sobie godna uwagi. Singapurski Instytut Bezpieczeństwa AI jest jednym z najaktywniejszych krajowych organów oceniających; OpenMined tworzy narzędzia obliczeniowe chroniące prywatność; MLCommons standaryzuje benchmarking branżowy. AVERI tworzy konsorcjum składające się z organów rządowych, środowisk akademickich i przemysłowych zajmujących się normalizacją – czyli okręgów wyborczych, które musiałyby przyjąć podwójnie ślepą ocenę, aby stała się ona normą, a nie demonstracją.
Wyścig zbrojeń o uczciwość oceny
Oświadczenie pojawia się w kontekście rosnącej analizy tego, jak firmy zajmujące się sztuczną inteligencją oceniają siebie. Laboratoria spotykają się z rosnącymi oskarżeniami o wybieranie korzystnych testów porównawczych, a niezależne rankingi zyskały wpływ właśnie dlatego, że znajdują się poza kontrolą dostawców. Podwójnie ślepa ocena rozszerza tę niezależność wewnątrz infrastruktury dostawcy — jest to zauważalna zmiana w przypadku firm, które w przeszłości kładły nacisk na kontrolowanie każdego szczegółu testowania swoich modeli.
Na razie pilotaż obejmuje jeden model i zestaw poufnych testów porównawczych. Jeśli jednak zweryfikowana kryptograficznie, wolna od zanieczyszczeń ocena stanie się rutyną z technicznego punktu widzenia, może zmienić oczekiwania przedsiębiorstw i organów regulacyjnych od każdego laboratorium granicznego – i sprawić, że „zaufaj naszemu wynikowi” będzie trudniej sprzedać na rynku w coraz większym stopniu opartym na weryfikowalnych twierdzeniach.
---
Wyprzedź sztuczną inteligencjęOtrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.
Przeczytaj więcej aktualności o sztucznej inteligencji →