Google DeepMind 27. srpna oznámil to, co nazývá první dvojitě slepé vyhodnocení proprietárního modelu umělé inteligence na hraniční úrovni na světě – kryptografického nastavení navrženého tak, aby umožnilo externím odborníkům stresovat modely Google, aniž by kterákoli strana viděla tajemství druhé strany.
Pilot, popsaný v příspěvku na blogu DeepMind od Williama Isaaca, Sola Messinga a Kristiana Luma, spouští model Gemini Flash Lite prostřednictvím důvěrných benchmarků v kryptograficky zabezpečeném prostředí. Google DeepMind na tomto úsilí spolupracuje se Singapurským institutem pro bezpečnost AI, OpenMined, AVERI a MLCommons a zveřejnil technickou zprávu popisující metodologii.
Oznámení řeší jednu z nejtrvalejších slabin v hodnocení AI: kontaminaci benchmarkem. Pro čtenáře sledující zprávy z výzkumu AI to představuje jeden z konkrétnějších pokusů o to, aby testování modelů třetích stran bylo prokazatelně čisté.
Problém kontaminace, vysvětleno
DeepMind otevírá své oznámení analogií ve třídě. Pokud student náhodou uvidí otázky ke zkoušce předem, perfektní skóre nic neznamená. Stejná logika platí pro hraniční modely: pokud byl model již vystaven otázkám v benchmarku – prostřednictvím trénovacích dat, uniklých hodnotových sad nebo předchozí optimalizace – výsledné skóre může masivně nadhodnocovat skutečné schopnosti.
To není hypotetická obava. Benchmark kontaminace pronásleduje toto pole léta a výzkumníci opakovaně ukazují, že oblíbené testovací sady pronikají do webových tréninkových korpusů a že modely lze v tichosti vyladit tak, aby dobře fungovaly ve známých hodnoceních. Když vlády a podniky používají srovnávací skóre k rozhodování o nákupu a politice, nafouknutá čísla mají skutečné důsledky.
Jak se modely stávají schopnějšími, tvrdí DeepMind, sázky jsou nejvyšší u citlivých hodnotících kategorií – mezi nimi testování kybernetické bezpečnosti a vládní hodnocení – kde kontaminované skóre není jen zavádějící, ale potenciálně nebezpečné.
Starý kompromis: Vaše výzvy nebo naše váhy
Historicky si vysoké externí hodnocení vynutilo nepohodlnou volbu. Buď hodnotitel předal své testovací výzvy poskytovateli modelu – riskoval, že poskytovatel uvidí testovací otázky předem – nebo poskytovatel předal modelové váhy hodnotiteli – riskoval ztrátu svého nejcennějšího duševního vlastnictví.
Protokoly nulového protokolování a přísné smluvní záruky dlouho udržovaly externí testovací výzvy v tajnosti, píše DeepMind, ale to jsou sliby vynucené spíše politikou než matematikou. Dvojitě slepá hodnocení nahrazují tuto důvěru kryptografickým důkazem.
Jak funguje kryptografický box
Pilot využívá Confidential Space, součást portfolia Confidential Computing Google Cloud, k vytvoření toho, co DeepMind popisuje jako kryptografickou „krabičku“. Uvnitř zůstávají obě poloviny hodnocení – důvěrný benchmark a proprietární model – soukromé pro své příslušné vlastníky a prostředí tuto skutečnost kryptograficky ověřuje.
Výsledek je skutečně dvojitě slepý: externí hodnotitel nevidí váhy modelu Gemini a Google nevidí testovací výzvy hodnotitele. Ani jedna ze stran nemusí věřit slibům té druhé, protože samotná architektura únik v zásadě znemožňuje. Důležité je, že nastavení také zabraňuje pozdějšímu použití vyhodnocovacích dat k optimalizaci výkonu modelu před budoucím testováním – uzavírá smyčku, kterou se kontaminace obvykle vkrádá zpět.
Proč je důležité pro dohled nad umělou inteligencí
Širší význam přesahuje jeden model Gemini. Nezávislé organizace – bezpečnostní instituty umělé inteligence, akademické laboratoře, regulační orgány – se léta potýkaly s přísným hodnocením uzavřených hraničních modelů právě proto, že poskytovatelé nemohou předávat váhy a hodnotitelé nepředávají měřítka. Každý velký bezpečnostní institut AI se potýkal s verzemi tohoto problému při podepisování dohod o hodnocení s hraničními laboratořemi.
Pokud pilot obstojí, nabídne šablonu, pod kterou suverenita dat a duševní vlastnictví přežijí kontakt s nezávislou kontrolou. DeepMind říká, že doufá, že pilotní projekt „stanoví novou hranici pro dohled nad modelem a pomůže širšímu odvětví vybudovat bezpečnější, spolehlivější a široce důvěryhodné systémy umělé inteligence“.
Seznam partnerů je pozoruhodný sám o sobě. Singapurský institut pro bezpečnost AI je jedním z nejaktivnějších národních hodnotících orgánů; OpenMined vytváří výpočetní nástroje chránící soukromí; MLCommons standardizuje průmyslový benchmarking. AVERI završuje konsorcium zahrnující vládní, akademickou sféru a průmyslové normalizační orgány – volební obvody, které by musely přijmout dvojitě zaslepené hodnocení, aby se staly normou spíše než demonstrací.
Závod ve zbrojení o integritu hodnocení
Oznámení přistává uprostřed rostoucího zkoumání toho, jak se společnosti AI hodnotí. Laboratoře čelí rostoucím obviněním z výběru příznivých benchmarků a nezávislé žebříčky se staly vlivnými právě proto, že jsou mimo kontrolu dodavatelů. Dvojité slepé hodnocení rozšiřuje tento pohyb nezávislosti uvnitř vlastní infrastruktury dodavatele – významný posun pro společnosti, které historicky trvaly na kontrole každého detailu toho, jak jsou jejich modely testovány.
Pilotní projekt zatím pokrývá jeden model a sadu důvěrných benchmarků. Pokud se však kryptograficky ověřené hodnocení bez kontaminace stane technicky rutinou, mohlo by to změnit to, co podniky a regulační orgány očekávají od každé hraniční laboratoře – a učinit „důvěřovat našemu skóre“ hůře prodejným na trhu, který je stále více postaven na ověřitelných tvrzeních.
---
Stay Ahead of AIZískejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.
Přečtěte si další zprávy o AI →