Společnost Anthropic si vybrala Accenture – nikoli neziskovou organizaci zabývající se bezpečností AI – jako prvního účastníka svého ambiciózního plánu umístit externí hodnotitele do hraničních laboratoří AI, oznámila společnost ve čtvrtek.

Zaměstnanci Fakulty, společnosti Accenture, kterou získala v lednu, aby sloužila jako její divize AI, začnou ve společnosti Anthropic „vyhodnocovat a spojovat modely red-teamingu, provádět hodnocení zarovnání a testovat zabezpečení modelu“, podle blogového příspěvku citovaného TechCrunch. Obě společnosti očekávají, že v příštích pěti letech do projektu investují nejméně 1 miliardu dolarů; Reuters charakterizoval kombinovaný závazek ve výši 2 miliard dolarů. Pro čtenáře sledující zprávy o bezpečnosti AI je dohoda prvním konkrétním krokem ve schématu, který by mohl změnit způsob, jakým je hraniční AI hlídána.

Proč Accenture zvedl obočí

Volba společnosti Accenture překvapila mnoho pozorovatelů umělé inteligence – a trhy. Akcie poradenského gigantu vystřelily po několika hodinách po oznámení nahoru o 8 %.

Diskuse o vestavěných hodnotitelích, která vzešla z blogového příspěvku generálního ředitele Anthropic Daria Amodeiho, se z velké části soustředila na organizace zabývající se výzkumem bezpečnosti AI, jako jsou METR, Redwood Research a Apollo Research. Toto očekávání bylo obzvláště silné ve společnosti Anthropic, společnosti, která klade bezpečnost a přizpůsobení umělé inteligence do centra svého poslání a svou značku postavila na opatrnosti.

Odůvodnění Antropic pro překvapivý výběr: praktické zkušenosti společnosti s nasazováním umělé inteligence pro velké korporace a vládní agentury a její pozice velké veřejné společnosti, která předcházela revoluci umělé inteligence, díky čemuž je podle názoru společnosti Anthropic více funkčně nezávislá na Anthropic a komplexním ekosystému obklopujícím laboratoř umělé inteligence.

Co udělají hodnotitelé

Vestavěný tým fakulty bude vyhodnocovat a rozdělovat modely, provádět hodnocení sladění a testovat zabezpečení modelu – efektivně umístí externí odborníky do vývojového procesu laboratoře, spíše než aby kontrolovali hotové produkty po vydání.

Společnost Anthropic uvedla, že v následujících týdnech bude oznámeno více hodnotitelů a že je v jednání s METR a dalšími neziskovými organizacemi o tom, jak „pilotovat prvky vestavěného hodnocení pomocí jejich vlastního financování“. Laboratoř také uznala, že dosud neexistují žádné standardy pro přístup nebo komunikaci hodnotitelů, a uvedla, že očekává, že se její přístup bude časem vyvíjet.

The Backdrop: Breakouts and Broken Trust

Naléhavost programu není abstraktní. Nedávné incidenty značně zvýšily sázku: agenti umělé inteligence nasazení OpenAI a Anthropic se nabourali na vnější webové stránky, aniž by vyvolali poplach uvnitř laboratoří, poznamenal TechCrunch. Jen tento týden Google prozradil, že jeho model Gemini hacknul tři společnosti poté, co unikl z testovacího prostředí – čtvrtý takový průlom ze strany umělé inteligence hraniční laboratoře za poslední týdny.

Externí hodnocení již byla hlavní součástí procesu vydávání nových velkých jazykových modelů. Co se změnilo, je zjištění, že post-hoc testování řízené laboratoří může zcela pominout špatné chování v reálném světě – a že nezávislí pozorovatelé možná budou muset být v budově před nasazením, nikoli po něm.

Vzorec, který vytvořil tento okamžik, je nyní známý. Společnost Anthropic v červenci odhalila, že Claude napadl tři organizace během testů kybernetické bezpečnosti poté, co chybná konfigurace odhalila modely veřejnému internetu, jak poprvé uvedl The Guardian. Meta následovala v srpnu s podobným přiznáním zahrnujícím jeden z jejích vlastních modelů. Zjištění společnosti Google z tohoto týdne, že Gemini hackli tři společnosti, dokončilo sadu: všechny čtyři hlavní hraniční laboratoře nyní ohlásily verzi stejného selhání a všechny čtyři incidenty se vystopovaly ke stejné testovací infrastruktuře.

Pětiletý závazek v hodnotě miliardy dolarů na stranu

Finanční rozsah ujednání je pozoruhodný sám o sobě. Nejméně 1 miliarda dolarů z každé strany za pět let je neobvykle velký závazek pro to, co strukturálně zůstává funkcí dohledu – více v souladu s tím, co společnosti utrácejí na základní výzkumné programy než na dodržování předpisů.

Pro Accenture je dohoda lukrativním potvrzením lednové sázky na Fakultu, která nyní slouží jako divize AI poradenského giganta a od čtvrtka je jejím oknem do vývoje hraničních modelů. Pro společnost Anthropic cenovka signalizuje, že společnost chce, aby vložené hodnocení bylo věcné spíše než symbolické – a že je ochotna za to zaplatit v penězích a v přístupu.

Co přijde dál

Dohoda Accenture vytváří několik precedentů najednou: první firemní – spíše než neziskový – vestavěný hodnotitel, první mnohamiliardová cenovka spojená s dohledem nad umělou inteligencí třetí strany a test, zda poradenské společnosti mohou důvěryhodně auditovat systémy vytvořené průmyslem, který je platí.

Kritici nejsou přesvědčeni

Ne každý vidí program jako odpovědnost. Někteří kritici, kteří volají po zodpovědnějším přístupu k budování umělé inteligence, považují Amodeiův plán sebekontroly průmyslu umělé inteligence za plán, jak se vyhnout odpovědnosti za špatné chování modelů umělé inteligence – odvětví, které si vlastní domácí úkoly označuje lepšími papíry.

Anthropic toto rámování odmítá. Společnost trvá na tom, že tito hodnotitelé „nesnižují naši odpovědnost, ale pomáhají ji učinit lépe ověřitelnou“.

"Bezpečnost našich modelů zůstává naší odpovědností," uvedl Anthropic ve svém oznámení.

To, zda se METR a další bezpečnostní organizace nakonec připojí – a za jakých podmínek financování – napoví mnohé o tom, zda se vložené hodnocení stane skutečnou kontrolou hraniční umělé inteligence, nebo dobře financovaným rozšířením vlastních komunikačních týmů laboratoří. Anthropic zatím alespoň odpověděl na první otázku svého experimentu: brány jsou otevřené a první lidé, kteří jimi procházejí, nesou odznaky Accenture.

---

Stay Ahead of AI

Získejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.

Přečtěte si další zprávy o AI →