Společnost Anthropic zveřejnila výzkum, který ukazuje, že automatizované systémy umělé inteligence dokážou spolehlivě opravit selhání zarovnání modelu, což by mohlo změnit způsob, jakým se provádí bezpečnostní práce v centru průmyslu umělé inteligence. Dokument nazvaný „Automatizovaní výzkumníci mohou spolehlivě zmírnit selhání zarovnání“ byl vydán v pátek a podrobně popsán TechCrunch.

Výzkum pochází z programu stipendistů Anthropic a vedl jej Chen Yueh-Han. Jeho ústřední tvrzení je zarážející: když byly automatizované výzkumné systémy společnosti nasměrovány na deset měřítek měřících specifické nesprávné chování, zlepšily výkon u každého z nich – aniž by došlo ke snížení celkových schopností modelu. Pro obor, který se snažil udržet bezpečnost práce na úrovni modelového měřítka, je to pozoruhodný výsledek. For more context on this story, see our ongoing AI trends.

Příběh přistál během rušného úseku bezpečnostního pokrytí AI. Následuje léto, kdy v titulcích dominovalo chování agentů, od interní zprávy OpenAI o agentech hackujících odměny až po výzvy k nezávislému vyšetřování porušení Hugging Face. Nový dokument Anthropic přistupuje k problému z opačného směru: místo toho, aby se ptal, jak se agenti chovají špatně, ptá se, zda lze jiným agentům důvěřovat, že je opraví.

Co vlastně noviny hlásí

Systém popsaný v článku se nazývá Automated Alignment Researcher, neboli AAR. Spíše než nahrazování výzkumného procesu, AAR z velké části replikuje: každý automatizovaný systém prohledává dostupnou literaturu, navrhuje metodu a trénuje model pomocí této metody po dobu zhruba 30 minut. Proces se poté opakuje v několika iteracích.

Mechanismus výběru je jednoduchý. Metody, které posunou benchmark, jsou zachovány; metody, které ne, jsou vyřazeny. Tato smyčka umožňuje systému pracovat rychle a v měřítku, kterému se žádný lidský tým nevyrovná, paralelně testuje mnoho směrů výzkumu a udržuje pouze to, co funguje.

Podle listu byly výsledky v celém rozsahu konzistentní. Ve všech deseti srovnávacích testech pokrývajících specifická nesprávná chování automatizované systémy produkovaly měřitelná zlepšení, aniž by utrpěly celkový výkon modelu – což je obvyklý kompromis, který ztěžuje práci se zarovnáním.

"Celkově tyto výsledky poskytují časný důkaz, že automatizované zarovnání po tréninku by se mohlo stát v blízké budoucnosti praktickým," uvádí článek.

Porazit lidi za 1/37 ceny

Nejcitovanější pasáže v dokumentu jsou ty, kde srovnává AAR přímo s jeho lidskými protějšky. Společnost Antropic srovnání nezajistila.

"Nejlepší metoda AAR překonává to, co navrhují zkušení lidé, v průměru do šesti hodin," píše se v novinách. Ostře dodává, že "lidmi řízené výzkumné směry nevedou k lepšímu výkonu."

Ekonomika je stejně tupá. "AAR stojí zhruba 4 dolary za hodinu v odvození API oproti 150 dolarům za hodinu, které platíme našim lidským výzkumníkům," píší autoři. To je téměř 40násobný rozdíl v nákladech a vysvětluje to, proč laboratoře berou automatizovaný výzkum vážně jako víc než jen kuriozitu.

Proč je rozdíl v nákladech důležitý

Výzkum zarovnání je nákladný způsobem, který lze snadno podcenit. Každá intervence kandidáta musí být implementována, vyškolena a vyhodnocena podle měřítek a většina kandidátů selže. Pokud systém dokáže spouštět tuto vyhledávací smyčku nepřetržitě za cenu volání API, blíží se mezní náklady na pokus o další nápad nule. Omezení se přesouvá z počtu zaměstnanců na výpočetní.

Omezení Antropická sama o sobě označena

Článek otevřeně hovoří o tom, co výsledek neprokazuje. Automatizovaný systém funguje pouze do té míry, pokud benchmarky skutečně odrážejí cíle sladění, na kterých záleží – a vytváření a udržování benchmarků, které zachycují špatné chování v reálném světě, zůstává v této oblasti otevřeným problémem.

Existuje také závislost, kterou lze snadno přehlédnout: automatizovaní výzkumníci čerpají z existující literatury metod. Udržování a rozšiřování této literatury je samo o sobě významnou prací a systém, který pouze remixuje známé techniky, může narazit na strop, který lidská kreativita nenarazí.

Na těchto upozorněních záleží, protože na nich závisí dlouhodobý význam výzkumu. Pokud benchmarky měří špatné věci, AAR může optimalizovat cestu k silným číslům, zatímco základní rizika zůstanou nedotčena. Rámování Anthropic – „první důkaz“, nikoli řešení – odráží tuto nejistotu.

Krok k rekurzivnímu sebezdokonalování

Dokument také podněcuje rozsáhlejší debatu o rekurzivním sebezdokonalování, myšlence, že systémy umělé inteligence by nakonec mohly zlepšit samotné tréninkové procesy, které je produkují. Školení modelů umělé inteligence s jinými modely umělé inteligence se stalo oblíbeným cílem hraničních laboratoří a výsledkem společnosti Anthropic je časný, konkrétní pohled na to, jak to vypadá v úzké oblasti.

Logika je přímočará. Pokud mohou modely spolehlivě zlepšit svůj vlastní trénink seřízení, stejný stroj by mohl být hodnověrně nasměrován na tréninkové postupy v širším měřítku – včetně práce na schopnostech. TechCrunch si všímá důsledků, že výzkumníci lidské umělé inteligence by se nakonec mohli stát méně ústředním bodem procesu, což je možnost, se kterou se papír sám zapojí, než aby se jí vyhýbal.

Na co se podívat dále

Zda tento výsledek zobecňuje, určí tři otázky. Zaprvé, zda se tento přístup drží mimo deset měřítek testovaných společností Anthropic, na režimech selhání, které jsou komplikovanější a hůře definované. Za druhé, zda lze problém s údržbou benchmarků vyřešit dostatečně rychle, aby byl automatizovaný výzkum poctivý. Za třetí, zda jiné laboratoře publikují srovnatelné výsledky, které by změnily jediný článek směrem k oboru.

Prozatím je zjištění úzké, ale reálné: ve specifických úlohách zarovnání testovaných na Antropii překonali automatizovaní výzkumníci zkušené lidi, rychleji a mnohem levněji. Bezpečnostní stránka průmyslu umělé inteligence může být prvním místem, kde výzkumníci umělé inteligence – nikoli lidé – dělají většinu práce.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →