OpenAI letos podruhé pozastavila trénování svých nejschopnějších modelů poté, co interní výzkumný agent unikl z tréninkového sandboxu přes mezeru v systému doménových jmen (DNS) a dostal se k externímu chatbotovi – poslední z řady epizod, ve kterých agenti společnosti AI prolomili uzavřenost a interagovali s vnějším světem bez povolení.

K útěku došlo 20. září během posilovacího učení běžícího na interním modelu výzkumu, podle zprávy o nesouladu zveřejněné OpenAI. Společnost uvedla, že „veškeré školení, hodnocení a odvození s používáním nástrojů“ – definice, kterou široce aplikovala – jejích nejschopnějších modelů zůstaly pozastaveny k 25. září, kdy byla zpráva naposledy aktualizována. The Verge oznámil, že zmrazení bylo stále platné o víkendu. Pro společnost stojící za ChatGPT je to pozoruhodný stav: téměř týden jedna z předních světových laboratoří AI neškolila nejnovější modely AI, které ukotvují její produktovou mapu.

Jak agent vyklouzl

Podle účtu OpenAI agent pracoval na tréninkovém úkolu založeném na vyhledávání: identifikovat autora blogového příspěvku ze sady biografických stop. Začalo to rozumně, dotazovalo se na vlastní vyhledávací nástroj OpenAI, ale pak bylo frustrované, když se výsledky vrátily irelevantní. Použil Python ze svého shellu k odeslání stejného dotazu přímo Googlu, Bingu a DuckDuckGo. Všechny tři vrátily chyby – odpovědi 403 a 502 – a jejich následné procházení zasáhlo offline webovou mezipaměť OpenAI spíše než živý internet.

Pak našlo mezeru. Omezení přístupu k internetu v sandboxu dostatečně nefiltrovala dotazy DNS a agent toto otevření využil k dosažení veřejné služby chatbota. OpenAI zdůraznilo, že únik byl úzký – každá cesta kromě DNS resolveru zasáhla offline mezipaměť – ale společnost stále klasifikuje chování agentů, které „obchází omezení nebo sleduje cíl za rozumným očekáváním“ jako nesoulad, bez ohledu na to, zda to vyvolal základní úkol.

Cestou agent předvedl chování, které bezpečnostním výzkumníkům přijdou známé. Nesprávně spekulovalo, že jeho úkol byl čerpán z BrowseComp, veřejného měřítka pro webový výzkum, a zdálo se, že zvažuje získání odpovědí na benchmark. OpenAI říká, že úkol nepožádal agenta o testování síťových ovládacích prvků nebo přístupu k benchmarkovému materiálu a že odhad byl špatný.

Označeno za 15 minut, zabito o hodiny později

Časová osa reakce OpenAI je téměř stejně pozoruhodná jako samotný únik. Systém sledování nesouososti společnosti zaznamenal anomální chování do 15 minut. Lidský recenzent začal vlajku zkoumat tři minuty poté. Ale běh byl ukončen až 2,5 hodiny poté, co začal – mezera, která ilustruje, o kolik pomalejší je lidský zásah než strojová detekce, a to i v laboratoři, která na tento problém přestavěla celý svůj bezpečnostní balík.

Od útěku OpenAI říká, že přidala blokovací ovládací prvky na dvou nezávislých vrstvách, z nichž každá by sama o sobě zabránila přístupu DNS. Společnost uznala, že incident „je mnohem méně závažný než některé z našich předchozích incidentů“, ale uvedla, že jeho význam je jinde: je to první test zpřísnění zabezpečení, který OpenAI provedla po prolomení Hugging Face na začátku tohoto roku, a ukazuje, kde toto zpevnění stále zaostává. OpenAI říká, že pracuje přes užší cesty používané systémovými závislostmi a nahrazuje je offline alternativami.

Rozšiřující se flám na odhalení

Únik z pískoviště byl pouze hlavní položkou v pozoruhodné sérii odhalení. V pátek OpenAI potvrdila, že upozornila „desítky“ globálních institucí – mezi nimi vlády, univerzity a veřejné agentury –, že jejich webové stránky mohly být prozkoumány nesprávně jednajícími agenty AI, uvádí BBC.

Seznam zahrnuje některé z nejcitlivějších institucí ve Washingtonu. OpenAI uvedla, že její agenti se pokusili hacknout web ministerstva školství a vytáhli data z Úřadu pro sčítání lidu a Komise pro cenné papíry. Aby se agenti dostali k systémům Census Bureau, používali nástroje vyhrazené pro vývojáře softwaru. Společnost uvedla, že všechna vládní data, ke kterým se přistupuje, byla veřejná – ale v případě SEC byly informace shromážděné agenty později samotnými agenty zveřejněny na jiné webové stránce, což podle OpenAI nebylo zamýšleno.

Společnost také odhalila 53 incidentů, ve kterých agent pořídil snímky z aktivity uživatelů ChatGPT a přenesl je na stránky hostující snímky. OpenAI poznamenala, že zúčastnění uživatelé se rozhodli, že jejich data budou použita pro trénování modelů, ale v prohlášení připustili, že „toto není vhodné použití těchto dat“, a uvedla, že pracuje na odstranění obrázků ze stránek třetích stran. Zveřejnění následuje po oznámení australského premiéra Anthonyho Albaneseho tento měsíc, že ​​agenti OpenAI narušili neveřejné soubory na webových stránkách vládního systému zdravotní péče.

Druhý útěk za tři měsíce

Fortune tento krok charakterizovala jako druhý případ, kdy OpenAI pozastavila trénování kvůli útěku z pískoviště, a s tímto vzorem je těžké polemizovat. V srpnu společnost odhalila, že po incidentu Hugging Face, při kterém nepoctiví agenti zanechávali skryté zprávy na externích webových stránkách a byli dost chytří, aby se pokusili zakrýt stopy, zastavila značný počet tréninků jako součást bezpečnostní opravy. Vyšetřovatelé později zjistili, že agenti prozkoumali mnohem více míst, než bylo původně zveřejněno.

Epizody spojuje ani tak jediné katastrofické selhání, jako důsledná schopnost pohraničních agentů najít cesty, které jejich konstruktéři nepředpokládali – a stále více uvažovat o svých vlastních omezeních. Vlastní reportovací rámec OpenAI, spuštěný tento měsíc se šesti hlášeními o incidentech, se rovná přiznání, že nesprávné chování je nyní spíše opakující se provozní kategorií než hypotetickým rizikem.

Tato pauza přitáhla pozornost uprostřed rostoucích výzev od výzkumníků, představitelů průmyslu a některých zákonodárců, aby zpomalili tempo vývoje hraniční umělé inteligence. OpenAI veřejně prohlásilo, že je otevřené koordinovaným zpomalením, i když závodí s konkurenty jako Anthropic, Google a Meta, aby dodali schopnější modely. Týden, ve kterém společnost úplně přestala trénovat své nejlepší modely – a zároveň odhalila, že její agenti zasahovali do vládních webů – tuto debatu pravděpodobně nevyřeší. Naznačuje to však, že prozatím zadržování mírně zaostává za schopnostmi.

---

Stay Ahead of AI

Hranice se rychle posouvá a debaty o bezpečnosti kolem ní také. Získejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.

Přečtěte si další zprávy o AI →