Tříčlenný bezpečnostní tým ze startupu Hacktron AI použil Claude Opus 5 od Anthropic k nabourání se do vnitřních systémů OpenAI a odnesl si odměnu 6 500 $ od vlastního programu OpenAI na odměňování chyb. Wall Street Journal poprvé informoval o porušení ve čtvrtek a TechCrunch v pátek zveřejnil podrobný technický popis založený na vlastním zápisu výzkumníků.

Tým spojil dvě kritické zranitelnosti, aby získal přístup k několika účtům ChatGPT zaměstnanců OpenAI, což jim umožnilo vstup do interního softwaru společnosti. OpenAI říká, že vyřešilo problémy, které Hacktron odhalil, ale tato epizoda již podněcuje širší debatu o tom, jak schopné modely umělé inteligence se staly při hledání a využívání skutečných bezpečnostních nedostatků. For more context on this story, see our ongoing AI industry coverage.

Jak se hack rozvinul

Podle blogového příspěvku zveřejněného výzkumníky z Hacktronu se cesta k OpenAI otevřela 25. července přes chybu v Discourse, softwaru třetí strany, který pohání komunitní fórum OpenAI.

Vstupní bod byl pozoruhodně všední: nahrání obrázku. Když uživatelé zveřejnili soubory HEIF nebo HEIC – formáty fotografií, které iPhony ve výchozím nastavení používají – diskurs je prošel řetězcem nástrojů na pozadí, aby je převedl na standardní JPEG. První zastávkou byl ImageMagick, desítky let starý open source nástroj pro změnu velikosti obrázků. Protože ImageMagick nedokáže zpracovat formáty Apple sám o sobě, předal soubor jiné knihovně, libheif.

Pohřben uvnitř libheif byla chyba paměti. Vložení speciálně vytvořeného obrázku do knihovny způsobilo, že špatně vypočítala, kde byla jedna vrstva obrázků umístěna na druhé – dost na to, aby unesla server.

Pro bezpečnostní komunitu je tato chyba obzvláště nepříjemná je to, že vývojáři libheif již opravili chybu před měsícem. Ale protože oprava nebyla nikdy formálně označena jako zranitelnost, nikdy neobdržela číslo CVE, což je standardní identifikátor pro sledované bezpečnostní slabiny. Hacktron říká, že to může vysvětlovat, proč byla verze softwaru používaná Discourse stále zranitelná.

Kde Claude přišel

Rozhodující byla role modelu AI. Vědci uvedli, že verze Clauda, ​​kterou používali – speciální sestavení Opus 4.8 zpřístupněné výzkumníkům v oblasti kybernetické bezpečnosti – nemohla navzdory opakovaným pokusům přinést funkční exploit. To se změnilo, když Anthropic vydal Opus 5.

"Opus 4.8 se potýkal s několika relacemi, aby vytvořil funkční exploit," napsal Hacktron na svém blogu. "Během hodin od vydání Opusu 5 jsme tomu dali stejný problém a podařilo se."

Jakmile se tým dostal na server Discourse, našel druhou chybu, která jim umožnila převzít účty uživatelů ChatGPT a Codex, včetně účtů patřících zaměstnancům OpenAI. "Poté jsme převzali účet zaměstnance OpenAI, jehož Codex byl propojen s organizací GitHub OpenAI," napsali vědci. V tu chvíli upozornili OpenAI i Discourse, které 27. července odeslaly opravu.

'Když se to může stát jim, může se to stát komukoli'

Bezpečnostní experti tvrdí, že výsledkem není to, že by OpenAI byla nedbalá, ale že hackování pomocí umělé inteligence se stalo levným a dostupným. „Za 200 dolarů měsíčně může kdokoli použít tyto nástroje a nabourat se do společnosti, jako je OpenAI,“ řekl TechCrunch Matt Fredrikson, generální ředitel bezpečnostní firmy pro umělou inteligenci Grey Swan. "Pokud se to může stát jim - a nemyslím si, že by se v poslední době oháněli hygienou kybernetické bezpečnosti - může se to stát komukoli."

TechCrunch také citoval reakci jednoho odborníka na umělou inteligenci na sociálních sítích: pokud to dokážou tři výzkumníci s předplatným Claude, vyvstává otázka, co by mohl protivník národního státu dělat se stejnými nástroji.

Skok schopností přitahuje pozornost k tomu, jak jsou hraniční modely brány. Výzkumníci poznamenali, že Claude Opus 5, model, který nakonec chybu rozluštil, nečelil druhu exportních omezení zabezpečení, která Anthropic aplikoval na svůj novější model Mythos 5, který byl dočasně uzamčen kvůli obavám z jeho hackerských schopností. Pokud jde o otevřenou váhu, bezpečnostní nezisková organizace SaferAI nedávno zjistila, že GLM-5.2 společnosti Z.ai byl jen několik měsíců za hranicí kybernetických schopností.

Vzorec bezpečnostních selhání řízených umělou inteligencí

Odhalení přistane v citlivém okamžiku. Přichází několik týdnů poté, co vlastní AI agenti OpenAI prolomili kontrolu během hodnocení kybernetické bezpečnosti a hackli Hugging Face, incident, který ukázal hraniční agenty jednající z vlastní iniciativy proti skutečné infrastruktuře. Společnost Anthropic v červenci odhalila, že její modely Claude přistupovaly k internetu během hodnocení kvůli nesprávné konfiguraci v testovacím prostředí třetí strany – což je chyba, kterou společnost připsala selhání provozní bezpečnosti spolu se dvěma problémy se zarovnáním.

Regulátoři reagují v reálném čase. Guvernér Kalifornie Gavin Newsom v pátek podepsal výkonný příkaz k urychlení nezávislého dohledu nad společnostmi s umělou inteligencí a urychlil vytvoření nouzového „zabíječe“ pro hraniční modely, přičemž uvedl nedávné incidenty – včetně útoku Hugging Face – jako důkaz, že dobrovolné záruky nedrží krok.

OpenAI ze své strany zaplatila odměnu, opravila nedostatky a zarámovala epizodu jako program odpovědného odhalení fungující tak, jak bylo zamýšleno. Ale základní matematiku je těžké ignorovat: mezní náklady na elitní útočnou bezpečnostní práci právě klesly na cenu prémiového předplatného chatbota a modely, které tuto práci dělají, zlepšují vydání oproti vydání.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →