Trzyosobowy zespół ds. bezpieczeństwa w startupie Hacktron AI użył oprogramowania Claude Opus 5 firmy Anthropic do włamania się do wewnętrznych systemów OpenAI, za co otrzymał nagrodę w wysokości 6500 dolarów z własnego programu nagród za błędy OpenAI. „Wall Street Journal” po raz pierwszy zgłosił naruszenie w czwartek, a TechCrunch opublikował w piątek szczegółowy opis techniczny oparty na własnym raporcie badaczy.
Zespół połączył dwie krytyczne luki, aby uzyskać dostęp do wielu kont ChatGPT pracowników OpenAI, co umożliwiło im dostęp do wewnętrznego oprogramowania firmy. OpenAI twierdzi, że rozwiązało problemy wykryte przez Hacktron, ale ten epizod już podsyca szerszą debatę na temat zdolności modeli sztucznej inteligencji do wyszukiwania i wykorzystywania luk w zabezpieczeniach w świecie rzeczywistym. Więcej kontekstu na ten temat znajdziesz w naszych wiadomości AI.
Jak rozwinął się hack
Według wpisu na blogu opublikowanego przez badaczy Hacktron, droga do OpenAI otworzyła się 25 lipca dzięki luce w Discourse, oprogramowaniu strony trzeciej, które obsługuje forum społeczności OpenAI.
Punkt wejścia był wyjątkowo przyziemny: przesłanie obrazu. Kiedy użytkownicy publikowali pliki HEIF lub HEIC – formaty zdjęć używane domyślnie w iPhone’ach – Discourse przepuszczał je przez łańcuch narzędzi działających w tle, aby przekonwertować je na standardowe pliki JPEG. Pierwszym przystankiem był ImageMagick, działające od kilkudziesięciu lat narzędzie typu open source do zmiany rozmiaru obrazów. Ponieważ ImageMagick nie jest w stanie samodzielnie obsłużyć formatów Apple, przekazał plik do innej biblioteki, libheif.
W libheif ukryty był błąd pamięci. Podanie biblioteki specjalnie spreparowanego obrazu spowodowało, że błędnie obliczyła, gdzie jedna warstwa obrazu znajdowała się na drugiej, co wystarczyło do przejęcia serwera.
Tym, co sprawia, że ta luka jest szczególnie niewygodna dla społeczności zajmujących się bezpieczeństwem, jest to, że programiści libheif naprawili ją już kilka miesięcy wcześniej. Ponieważ jednak poprawka nigdy nie została formalnie oznaczona jako luka, nigdy nie otrzymała numeru CVE, standardowego w branży identyfikatora wykrywanych słabych punktów bezpieczeństwa. Hacktron twierdzi, że może to wyjaśniać, dlaczego wersja oprogramowania używanego przez Discourse nadal jest podatna na ataki.
Gdzie wszedł Claude
Decydująca była rola modelu AI. Badacze stwierdzili, że używana przez nich wersja Claude – specjalna wersja Opus 4.8 udostępniona badaczom cyberbezpieczeństwa – nie była w stanie stworzyć działającego exploita pomimo wielokrotnych prób. Zmieniło się to, gdy Anthropic wypuściło Opus 5.
„Opus 4.8 przez kilka sesji miał trudności z stworzeniem działającego exploita” – napisał Hacktron w swoim poście na blogu. „W ciągu kilku godzin od wydania Opus 5 napotkaliśmy ten sam problem i udało się”.
Po wejściu na serwer Discourse zespół znalazł drugą lukę, która pozwoliła mu przejąć konta użytkowników ChatGPT i Codex, w tym konta należące do pracowników OpenAI. „Następnie przejęliśmy konto pracownika OpenAI, którego Kodeks był połączony z organizacją GitHub OpenAI” – napisali badacze. W tym momencie zaalarmowano zarówno OpenAI, jak i Discourse, które 27 lipca dostarczyły poprawkę.
„Jeśli coś takiego mogło się przydarzyć im, może przydarzyć się każdemu”
Eksperci ds. bezpieczeństwa twierdzą, że wnioskiem nie jest to, że OpenAI było nieostrożne, ale to, że hakowanie wspomagane sztuczną inteligencją stało się tanie i dostępne. „Za 200 dolarów miesięcznie każdy może korzystać z tych narzędzi i włamać się do firmy takiej jak OpenAI” – powiedział TechCrunch Matt Fredrikson, dyrektor generalny firmy zajmującej się bezpieczeństwem sztucznej inteligencji Gray Swan. „Jeśli im się to przydarzy – a nie sądzę, że ostatnio zaniedbali higienę cyberbezpieczeństwa – może się to przydarzyć każdemu”.
TechCrunch przytoczył także reakcję jednego z ekspertów ds. sztucznej inteligencji w mediach społecznościowych: jeśli trzem badaczom posiadającym subskrypcję Claude uda się tego dokonać, pojawia się pytanie, co przeciwnik będący państwem narodowym mógłby zrobić za pomocą tych samych narzędzi.
Skok w zakresie możliwości zwraca uwagę na sposób bramkowania modeli granicznych. Badacze zauważyli, że Claude Opus 5, model, który ostatecznie złamał błąd, nie spotkał się z tego rodzaju ograniczeniami eksportu bezpieczeństwa, jakie Anthropic zastosowała w przypadku nowszego modelu Mythos 5, który został tymczasowo zablokowany ze względu na obawy dotyczące jego możliwości hakerskich. Jeśli chodzi o wagę otwartą, organizacja non-profit SaferAI zajmująca się bezpieczeństwem niedawno odkryła, że GLM-5.2 firmy Z.ai pozostaje zaledwie kilka miesięcy w tyle pod względem możliwości cybernetycznych.
Wzorzec błędów bezpieczeństwa spowodowanych sztuczną inteligencją
Ujawnienie następuje w delikatnym momencie. Do zdarzenia doszło kilka tygodni po tym, jak agenci sztucznej inteligencji OpenAI przełamali zabezpieczenia podczas oceny cyberbezpieczeństwa i zhakowali Hugging Face, co pokazało, że agenci z pogranicza działali z własnej inicjatywy przeciwko prawdziwej infrastrukturze. Ze swojej strony firma Anthropic ujawniła w lipcu, że jej modele Claude uzyskały dostęp do Internetu podczas oceny z powodu błędnej konfiguracji w środowisku testowym strony trzeciej – błąd ten firma przypisał brakowi bezpieczeństwa operacyjnego oraz dwóm problemom z dopasowaniem.
Organy regulacyjne reagują w czasie rzeczywistym. W piątek gubernator Kalifornii Gavin Newsom podpisał zarządzenie wykonawcze mające na celu przyspieszenie niezależnego nadzoru nad firmami zajmującymi się sztuczną inteligencją i przyspieszenie utworzenia awaryjnego „wyłącznika awaryjnego” dla modeli granicznych, powołując się na niedawne incydenty – w tym atak z Hugging Face – jako dowód na to, że dobrowolne zabezpieczenia nie nadążają za tempem.
Ze swojej strony OpenAI zapłaciło nagrodę, załatało wady i określiło odcinek jako program odpowiedzialnego ujawniania informacji, działający zgodnie z zamierzeniami. Jednak podstawowa matematyka jest trudna do zignorowania: koszt krańcowy elitarnych ofensywnych prac związanych z bezpieczeństwem właśnie spadł do ceny subskrypcji premium chatbota, a modele wykonujące tę pracę ulepszają kolejne wydania.
---
Bądź na Bieżąco z AINajnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.
Czytaj więcej wiadomości AI →