Nowy test porównawczy firmy Semgrep zajmującej się bezpieczeństwem aplikacji przyniósł nieoczekiwany wynik: model o otwartej wadze chińskiej firmy Zhipu AI przewyższył Claude firmy Anthropic w znajdowaniu rzeczywistych luk w zabezpieczeniach oprogramowania. Odkrycie to podsyca debatę na temat tego, czy najzdolniejsza sztuczna inteligencja jest koniecznie najdroższa, czy też najbardziej ograniczona.
Ponieważ potężny model Mythos firmy Anthropic jest objęty zakazem eksportu w USA, zespoły ds. bezpieczeństwa poszukujące dostępnej alternatywy zwracają się w stronę opcji o otwartej wadze, takich jak GLM 5.2, aby uzyskać najnowsze informacje z branży sztucznej inteligencji. Test Semgrepa, opublikowany 22 czerwca, sugeruje, że polowanie może opłacić się wcześniej, niż oczekiwano.
Co przetestował Semgrep
Firma Semgrep oceniła gamę modeli otwartych i frontierowych w swoim wewnętrznym benchmarku wykrywania IDOR. IDOR — niebezpieczne odniesienia do obiektów bezpośrednich — to błędy kontroli dostępu, które pozwalają jednemu użytkownikowi uzyskać dostęp do danych innego użytkownika. Bardzo trudno je wyłapać za pomocą tradycyjnej analizy statycznej, ponieważ błąd ma charakter logiczny, a nie syntaktyczny: kod jest poprawny technicznie, po prostu brakuje mu kontroli autoryzacji.
Firma udoskonaliła przepływ pracy umożliwiający wykrywanie tych luk, łącząc swój silnik oparty na regułach z rozumowaniem AI. Aby określić, jaka wydajność pochodzi z samego modelu w porównaniu z otaczającym go rusztowaniem, badacze przeprowadzili zestaw popularnych modeli o otwartej masie za pomocą minimalnej uprzęży — prostej konfiguracji Pydantic, korzystając z tego samego podpowiedzi IDOR podawanego dla każdego modelu, bez odkrywania punktów końcowych i bez nawigacji ze wskazówkami. Podpowiedź oferowała jedynie podstawową strategię wyszukiwania i kilka wskazówek na temat wyglądu IDOR — trochę więcej niż „tutaj jest kod, znajdź błędy”, ale znacznie mniej niż to, co otrzymują graniczni agenci kodujący, gdy działają w pełnym potoku Semgrep.
IDORy są stałym problemem dla zespołów zajmujących się bezpieczeństwem aplikacji, ponieważ wpadają w pułapki konwencjonalnych skanerów. Narzędzie oparte na regułach może oznaczyć brakujące dane wejściowe, ale zrozumienie, czy konkretny punkt końcowy faktycznie udostępnia dane innego użytkownika, wymaga wnioskowania na temat logiki biznesowej aplikacji — dokładnie w tym rodzaju oceny kontekstowej, w której coraz lepiej sprawdzają się duże modele językowe.
GLM 5.2 przejmuje prowadzenie
Wyróżniającym się modelem był GLM 5.2, model Zhipu AI o otwartej masie. Działając wyłącznie bez podpowiedzi, uzyskał wynik 39% F1 w wykrywaniu IDOR — pokonując 32% Claude'a Code'a o siedem pełnych punktów. Według Semgrepa model o otwartej masie przewyższył również w tym zadaniu Claude Opus 4,8, co czyni go najsilniejszą przetestowaną opcją niegraniczną.
Równie uderzająca była ekonomia. Przy cenie GLM 5.2 koszt uruchomienia wynosi około 0,17 dolara za każdą wykrytą lukę. W przypadku organizacji, które mogą skanować tysiące punktów końcowych, Semgrep zauważył, że koszt pojedynczego błędu jest często czynnikiem decydującym o tym, czy technika wykrywania jest praktyczna na dużą skalę.
Inni pretendenci w wadze otwartej pozostali dalej w tyle. MiniMax M3 uzyskał 23% F1, a Kimi K2.7 Code uzyskał 22%, oba plasując się znacznie poniżej Claude Code. Semgrep scharakteryzował GLM 5.2 jako wyraźny wyjątek, a nie reprezentatywny wynik dla kategorii wagi otwartej.
Uprząż wciąż ma znaczenie
Pomimo zwycięstwa w wadze otwartej w kategorii surowych produktów, specjalnie zbudowany rurociąg firmy Semgrep pozostał ogólnym liderem. Multimodalna konfiguracja firmy — łącząca rozumowanie AI z wykrywaniem opartym na regułach i ustrukturyzowanym wyliczaniem punktów końcowych — osiągnęła od 53% do 61% F1, w zależności od konfiguracji. Ta luka podkreśla pierwotne pytanie badaczy: w jakim stopniu wydajność wykrywania podatności ma model, a w jakim stopniu otaczająca go architektura?
Odpowiedź wydaje się brzmieć „oba, ale bardziej, niż ludzie przypuszczają, jest uprząż”. GLM 5.2 udowodnił, że wydajny model może wykonać znaczącą pracę przy minimalnym wsparciu, a mimo to nie był w stanie dorównać systemowi zaprojektowanemu specjalnie pod kątem danego problemu.
Zespół Semgrep — w skład którego wchodzili badacze Paxton-Fear, Seth Jaksik, Brenden Noblitt i Erik Buchanan — stwierdził, że był „naprawdę zszokowany”, gdy okazało się, że model o otwartej wadze obsługujący gołe polecenie przewyższył granicznego agenta kodującego w przypadku wymagającego rozumowania zadania bezpieczeństwa.
Mity w domu
Ten punkt odniesienia ma dodatkową wagę w kontekście aktualnej sytuacji geopolitycznej. Tytuł wpisu na blogu – „Mamy Mythos w domu” – stanowi wyraźne nawiązanie do faktu, że model Mythos firmy Anthropic, skupiający się na cyberbezpieczeństwie, jest w rzeczywistości niedostępny dla większości krajów na świecie. Po tym, jak administracja Trumpa zabroniła obywatelom spoza USA korzystania z Mythos i jego ograniczonego rodzeństwa Fable 5, globalne zespoły ds. bezpieczeństwa utraciły dostęp do tego, co powszechnie uważa się za najpotężniejszą sztuczną inteligencję do zadań związanych z bezpieczeństwem ofensywnym i defensywnym.
W tej próżni dostępne modele z otwartą wagą wypełniają lukę. Fakt, że GLM 5.2 – który można bezpłatnie pobrać i wdrożyć w dowolnym miejscu – może już dorównać lub pokonać zastrzeżone modele z zagranicy w określonych zadaniach związanych z bezpieczeństwem, sugeruje, że efekt mrożący zakazu eksportu może być mniejszy niż zamierzony. Jeśli najlepszy „nieograniczony” model będzie stale udoskonalany, strategiczna wartość gromadzenia zdolności granicznych maleje.
Na razie wynik jest wąski: pojedynczy test porównawczy dla jednej klasy podatności. Jest to jednak sygnał, że otwarta granica zamyka się szybciej, niż wielu przypuszczało, i że dostępność – a nie same możliwości – może stać się zmienną definiującą w krajobrazie bezpieczeństwa sztucznej inteligencji.
Odkrycie rodzi także niewygodne pytania dla laboratoriów pionierskich. Jeśli ogólnodostępny model może już dorównać zastrzeżonym systemom w zakresie zadań związanych z rozumowaniem bezpieczeństwa, fosa konkurencyjna wokół modeli zamkniętych zawęża się — szczególnie gdy kontrole eksportu sprawiają, że te zamknięte modele stają się niedostępne dla dużych obszarów rynku globalnego. Programiści o otwartej wadze, nieskrępowani ograniczeniami użytkowania, mogą iterować i wdrażać wszędzie jednocześnie.
Wyprzedź sztuczną inteligencję
Przepaść między pionierską a otwartą sztuczną inteligencją zmniejsza się dzięki najnowszym wiadomościom o sztucznej inteligencji oraz badaniom zmieniającym bezpieczeństwo, infrastrukturę i politykę.
Przeczytaj więcej aktualności o sztucznej inteligencji →


