Anthropic uruchomił OSS Scanner, bezpłatną usługę opt-in, która wykorzystuje najsilniejsze modele sztucznej inteligencji firmy — w tym Claude Mythos — do okresowego skanowania kwalifikujących się projektów open source pod kątem luk w zabezpieczeniach i dostarczania w pełni wygenerowanych przez model raportów o błędach bezpośrednio do opiekunów.

Usługa, ogłoszona w środę w poście na blogu firmy, jest efektem cichej zmiany w pracach Anthropic nad bezpieczeństwem: jej modele znajdują ostatnio luki w zabezpieczeniach szybciej, niż jest w stanie je zweryfikować własny zespół ds. bezpieczeństwa Anthropic. Dla programistów śledzących narzędzia zmieniające bezpieczeństwo oprogramowania premiera jest ważnym momentem w naszych relacjach z rozwojem sztucznej inteligencji w infrastrukturze open source.

Od projektu Glasswing do usługi publicznej

Skaner OSS opiera się na doświadczeniach firmy Anthropic z wykorzystaniem Claude do wyszukiwania luk w zabezpieczeniach w ramach Projektu Glasswing, wewnętrznego wysiłku firmy polegającego na wykrywaniu luk w zabezpieczeniach. Liczby z tych prac wyjaśniają, dlaczego Anthropic udostępnia rurociąg społeczeństwu.

Anthropic twierdzi, że w ciągu ostatnich sześciu miesięcy w jej najnowszych modelach wykryto ponad 29 000 potencjalnych luk w zabezpieczeniach w niektórych z najważniejszych projektów oprogramowania na świecie, ale firmie udało się ręcznie sprawdzić i sklasyfikować jedynie około 6 000 z nich. Wąskim gardłem stała się zdolność człowieka do walidacji, a nie modelowanie.

Strona popytowa opowiada podobną historię. Antropiczne raporty mówią, że opiekunowie otrzymujący pierwsze raporty coraz częściej proszą o wszystko, co firma ma: prawie 5000 raportów zostało już wysłanych bezpośrednio do opiekunów, którzy poprosili o masowe przesyłanie niezweryfikowanych wyników, w tym poprawek.

Kontekst możliwości jest surowy. Według Anthropic w CyberGym, akademickim teście porównawczym służącym do wyszukiwania podatności, duże modele językowe odkryły mniej niż 20 procent luk na początku ubiegłego roku do ponad 85 procent w tym roku. Jest to skok, który przekształcił raporty o błędach sztucznej inteligencji z szumów w ustalenia, które można podjąć.

Jak liczby sprawdziły się w testach

Przed uruchomieniem firma Anthropic zweryfikowała swój plan za pomocą dziesiątek projektów typu open source, tworząc setki raportów o błędach — w tym o lukach, które według firmy mogą być powiązane z exploitami nieuwierzytelnionego zdalnego wykonania kodu.

Najbardziej wymowny test obejmował kontrolę zewnętrzną. Firma Anthropic poprosiła ekspertów zajmujących się testami penetracyjnymi, którzy dokonują przeglądu wyników skoordynowanego ujawniania luk w zabezpieczeniach (CVD), o sprawdzenie 97 krytycznych i bardzo istotnych ustaleń ze skanera, pochodzących z 48 projektów. Spośród nich 85–88 procent spełniło wymagania dotyczące procesu CVD firmy Anthropic. Z pozostałych 12 11 dotyczyło rzeczywistych, ale zdublowanych znanych problemów lub innych ustaleń z tego samego skanowania. Tylko jeden wynik był całkowicie fałszywie pozytywny.

Jak twierdzi firma, każdy raport zawiera samodzielny reproduktor i wyjaśnienie luki, w tym podział pozwalający określić, kiedy usterka została wprowadzona.

Kompromis: prędkość ponad pewność

Centralna decyzja projektowa narzędzia OSS Scanner wiąże się również z największym ryzykiem: raporty są w pełni generowane na podstawie modelu, bez konieczności przeglądu przez człowieka ani selekcji. Firma Anthropic wyraźnie twierdzi, że umożliwia to szybsze i częstsze skanowanie, ale także że niektóre raporty będą nieprawidłowe lub nieważne.

Firma określa kompromis jako będący odpowiedzią na zapotrzebowanie konserwatora. Ponieważ exploity można teraz opracować w ciągu kilku minut, projekty coraz częściej wolą natychmiastowe otrzymywanie każdego niezweryfikowanego znaleziska – z dołączonymi proponowanymi poprawkami – niż czekanie na weryfikację przez człowieka. Zainspirowany rozwiązaniem Google OSS-Fuzz, które od lat skanuje oprogramowanie open source za pomocą fuzzerów, OSS Scanner stosuje tę samą logikę do analizy kodu opartej na sztucznej inteligencji.

Nie pominięto projektów preferujących tradycyjną obsługę: Anthropic twierdzi, że będzie w dalszym ciągu ręcznie ujawniać zweryfikowane przez człowieka raporty o podatnościach w ramach istniejącego procesu CVD, szczególnie w przypadku projektów, które nie mają zasobów do samodzielnego selekcjonowania raportów. Dla tych, którzy chcą surowych wyników natychmiast po ich wygenerowaniu, dostępna jest opcjonalna szybka ścieżka.

Kto może się zapisać — i co jeszcze ogłosił Anthropic

Główni opiekunowie kwalifikujących się projektów mogą się zarejestrować, przesyłając żądanie ściągnięcia do repozytorium GitHub, korzystając ze standardowego szablonu projektu. Kwalifikowalność odzwierciedla kryteria OSS-Fuzz: projekty powinny mieć decydujący wpływ na infrastrukturę i bezpieczeństwo użytkowników, a o przyjęciu decydować będzie każdy przypadek.

Skaner pojawia się wraz z szerszym zestawem inicjatyw w zakresie bezpieczeństwa antropicznego. Program Cyber ​​Verification Program udostępnia wykwalifikowanym specjalistom ds. bezpieczeństwa zaawansowane możliwości cybernetyczne i klasyfikatory o zmniejszonym blokowaniu — program Anthropic został rozszerzony na początku tego tygodnia o trzy poziomy dostępu Claude dla zespołów ds. bezpieczeństwa. Oddzielny program Claude for OSS zapewnia bezpłatne subskrypcje Claude Max 20x, które pomagają opiekunom usuwać luki w zabezpieczeniach i ulepszać ich projekty. SiliconANGLE poinformowało również o nowym programie Anthropic skupiającym się na ochronie infrastruktury krytycznej, traktując ogłoszenia z tygodnia jako skoordynowane dążenie do defensywnego cyberbezpieczeństwa.

Co to oznacza dla bezpieczeństwa oprogramowania typu open source

Jeśli skaner OSS działa zgodnie z reklamą, oznacza to strukturalną zmianę w bezpieczeństwie oprogramowania typu open source: sztuczna inteligencja znajduje błędy, a ludzie przechodzą od polowania do weryfikacji. Ta zmiana przenosi prawdziwy ciężar na opiekunów, którzy muszą selekcjonować raporty wygenerowane maszynowo – niektóre z nich są błędne – i decydować, czy zaufać automatycznym łatkom.

Wskaźnik walidacji wynoszący 88% sugeruje, że stosunek sygnału do szumu jest obecnie na tyle dobry, że warto poświęcić czas konserwatorowi, przynajmniej w przypadku projektów dotyczących infrastruktury krytycznej. To, czy szerszy ekosystem się zgodzi, pokaże liczba zapisów oraz liczba zarejestrowanych projektów, które po cichu rezygnują po pierwszej fali raportów.

---

Wyprzedź sztuczną inteligencję

Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →