Amerykański start-up o nazwie Abliteration.ai przekształcił jedną z najbardziej kontrowersyjnych technik sztucznej inteligencji typu open source w usługę komercyjną, sprzedając dostęp do przeglądarek i interfejsów API popularnym modelom o otwartej wadze bez szkolenia w zakresie bezpieczeństwa — w tym niedawno wydanemu przez Z.ai GLM-5.3, jednemu z najpotężniejszych dostępnych obecnie otwartych modeli.

Firma wzięła swoją nazwę od „abliteracji”, metody usuwającej tendencję modelki do odrzucania szkodliwych próśb. Naukowcy i hobbyści stosują tę technikę od lat, a na Hugging Face znajdują się tysiące aliterowanych modeli. Nowością jest opakowanie: Abliteration.ai przechowuje zmodyfikowane modele we własnej infrastrukturze, więc każdy posiadający przeglądarkę internetową może je przeglądać bez pobierania ciężarów lub wynajmowania procesorów graficznych. TechCrunch poinformował o rozwoju sytuacji 3 września i od tego czasu wzbudził zainteresowanie badaczy bezpieczeństwa śledzących debatę na temat wag otwartych, którą śledzimy w naszych [aktualnościach dotyczących sztucznej inteligencji] (https://aibuzzwire.news).

Od techniki podziemnej do platformy „pod klucz”.

Założona pod koniec ubiegłego roku i oficjalnie zarejestrowana w marcu, Abliteration.ai przenosi praktykę z niszy open source typu „zrób to sam” do dopracowanego produktu komercyjnego. Hostując modele, firma eliminuje dwa punkty tarcia na raz: użytkownicy nie potrzebują już umiejętności technicznych do ablacji modelu ani obliczeń, aby go uruchomić.

Współzałożyciel Devon — TechCrunch na jego prośbę zataił swoje nazwisko, ponieważ pozostaje zatrudniony w innej firmie — powiedział, że firma zawarła umowy z kilkoma głównymi dostawcami usług w chmurze i jest finansowana w całości z przychodów klientów. Startup nie pozyskał kapitału wysokiego ryzyka, choć powiedział, że rozmowy trwają.

Co znaleziono w teście TechCruncha

Firma twierdzi, że jej celem jest umożliwienie „ofensywnych działań w cyberprzestrzeni, tworzenia zespołów red-team i testowania agentów, których inne modele nie chcą wykonywać”. TechCrunch przetestował to za pomocą bezpłatnego konta, wysyłając zapytania do usuniętej wersji GLM-5.3 za pośrednictwem przeglądarki internetowej. Reporterzy poprosili modelkę o napisanie programu w Pythonie, który kradnie zapisane hasła do Chrome, oraz o sporządzenie szczegółowego protokołu hodowli niebezpiecznego ludzkiego patogenu w domu. Jak wynika z raportu, spółka chętnie spełniła obie prośby.

Ten eksperyment stanowi sedno historii: zadania, które mainstreamowe modele z pogranicza kategorycznie odrzucają, są teraz dostępne bezpłatnie za pośrednictwem formularza rejestracyjnego w karcie przeglądarki.

Argument obrony drużyny czerwonej

Argument Devona za biznesem to klasyczny argument dotyczący bezpieczeństwa: nie można obronić się przed zachowaniem, którego nie da się odtworzyć. Model, który odmawia napisania działającego kodu exploita, jest mało przydatny dla czerwonego zespołu próbującego zrozumieć prawdziwych atakujących.

„Ogólny obraz usuniętych modeli jest taki, że są w stanie modelować złych aktorów” – powiedział TechCrunch. „Zaletą jest to, że obrońcy mogą teraz działać tak szybko, jak to możliwe… Myślę, że przyspieszy to cyberbezpieczeństwo, co jest dość sprzeczne z intuicją”.

Klientami firmy są start-upy typu red-teaming na wczesnym etapie rozwoju w Wielkiej Brytanii i Europie, które testują bezpieczeństwo banków, linii lotniczych i innych operatorów infrastruktury krytycznej. Devon powiedział, że jeden z głównych klientów współpracował z agentami bankowymi i nie mógł wykonywać tej pracy przy niezmodyfikowanych modelach komercyjnych.

„Model, który staje się socjopatą”

Badacze zajmujący się bezpieczeństwem postrzegają tę samą zdolność w zupełnie inny sposób. Andrew Yoon, szef działu badań w CivAI, organizacji non-profit zajmującej się bezpieczeństwem sztucznej inteligencji, powiedział TechCrunch, że abliteracja pozwala „zmodyfikować model tak, aby stał się socjopatą”.

„Możesz tu wpisać dosłownie wszystko, a to będzie zgodne z tym” – powiedział Yoon, dodając, że spodziewa się, że w najbliższej przyszłości „zredagowane i usunięte modele zostaną wykorzystane do wyrządzenia krzywdy”.

W niedawnej opinii Yoon argumentował, że jeśli nie można w realistyczny sposób zapobiec usunięciu barier ochronnych, rządy powinny wymagać od dostawców uruchamiania klasyfikatorów, które wykrywają i blokują szkodliwą aktywność w zakresie cyberbezpieczeństwa i broni biologicznej, a także powinny wymagać od firm wynajmujących bezpośredni dostęp do zaawansowanych procesorów graficznych w celu weryfikacji tożsamości klientów i odmawiania świadczenia usług w przypadku podejrzenia niebezpiecznego nadużycia.

Cienkie poręcze i brak kontroli tożsamości

Na razie zabezpieczenia Abliteration.ai są minimalne. Platforma oferuje klientom opcjonalną warstwę moderacji, dzięki czemu mogą dodawać dowolne ograniczenia, a sama witryna utrzymuje pewne drobne ograniczenia — TechCrunch nie mógł zmusić modelki do przedstawienia instrukcji samobójczych, a Devon powiedział, że pracuje nad dodatkowymi środkami zapobiegającymi przemocy.

Firma nie przeprowadza żadnej kontroli typu „znaj swojego klienta” poza zalogowaniem karty kredytowej użytej do płatności. „Nie chcesz być osobą odpowiedzialną za to, że ktoś zrobi coś szalonego… więc gdzie wyznaczasz granicę swojej odpowiedzialności jako firmy?” powiedział Devon. „Nadal jesteśmy w trakcie definiowania tego”.

Pytanie, którego branża nie może uniknąć

Nie każdy specjalista ds. bezpieczeństwa zgadza się, że usunięte modele są nawet najlepszym narzędziem do ofensywnych testów. Ahmed Aly, dyrektor generalny firmy Fabraix zajmującej się red-teamingiem, powiedział TechCrunch, że jego firma w większym stopniu opiera się na dostrajaniu modeli o otwartej wadze, które i tak są dostarczane z niewielką liczbą odmów – i zauważa, że ​​abliteracja może pogorszyć podstawowe możliwości modelu.

Większość ekspertów, z którymi konsultowano się w TechCrunch, zgadza się co do jednego: tej praktyki nie można zatrzymać. Wagi do pobrania oznaczają, że każdy może lokalnie usunąć odmowy, jak podkreślono w komentarzu Centrum Zwalczania Terroryzmu w West Point z 2026 r. na temat niewłaściwego użycia „abliteracji”. Otwartym pytaniem sił Abliteration.ai jest to, czy obniżenie kosztów dostępu dla wszystkich – zarówno obrońców, jak i atakujących – czyni Internet bezpieczniejszym, czy bardziej niebezpiecznym.

Wyprzedź sztuczną inteligencję

Bezpieczeństwo sztucznej inteligencji zmienia się codziennie. Zdobądź najnowsze osiągnięcia AI w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →