OpenAI podniosło nagrodę za odkrycie „uniwersalnych jailbreaków” w swoich modelach AI do 50 000 dolarów, co stanowi ponad dwukrotność poprzedniej nagrody i sygnalizuje, że firma uważa pewne klasy obejść bezpieczeństwa za na tyle poważne, że uzasadniają wypłatę dodatkowej kwoty.
Zaktualizowany program Bio Bug Bounty, ogłoszony przez OpenAI 9 lipca 2026 r., prosi badaczy bezpieczeństwa o znalezienie podpowiedzi, które będą w stanie uniwersalnie przełamać bariery bezpieczeństwa modelu — obejścia, które działają w wielu rozmowach i kontekstach, a nie w izolowanych przypadkach brzegowych. Program jest szczególnie ukierunkowany na ucieczki z więzienia związane z zagrożeniami biologicznymi, w przypadku których można by zmusić model sztucznej inteligencji do zapewnienia praktycznych wskazówek dotyczących tworzenia niebezpiecznych patogenów lub broni.
Więcej najświeższych wiadomości o sztucznej inteligencji i dogłębną analizę można znaleźć na stronie AI Buzz Wire.
Dlaczego 50 000 dolarów?
Zwiększona nagroda odzwierciedla rosnące obawy związane z rozbieżnością między tym, czego zabrania się robić pionierskim modelom sztucznej inteligencji, a tym, co zdeterminowani użytkownicy mogą z nich faktycznie wydobyć. Uniwersalny jailbreak jest szczególnie niebezpieczny, ponieważ w przeciwieństwie do jednorazowej sztuczki polegającej na natychmiastowym wstrzyknięciu stanowi systematyczną słabość, którą można powielić i udostępnić.
10 lipca firma TechRepublic poinformowała, że wzrost nagród wynika z wnikliwej analizy najpotężniejszych modeli OpenAI. Według National Technology News administracja Trumpa zwróciła się już wcześniej do OpenAI o ograniczenie wypuszczenia jego najnowszego modelu obsługującego cybernetykę do starannie wybranej grupy zweryfikowanych użytkowników, jak podaje National Technology News, co odzwierciedla obawy rządu dotyczące ofensywnego potencjału pionierskich systemów sztucznej inteligencji.
Brytyjska agencja stwierdza, że możliwości AI w zakresie cyberbezpieczeństwa przyspieszają
Ogłoszenie nagrody zbiega się z ostrym ostrzeżeniem brytyjskiego Instytutu Bezpieczeństwa AI (AISI), który od 2024 r. niezależnie ocenia możliwości cybernetyczne modeli granicznych.
W ocenie GPT-5.5 OpenAI przeprowadzonej w kwietniu 2026 r. AISI stwierdziła, że model ten osiągnął wskaźnik pomyślności w zadaniach związanych z cyberbezpieczeństwem na poziomie eksperckim na poziomie 71,4% — najwyższy ze wszystkich testowanych modeli, przewyższając Claude Mythos Preview firmy Anthropic na poziomie 68,6%, GPT-5.4 na poziomie 52,4% i Opus 4.7 na poziomie 48,6%.
Jeden punkt odniesienia był szczególnie uderzający. AISI zaprojektowało niestandardowe wyzwanie polegające na inżynierii wstecznej maszyny wirtualnej — wieloetapowe zadanie wymagające od osoby atakującej zbudowania niestandardowego dekodera instrukcji, przeprowadzenia inżynierii wstecznej modułu uwierzytelniającego i odzyskania prawidłowego hasła. Ekspert w testowaniu gry na ludziach z Crystal Peak Security rozwiązał to wyzwanie w około 12 godzin, korzystając z profesjonalnych narzędzi. GPT-5.5 rozwiązał problem w 10 minut i 22 sekundy, kosztem użycia API wynoszącego 1,73 dolara, bez pomocy człowieka.
Podwajanie co kilka miesięcy
W osobnej analizie opublikowanej w maju 2026 r. AISI stwierdziło, że długość pionierskich modeli sztucznej inteligencji w zakresie cyberzadań, które mogą autonomicznie wykonać, podwaja się co 4,7 miesiąca od końca 2024 r., co oznacza przyspieszenie w porównaniu z szacunkami z listopada 2025 r., które wynosiły 8 miesięcy.
„Obecne tempo zmian wskazuje na rosnący potencjał zdolności cybernetycznych sztucznej inteligencji do przełożenia się na wymierne ryzyko – ryzyka, z którymi brytyjskie organizacje będą musiały się uporać w nadchodzących miesiącach” – napisała AISI.
Zarówno Claude Mythos Preview, jak i GPT-5.5 znacznie przekroczyły poprzedni trend podwojenia, co rodzi pytanie, czy tempo nie będzie jeszcze szybsze.
Uniwersalne jailbreaki: najwyższa stawka
Rozróżnienie między wąskim jailbreakiem a uniwersalnym jest krytyczne. Wąski jailbreak może nakłonić model do wygenerowania pojedynczej niedozwolonej odpowiedzi w określonych warunkach. Z kolei uniwersalne jailbreak stanowi fundamentalne pęknięcie w architekturze bezpieczeństwa modelu — metodę, która niezawodnie omija bariery ochronne przy szerokim zakresie wejść.
Decyzja OpenAI o zaoferowaniu 50 000 dolarów za takie odkrycia sugeruje, że firma uważa, że uniwersalne ucieczki z więzienia są zarówno na tyle rzadkie, że uzasadniają dużą nagrodę, jak i na tyle niebezpieczne, aby uzasadniać inwestycję. Jeśli złośliwy aktor odkryje przed załataniem uniwersalny jailbreak w przypadku zapytań związanych z zagrożeniami biologicznymi, konsekwencje mogą być poważne.
Program pełni także funkcję przezroczystości. Zapraszając badaczy zewnętrznych do zbadania swoich modeli, OpenAI może zidentyfikować i naprawić luki w zabezpieczeniach, zanim zostaną one wykorzystane w środowisku naturalnym – pod warunkiem, że nagroda jest wystarczająco duża, aby przyciągnąć potrzebny talent.
Wyścig między atakiem a obroną
Równoległe wydarzenia – wzrost nagród za OpenAI i oceny zdolności AISI – ilustrują główne napięcie w dzisiejszym bezpieczeństwie sztucznej inteligencji. Modele stają się coraz bardziej zdolne do wykonywania zadań cybernetycznych, a horyzont czasowy zadań, które mogą wykonać, podwaja się co kilka miesięcy. Jednocześnie firmy ścigają się, aby załatać luki, które czynią ich modele niebezpiecznymi.
Otwartym pytaniem pozostaje, czy nagrody i dobieranie drużyn czerwonych dotrzymają kroku rosnącej krzywej możliwości. Jednak kwota 50 000 dolarów stanowi wyraźny sygnał: OpenAI uważa, że zagrożenie jest na tyle poważne, że zapłaci wysoką kwotę każdemu, kto udowodni istnienie pęknięć.
Wyprzedź sztuczną inteligencję
W miarę jak modele graniczne stają się coraz potężniejsze, walka pomiędzy barierkami ochronnymi a tymi, którzy próbują je złamać, będzie się tylko nasilać. Śledź najnowsze osiągnięcia w AI Buzz Wire.
Przeczytaj więcej relacjonowanie branży AI w AI Buzz Wire.


