30 września 2026 r. OpenAI opublikowało post dotyczący bezpieczeństwa, opisujący, w jaki sposób zidentyfikował i przerwał skoordynowaną kampanię mającą na celu wydobycie chronionego rozumowania ze swoich modeli oraz przypisał główny zespół działań osobom związanym z Moonshot AI, chińskim laboratorium stojącym za rodziną modeli Kimi.
Ujawnienie następuje w newralgicznym momencie dla branży, gdzie wartość modelu pionierskiego w coraz większym stopniu leży nie tylko w odpowiedziach, ale także w sposobie jego uzasadnienia. Czytelnikom śledzącym najnowsze osiągnięcia w dziedzinie sztucznej inteligencji sprawa oferuje niezwykle szczegółowe spojrzenie na to, jak modele IP są atakowane na dużą skalę i jak reagują laboratoria.
Co oznacza tutaj „destylacja kontradyktoryjna”.
OpenAI opisuje tę działalność jako zgodną z destylacją kontradyktoryjną, którą definiuje jako systematyczne i nieautoryzowane wykorzystanie wyników lub rozumowań jednego modelu w celu szkolenia, reprodukowania lub ulepszania innego modelu. „Chronione rozumowanie” to wewnętrzny zapis modelu dotyczący wykonania zadania — informacja, która zwykle nie jest uwzględniana w ostatecznej odpowiedzi, którą widzi użytkownik. Jak twierdzi firma, wydobycie go może pomóc innym w odtworzeniu możliwości, których sami nie zbudowali.
Co ważne, OpenAI twierdzi, że operatorzy nie złamali szyfrowania, nie naruszyli bazy danych ani nie uzyskali bezpośredniego dostępu do przechowywanych rozmów użytkowników. Zamiast tego manipulowali interakcjami modeli, tak aby chronione rozumowanie mogło zostać odtworzone w formie widocznej dla zgłaszającego – co stanowiło skoordynowane, masowe nadużycie samego produktu, a nie tradycyjny hack.
Jedna z technik udokumentowanych przez OpenAI polegała na kopiowaniu zaszyfrowanych śladów rozumowania z jednej rozmowy, a następnie proszeniu modelu w osobnej rozmowie o odszyfrowanie i transkrypcję ukrytej treści rozumowania. Firma podkreśliła, że manipulacja nie jest luką charakterystyczną dla jej własnych modeli i oświadczyła, że udostępniła szczegółowe informacje partnerom branżowym za pośrednictwem Frontier Model Forum, aby wzmocnić zbiorową obronę.
Oś czasu: 16 000 żądań w dwa dni
Jak wynika z postu, kampania rozpoczęła się 1 lipca 2026 roku przy stosunkowo niewielkim nakładzie. Problem gwałtownie się nasilił 24 i 25 lipca, kiedy OpenAI zaobserwowało masowe wzrosty liczby 16 000 żądań przy użyciu odpowiedniego wzorca ekstrakcji, pochodzących od ponad 4000 użytkowników. Przypis w poście ostrzega, że liczby te opisują próby ekstrakcji – niekoniecznie udane.
Dalsze badanie ujawniło powiązaną aktywność wzorca podpowiedzi w klastrze liczącym ponad 15 000 użytkowników. OpenAI twierdzi, że do 28 lipca 2026 r. całkowicie zakłóciło kampanię i że aktywność ta z biegiem czasu ewoluowała, utwierdzając jej pogląd, że destylacja kontradyktoryjna wymaga warstwowych, adaptacyjnych zabezpieczeń, a nie jednorazowego rozwiązania.
Punkty uznania dla Moonshot AI
OpenAI jest ostrożny przy przypisywaniu. Mówi, że nie jest jasne, czy wszyscy operatorzy obserwowani w tym okresie pochodzili od jednego podmiotu, ale główny zespół działań przypisuje osobom powiązanym z Moonshot AI, twórcą Kimi.
Roszczenie nie pojawia się w próżni. 8 września 2026 r. Agencja Bezpieczeństwa Narodowego, Agencja ds. Cyberbezpieczeństwa i Bezpieczeństwa Infrastruktury oraz FBI opublikowały wspólny poradnik dotyczący cyberbezpieczeństwa, w którym stwierdzają, że Moonshot AI prowadzi szeroko zakrojoną kampanię destylacyjną przeciwko zagranicznym firmom zajmującym się sztuczną inteligencją od co najmniej połowy 2025 r. Zgodnie z poradnikiem firma Moonshot pobrała istotne dane z systemu Claude Fable 5 w celu wytrenowania modelu Kimi-K3 i danych GPT-4o w celu wyszkolenia Kimi-K2, wykorzystując modele amerykańskie do określenia możliwości w zakresie nadzorowanego dostrajania, uczenia się przez wzmacnianie, inżynierii oprogramowania i matematyki.
W zaleceniu idzie dalej i stwierdza się, że – prawdopodobnie przy świadomości chińskiego rządu – DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun i Z.AI wspólnie wyodrębniły miliardy tokenów na milionach giełd z amerykańskich modeli granicznych, w tym wariantów Claude, GPT, Gemini i Grok, co najmniej od końca 2024 r. Agencje opisują rurociąg logistyczny obejmujący natywne interfejsy API, zdalnych dostawców usług w chmurze i zewnętrznych agregatorów, a także szara strefa serwerów proxy API zwanych „stacjami przesiadkowymi” używanych do ominięcia ograniczeń geograficznych i warunków świadczenia usług. Według doniesień oszczędności wynikają z masowego zakupu subskrypcji premium współdzielonych przez zespoły programistów.
Dlaczego warto kraść ślady rozumowania
Troska o bezpieczeństwo wykracza poza przewagę konkurencyjną. OpenAI argumentuje, że wyodrębnione rozumowanie można wykorzystać do szkolenia innego modelu bez zachowywania zabezpieczeń stosowanych w przypadku wyników oryginalnego modelu skierowanych do użytkownika, co oznacza, że destylacja na dużą skalę może przenieść zaawansowane możliwości bez odpowiednich inwestycji w bezpieczeństwo. Firma twierdzi, że ryzyko to rośnie w miarę zdobywania przez modele umiejętności w dziedzinach podwójnego zastosowania.
Niezależni badacze biją na ten sam alarm. W artykule przesłanym do arXiv 10 sierpnia 2026 r. grupa badaczy, w tym Alexander Panfilov, Ilia Shumailov i Maksym Andriushchenko, poinformowała, że czołowi dostawcy nie ukrywają w pełni śladów rozumowania swoich modeli oraz poprzez odpowiedzialne ujawnianie wykazały powiązane luki w zabezpieczeniach między modelami i zagęszczaniem konwersacji. OpenAI twierdzi, że zbadało te ustalenia, potwierdziło, że ścieżki ataków są rzeczywiste i wykorzystało tę pracę do przyspieszenia działań zaradczych.
Co będzie dalej
OpenAI twierdzi, że przed publikacją zbadało zakres i potencjalny wpływ kampanii, wdrożyło własne rozwiązania łagodzące i podzieliło się swoimi ustaleniami z badaczami i partnerami branżowymi w celu uzyskania opinii. Trwają dodatkowe prace łagodzące i dochodzeniowe, a firma postrzega destylację kontradyktoryjną jako szersze wyzwanie dla bezpieczeństwa całego ekosystemu laboratoriów granicznych, a nie pojedynczy incydent.
Odcinek ten zaostrza także toczącą się debatę polityczną. Jeśli agencje amerykańskie formalnie przypiszą chińskim laboratoriom kampanie destylacyjne, należy spodziewać się ściślejszej kontroli dostępu do API, bardziej agresywnego ograniczania stawek i kontroli tożsamości, a także ciągłej presji na rynki agregatorów i serwerów proxy, co ułatwia ukrycie nadużyć na dużą skalę. W przypadku firm zajmujących się sztuczną inteligencją po obu stronach Pacyfiku warstwa rozumowania jest obecnie przedmiotem sporu, a jej ochrona stała się osobną dyscypliną bezpieczeństwa.
---
Wyprzedź sztuczną inteligencjęOtrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.
Przeczytaj więcej aktualności o sztucznej inteligencji →