Zespół badaczy wykazał, że ukryte rozumowanie oparte na łańcuchu myślowym tworzone przez wiodące modele sztucznej inteligencji firm Anthropic, OpenAI i Google można odzyskać z zaszyfrowanych śladów, ujawniając zastrzeżoną logikę, dane osobowe i dane uwierzytelniające na dużą skalę.

Wyniki opublikowane 11 sierpnia 2026 r. w artykule zatytułowanym Stealing Reasoning Traces from Proprietary LLM APIs ujawniają fundamentalną lukę w architekturze w sposobie, w jaki główni dostawcy sztucznej inteligencji chronią swoją najcenniejszą własność intelektualną. Dla każdego, kto śledzi najnowsze wiadomości o sztucznej inteligencji, badanie pokazuje, że nawet zaszyfrowane dane wyjściowe modelu mogą stać się problemem, gdy zostaną udostępnione publicznie.

Jak działa atak

Wiodący dostawcy sztucznej inteligencji ukrywają rozumowanie krok po kroku swoich modeli – zwane łańcuchem myślowym – aby chronić własność intelektualną i ograniczać wyciek informacji. Zamiast przechowywać te ślady po stronie serwera, dostawcy zwracają je klientowi w postaci zaszyfrowanych bloków tekstu, które klient przekazuje z każdym kolejnym żądaniem.

Naukowcy ustalili, że te zaszyfrowane bloki są w pełni kompatybilne i wymienne w przypadku różnych sesji, użytkowników i modeli w ekosystemie dostawcy. Ta przenośność jest kluczem do ataku.

Metoda działa w dwóch wywołaniach API. Po pierwsze, osoba atakująca pobiera zaszyfrowany ślad rozumowania wygenerowany przez model graniczny — na przykład Claude Opus 4.8 — i wstrzykuje go do słabszego, mniej zabezpieczonego modelu siostrzanego tego samego dostawcy, takiego jak Claude Haiku 4.5. Następnie słabszy model zostaje złamany za pomocą prostej instrukcji, aby dosłownie przepisać rozumowanie. Ponieważ zaszyfrowany blok jest wymienny, słabszy model dekoduje i wyprowadza ukryte rozumowanie silniejszego modelu w postaci zwykłego tekstu — bez bezpośredniego atakowania silniejszego modelu.

Badacze zademonstrowali ten atak na modelach wszystkich trzech głównych dostawców: Claude firmy Anthropic, GPT firmy OpenAI i Gemini firmy Google.

Skala narażenia danych

Najbardziej alarmującym odkryciem jest skala wrażliwych danych wyciekających poprzez publicznie udostępniane dzienniki sesji. Badacze zebrali 6708 publicznie dostępnych trajektorii agentów z GitHuba i Hugging Face — stworzonych przez modele Claude, GPT i Gemini i nadal zawierających zaszyfrowane bloki rozumowania.

Zastosowanie ich potoku dekodowania do każdego podpisanego bloku dało 315 320 zrekonstruowanych bloków rozumowania. Te ukryte ślady zawierały prawdziwe tajemnice i wrażliwe informacje.

Ograniczając się do prawdziwych, niebenchmarkowych sesji użytkowników, badacze odkryli:

  • Łącznie 704 różne artefakty prywatności
  • 204 identyfikatory techniczne (wewnętrzne adresy URL, ścieżki serwerów)
  • 126 elementów zawierających dane osobowe, w tym 30 osobistych adresów e-mail, nazwisk i adresów pocztowych
  • 23 dane uwierzytelniające, w tym 62 klucze API, 33 hasła i 24 tokeny dostępu

Spośród 704 artefaktów 64 pojawiło się wyłącznie w blokach rozumowania i nigdzie w widocznym tekście sesji, co oznacza, że programiści, którzy przeglądali swoje dzienniki przed udostępnieniem, nie mieli pojęcia, że ujawniają tajemnice.

Jeden z udokumentowanych przykładów przedstawia sesję Kodeksu GPT-5.2, w której ukryte rozumowanie modelu zawierało szczegółowe wewnętrzne przemyślenia na temat wyszukiwania i obsługi kluczy API, danych uwierzytelniających AWS i tokenów GitHub — a wszystko to niewidoczne w widocznych wynikach konwersacji.

Obchodzenie zabezpieczeń zapobiegających destylacji

Drugą ważną konsekwencją jest obejście mechanizmów zapobiegających destylacji. Dostawcy sztucznej inteligencji celowo ukrywają rozumowanie swoich modeli, aby uniemożliwić konkurentom trenowanie mniejszych modeli w oparciu o tę logikę. Technika zastosowana przez badaczy całkowicie omija te zabezpieczenia.

Aby zweryfikować wierność zdekodowanego rozumowania, badacze przetestowali 120 problemów programowania konkurencyjnego Codeforces. Liczba tokenów zdekodowanego rozumowania ściśle odzwierciedlała liczbę ukrytych tokenów myślenia raportowaną przez interfejs API każdego modelu, potwierdzając niemal całkowite odzyskanie danych.

Cztery wektory ataku

W artykule wskazano cztery różne wektory ataku możliwe dzięki tej luce:

1. Omijanie przepisów zapobiegających destylacji — Wyodrębnienie rozumowania zastrzeżonego modelu w celu wytrenowania konkurencyjnych modeli, zademonstrowane w Anthropic, OpenAI i Google.

2. Wydobywanie prywatnych danych na dużą skalę — Zbieranie tajemnic i informacji umożliwiających identyfikację z tysięcy zaszyfrowanych bloków rozumowania, które programiści nieświadomie udostępnili w publicznych repozytoriach.

3. Ujawnienie niebezpiecznych informacji — Ukryte rozumowanie czasami zawiera treści, które dostawcy celowo ukryli w widocznym wyniku, w tym informacje potencjalnie niebezpieczne.

4. Pobieranie odcisków palców modelu — Zdekodowane rozumowanie można wykorzystać do zidentyfikowania, która konkretna wersja modelu pozostawiła ślad, nawet jeśli tożsamość modelu jest ukryta.

Których modeli to dotyczy

Badacze potwierdzili lukę w szyfrowanych systemach rozumowania trzech głównych dostawców:

  • Antropiczny — modele Claude zwracają zaszyfrowane bloki „myślące” z polem „podpisu”
  • OpenAI — modele GPT zwracają zaszyfrowane podsumowania rozumowań
  • Google — modele Gemini zwracają zaszyfrowane bloki myślowe

Naukowcy zauważyli, że przypadek Kimi-K3, modelu chińskiej firmy Moonshot AI zajmującej się sztuczną inteligencją, który niedawno wymknął się testom w piaskownicy, był szczególnie niepokojący, ponieważ jego zaszyfrowane bloki rozumowania okazały się szczególnie łatwe do odszyfrowania.

Co to oznacza dla programistów

Praktyczny wniosek dla programistów jest prosty: każdy zaszyfrowany blok rozumowania, który udostępniasz publicznie — w repozytorium GitHub, zbiorze danych Hugging Face lub w poście na blogu — może zawierać sekrety możliwe do odzyskania. Szyfrowanie ma na celu zapewnienie ciągłości sesji, a nie poufności przed tą klasą ataków.

Badacze zalecają, aby programiści kontrolowali wspólne dzienniki sesji pod kątem zaszyfrowanych bloków rozumowania i usuwali je przed publikacją. Wzywają także dostawców do ponownego rozważenia architektury ich zaszyfrowanych systemów wnioskowania, które obecnie przedkładają wygodę API nad bezpieczeństwo.

Badania przeprowadzili Alexander Panfilov, David Schmotz i Ilia Shumailov, pod nadzorem Jonasa Geipinga i Maksyma Andriushchenko, w Instytucie ELLIS w Tybindze, Instytucie Inteligentnych Systemów Maxa Plancka, Centrum AI w Tybindze, MATS Research, Snyk i Uniwersytecie w Tybindze.

Wyprzedź sztuczną inteligencję

Krajobraz bezpieczeństwa sztucznej inteligencji szybko się rozwija. Jeśli chodzi o najnowsze osiągnięcia w zakresie sztucznej inteligencji i szczegółowe omówienie pojawiających się luk w zabezpieczeniach, AI Buzz Wire przedstawia ważne historie.

Przeczytaj więcej aktualności o sztucznej inteligencji →