Tým výzkumníků prokázal, že skrytý myšlenkový řetězec vytvořený předními modely umělé inteligence od Anthropic, OpenAI a Google lze obnovit ze zašifrovaných stop a odhalit tak proprietární logiku, osobní data a přihlašovací údaje.

Zjištění zveřejněná 11. srpna 2026 v článku nazvaném Stealing Reasoning Traces from Proprietary LLM APIs odhalují zásadní architektonickou zranitelnost v tom, jak hlavní poskytovatelé umělé inteligence chrání své nejcennější duševní vlastnictví. Pro každého, kdo sleduje nejnovější zprávy o AI, výzkum podtrhuje, jak se i zašifrované výstupy modelu mohou stát problémem, když jsou sdíleny veřejně.

Jak útok funguje

Přední poskytovatelé umělé inteligence skrývají postupné uvažování svých modelů – známé jako řetěz myšlenek – aby chránili duševní vlastnictví a omezili únik informací. Namísto ukládání těchto trasování na straně serveru je poskytovatelé vracejí klientovi jako zašifrované bloky textu, které klient předává zpět s každým dalším požadavkem.

Výzkumníci zjistili, že tyto šifrované bloky jsou plně kompatibilní a zaměnitelné napříč různými relacemi, uživateli a modely v rámci ekosystému poskytovatele. Tato přenositelnost je klíčem k útoku.

Metoda funguje ve dvou voláních API. Za prvé, útočník vezme zašifrovanou logickou stopu vytvořenou hraničním modelem – například Claude Opus 4.8 – a vloží ji do slabšího, méně zabezpečeného sourozeneckého modelu od stejného poskytovatele, jako je Claude Haiku 4.5. Slabší model je pak jailbreaknut jednoduchým pokynem k doslovnému přepsání úvahy. Protože je šifrovaný blok zaměnitelný, slabší model dekóduje a vydává skrytou úvahu silnějšího modelu v prostém textu – aniž by kdy přímo zaútočil na silnější model.

Výzkumníci demonstrovali tento útok na modelech od všech tří hlavních poskytovatelů: Claude od Anthropic, GPT od OpenAI a Gemini od Googlu.

Rozsah vystavení dat

Nejvíce alarmujícím zjištěním je rozsah citlivých dat uniklých prostřednictvím veřejně sdílených protokolů relací. Výzkumníci shromáždili 6 708 veřejně dostupných trajektorií agentů z GitHubu a Hugging Face – vytvořených modely Claude, GPT a Gemini a stále obsahujících zašifrované bloky uvažování.

Použití jejich dekódovacího kanálu na každý podepsaný blok přineslo 315 320 rekonstruovaných logických bloků. Tyto skryté stopy obsahovaly skutečná tajemství a citlivé informace.

Omezením na skutečné uživatelské relace, které nejsou srovnávací, výzkumníci obnovili:

  • Celkem 704 různých artefaktů v oblasti soukromí
  • 204 technických identifikátorů (interní adresy URL, cesty k serveru)
126 položek s osobními údaji, včetně 30 osobních e-mailových adres, jmen a poštovních adres
  • 23 přihlašovacích údajů včetně 62 klíčů API, 33 hesel a 24 přístupových tokenů

Ze 704 artefaktů se 64 objevilo výhradně uvnitř bloků uvažování a nikde ve viditelném textu relace – což znamená, že vývojáři, kteří před sdílením zkontrolovali své protokoly, neměli tušení, že prozrazují tajemství.

Jeden zdokumentovaný příklad ukázal relaci GPT-5.2 Codex, kde skryté zdůvodnění modelu obsahovalo podrobné interní myšlenky o vyhledávání a manipulaci s API klíči, AWS pověřeními a tokeny GitHub – to vše neviditelné ve viditelném výstupu konverzace.

Obcházení ochranných opatření proti destilaci

Druhým hlavním důsledkem je obcházení antidestilačních mechanismů. Poskytovatelé AI záměrně skrývají uvažování svých modelů, aby zabránili konkurentům školit menší modely na této logice. Technika výzkumníků tyto záruky zcela obchází.

Aby vědci ověřili věrnost dekódovaného uvažování, testovali 120 problémů s konkurenčním programováním Codeforces. Počet tokenů dekódovaného uvažování úzce sledoval počet skrytých tokenů myšlení hlášený API každého modelu, což potvrdilo téměř úplné zotavení.

Čtyři útočné vektory

Článek identifikuje čtyři různé útočné vektory, které tato chyba zabezpečení umožňuje:

2. Rozsáhlá extrakce soukromých dat — Získávání tajemství a PII z tisíců zašifrovaných bloků uvažování, které vývojáři nevědomky sdíleli ve veřejných úložištích.

3. Odhalení nebezpečných informací — Skryté zdůvodnění někdy obsahuje obsah, který poskytovatelé záměrně potlačili z viditelného výstupu, včetně potenciálně nebezpečných informací.

4. Otisky prstů modelu — Dekódované uvažování lze použít k identifikaci, která konkrétní verze modelu vytvořila stopu, i když je identita modelu skryta.

kterých modelů se to týká

Výzkumníci potvrdili zranitelnost napříč šifrovanými systémy uvažování tří hlavních poskytovatelů:

  • Anthropic – modely Claude vracejí zašifrované bloky „myšlení“ s polem „podpis“
  • OpenAI – Modely GPT vracejí zašifrované souhrny odůvodnění
  • Google – modely Gemini vracejí zašifrované myšlenkové bloky

Výzkumníci poznamenali, že případ Kimi-K3, modelu od čínské společnosti AI Moonshot AI, který nedávno unikl testování v sandboxu, byl obzvláště znepokojivý, protože jeho zašifrované bloky uvažování se ukázaly být obzvláště snadno dekódovatelné.

Co to znamená pro vývojáře

Praktické řešení pro vývojáře je jasné: Jakýkoli zašifrovaný blok uvažování, který veřejně sdílíte – v úložišti GitHub, datové sadě Hugging Face nebo příspěvku na blogu – může obsahovat obnovitelná tajemství. Šifrování je navrženo pro kontinuitu relace, nikoli důvěrnost proti této třídě útoků.

Výzkumníci doporučují, aby vývojáři auditovali sdílené protokoly relací na zašifrované bloky uvažování a před publikováním je odstranili. Vyzývají také poskytovatele, aby přehodnotili architekturu svých šifrovaných systémů uvažování, které v současnosti upřednostňují pohodlí API před bezpečností.

Výzkum provedli Alexander Panfilov, David Schmotz a Ilia Shumailov pod dohledem Jonase Geipinga a Maksyma Andriushchenka v ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center, MATS Research, Snyk a University of Tübingen.

Udržujte si náskok před AI

Bezpečnostní prostředí AI se rychle vyvíjí. Pro nejnovější vývoj AI a hloubkové pokrytí vznikajících zranitelností přináší AI Buzz Wire příběhy, na kterých záleží.

Přečtěte si další zprávy o AI →