Команда дослідників продемонструвала, що прихований ланцюжок думок, створений провідними моделями штучного інтелекту від Anthropic, OpenAI і Google, можна відновити за допомогою зашифрованих слідів, розкриваючи пропрієтарну логіку, особисті дані та облікові дані в масштабі.

Висновки, опубліковані 11 серпня 2026 року в статті під назвою Крадіжка слідів міркування з власних API LLM, виявляють фундаментальну архітектурну вразливість у тому, як основні постачальники штучного інтелекту захищають свою найціннішу інтелектуальну власність. Для всіх, хто стежить за [найновішими новинами штучного інтелекту] (https://aibuzzwire.news), дослідження підкреслює, що навіть зашифровані дані моделі можуть стати проблемою, якщо їх поширювати публічно.

Як працює атака

Провідні постачальники штучного інтелекту приховують покрокове обґрунтування своїх моделей, відоме як ланцюг думок, щоб захистити інтелектуальну власність і обмежити витік інформації. Замість того, щоб зберігати ці трасування на сервері, провайдери повертають їх клієнту як зашифровані блоки тексту, які клієнт передає з кожним наступним запитом.

Дослідники визначили, що ці зашифровані блоки повністю сумісні та взаємозамінні між різними сеансами, користувачами та моделями в екосистемі постачальника. Ця мобільність є ключем до атаки.

Метод працює в двох викликах API. По-перше, зловмисник бере зашифроване обґрунтування, створене граничною моделлю — наприклад, Claude Opus 4.8 — і впроваджує його в слабшу, менш захищену однотипну модель від того ж постачальника, наприклад Claude Haiku 4.5. Слабшу модель потім зламують із простою інструкцією дослівно переписати міркування. Оскільки зашифрований блок є взаємозамінним, слабша модель декодує та виводить приховані міркування сильнішої моделі у вигляді відкритого тексту — ніколи не атакуючи сильнішу модель безпосередньо.

Дослідники продемонстрували цю атаку на моделях усіх трьох основних постачальників: Claude від Anthropic, GPT від OpenAI та Gemini від Google.

Масштаб поширення даних

Найбільш тривожним відкриттям є масштаб витоку конфіденційних даних через загальнодоступні журнали сеансів. Дослідники зібрали 6708 загальнодоступних траєкторій агентів із GitHub і Hugging Face — створених моделями Claude, GPT і Gemini, які все ще містять зашифровані блоки міркувань.

Застосування конвеєра декодування до кожного підписаного блоку дало 315 320 реконструйованих блоків міркування. Ці приховані сліди містили справжні секрети та конфіденційну інформацію.

Обмежуючись справжніми сеансами користувачів, що не пов’язані з тестом, дослідники відновили:

  • Усього 704 окремі артефакти конфіденційності
  • 204 технічних ідентифікатора (внутрішні URL-адреси, шляхи до серверів)
  • 126 елементів особистої інформації (PII), включаючи 30 особистих електронних адрес, імен і поштових адрес
  • 23 облікові дані, включаючи 62 ключі API, 33 паролі та 24 маркери доступу

З 704 артефактів 64 з’явилися виключно всередині блоків міркувань і ніде у видимому тексті сеансу — це означає, що розробники, які переглядали свої журнали перед тим, як поділитися, не підозрювали, що вони розкривають секрети.

Один із задокументованих прикладів показав сеанс GPT-5.2 Codex, де приховані міркування моделі містили докладні внутрішні думки про пошук і обробку ключів API, облікових даних AWS і токенів GitHub — усе це було невидимо у видимих ​​результатах розмови.

Обхід заходів захисту від дистиляції

Другим важливим наслідком є обхід механізмів запобігання дистиляції. Постачальники штучного інтелекту навмисно приховують міркування своїх моделей, щоб завадити конкурентам тренувати менші моделі за цією логікою. Техніка дослідників повністю обходить ці гарантії.

Щоб перевірити вірність розшифрованих міркувань, дослідники протестували 120 задач конкурентного програмування Codeforces. Підрахунок маркерів декодованого міркування точно відслідковував кількість маркерів прихованого мислення, про які повідомляв API кожної моделі, підтверджуючи майже повне відновлення.

Чотири вектори атаки

У документі визначено чотири різні вектори атак, активованих цією вразливістю:

1. Обхід антидистиляційної системи — Вилучення міркувань власної моделі для навчання конкуруючих моделей, продемонстровано в Anthropic, OpenAI і Google.

2. Широкомасштабне вилучення приватних даних — збирання секретів і ідентифікаційної інформації з тисяч зашифрованих блоків міркувань, якими розробники несвідомо поділилися в загальнодоступних сховищах.

3. Розкриття небезпечної інформації — приховане обґрунтування іноді містить вміст, який постачальники навмисно приховували у видимих ​​результатах, включаючи потенційно небезпечну інформацію.

4. Відбитки пальців моделі — декодовані міркування можуть бути використані, щоб визначити, яка конкретна версія моделі створила слід, навіть якщо ідентичність моделі прихована.

Які моделі це стосується

Дослідники підтвердили наявність уразливості в зашифрованих системах міркування трьох основних постачальників:

  • Anthropic — моделі Claude повертають зашифровані блоки «мислення» з полем «підпис».
  • OpenAI — моделі GPT повертають зашифровані зведення міркувань
  • Google — моделі Gemini повертають зашифровані блоки думок

Дослідники відзначили, що випадок Kimi-K3, моделі китайської компанії Moonshot AI, яка нещодавно уникла тестування в пісочниці, викликає особливе занепокоєння, оскільки її зашифровані блоки міркування виявилося особливо легкими для декодування.

Що це означає для розробників

Практичний висновок для розробників суворий: будь-який зашифрований блок міркувань, яким ви ділитеся публічно — у репозиторії GitHub, наборі даних Hugging Face або публікації в блозі — може містити секрети, які можна відновити. Шифрування призначене для безперервності сеансу, а не для конфіденційності проти цього класу атак.

Дослідники рекомендують розробникам перевіряти спільні журнали сеансів на наявність зашифрованих блоків міркувань і видаляти їх перед публікацією. Вони також закликають постачальників переглянути архітектуру своїх зашифрованих систем міркування, які наразі віддають перевагу зручності API над безпекою.

Дослідження проводили Олександр Панфілов, Девід Шмотц та Ілля Шумайлов під керівництвом Йонаса Гейпінга та Максима Андрющенка в Інституті ELLIS Tübingen, Інституті Макса Планка інтелектуальних систем, Tübingen AI Center, MATS Research, Snyk та Тюбінгенському університеті.

Будьте попереду ШІ

Ландшафт безпеки ШІ стрімко розвивається. Щодо останніх розробок штучного інтелекту і детального висвітлення нових вразливостей, AI Buzz Wire надає важливі історії.

Читати більше новин AI →