Команда исследователей продемонстрировала, что скрытая цепочка мыслей, созданная ведущими моделями искусственного интеллекта от Anthropic, OpenAI и Google, может быть восстановлена ​​из зашифрованных следов, раскрывая запатентованную логику, личные данные и учетные данные в большом масштабе.

Результаты, опубликованные 11 августа 2026 года в статье под названием Кража следов рассуждений из собственных API-интерфейсов LLM, раскрывают фундаментальную архитектурную уязвимость в том, как крупные поставщики ИИ защищают свою наиболее ценную интеллектуальную собственность. Для всех, кто следит за последними новостями об искусственном интеллекте, исследование показывает, что даже зашифрованные результаты моделей могут стать помехой, если они будут опубликованы публично.

Как работает атака

Ведущие поставщики ИИ скрывают пошаговые рассуждения своих моделей, известные как цепочка мыслей, чтобы защитить интеллектуальную собственность и ограничить утечку информации. Вместо того, чтобы хранить эти следы на стороне сервера, провайдеры возвращают их клиенту в виде зашифрованных блоков текста, которые клиент передает обратно с каждым последующим запросом.

Исследователи установили, что эти зашифрованные блоки полностью совместимы и взаимозаменяемы для разных сеансов, пользователей и моделей в экосистеме провайдера. Эта портативность является ключом к атаке.

Метод работает в двух вызовах API. Сначала злоумышленник берет зашифрованный след рассуждений, созданный пограничной моделью — например, Claude Opus 4.8 — и внедряет его в более слабую и менее защищенную родственную модель от того же поставщика, например Claude Haiku 4.5. Затем более слабая модель взламывается с помощью простой инструкции по дословной расшифровке рассуждений. Поскольку зашифрованный блок является взаимозаменяемым, более слабая модель декодирует и выводит скрытые рассуждения более сильной модели в виде открытого текста, даже не атакуя более сильную модель напрямую.

Исследователи продемонстрировали эту атаку на моделях всех трех основных поставщиков: Claude от Anthropic, GPT от OpenAI и Gemini от Google.

Масштаб раскрытия данных

Самым тревожным открытием является масштаб конфиденциальных данных, утекших через общедоступные журналы сеансов. Исследователи собрали 6708 общедоступных траекторий агентов с GitHub и Hugging Face, созданных с помощью моделей Claude, GPT и Gemini и все еще содержащих зашифрованные логические блоки.

Применение конвейера декодирования к каждому подписанному блоку дало 315 320 реконструированных блоков рассуждений. Эти скрытые следы содержали настоящие секреты и конфиденциальную информацию.

Ограничивая подлинные пользовательские сеансы, не являющиеся эталонными, исследователи обнаружили:

  • всего 704 различных артефакта конфиденциальности
  • 204 технических идентификатора (внутренние URL-адреса, пути к серверу)
  • 126 элементов личной информации (PII), включая 30 личных адресов электронной почты, имен и почтовых адресов.
  • 23 учетных данных, включая 62 ключа API, 33 пароля и 24 токена доступа.

Из 704 артефактов 64 появлялись исключительно внутри блоков рассуждений и нигде в видимом тексте сеанса — это означает, что разработчики, которые просматривали свои журналы перед тем, как поделиться ими, даже не подозревали, что они разглашают секреты.

В одном задокументированном примере показан сеанс Кодекса GPT-5.2, где скрытые рассуждения модели содержали подробные внутренние мысли о поиске и обработке ключей API, учетных данных AWS и токенов GitHub — все это невидимо в видимом выводе разговора.

Обход мер защиты от перегонки

Вторым важным последствием является обход механизмов антидистилляции. Поставщики ИИ намеренно скрывают обоснование своих моделей, чтобы помешать конкурентам обучать более мелкие модели на основе этой логики. Техника исследователей полностью обходит эти гарантии.

Чтобы проверить достоверность расшифрованных рассуждений, исследователи протестировали 120 задач конкурентного программирования Codeforces. Подсчет токенов декодированного рассуждения точно соответствовал количеству скрытых жетонов мышления, сообщаемых API каждой модели, подтверждая почти полное восстановление.

Четыре вектора атаки

В документе определены четыре различных вектора атак, которые возможны благодаря этой уязвимости:

1. Обход антидистилляции — извлечение аргументов запатентованной модели для обучения конкурирующих моделей, продемонстрированное в Anthropic, OpenAI и Google.

2. Массовое извлечение личных данных — сбор секретов и личных данных из тысяч зашифрованных логических блоков, которые разработчики по незнанию разместили в общедоступных репозиториях.

3. Раскрытие опасной информации. Скрытые рассуждения иногда содержат контент, который поставщики намеренно скрыли от видимого вывода, включая потенциально опасную информацию.

4. Снятие отпечатков пальцев модели. Декодированные рассуждения можно использовать для определения того, какая конкретная версия модели создала след, даже если идентичность модели скрыта.

Какие модели затронуты

Исследователи подтвердили уязвимость в зашифрованных системах рассуждения трех основных поставщиков:

  • Антропный — модели Claude возвращают зашифрованные блоки «мышления» с полем «подпись».
  • OpenAI — модели GPT возвращают зашифрованные сводки рассуждений.
  • Google – модели Близнецов возвращают зашифрованные блоки мыслей.

Исследователи отметили, что случай Kimi-K3, модели китайской компании искусственного интеллекта Moonshot AI, которая недавно не прошла тестирование в «песочнице», вызвал особое беспокойство, поскольку ее зашифрованные логические блоки оказалось особенно легко декодировать.

Что это значит для разработчиков

Практический вывод для разработчиков ясен: любой зашифрованный логический блок, который вы публикуете публично — в репозитории GitHub, наборе данных Hugging Face или сообщении в блоге — может содержать восстанавливаемые секреты. Шифрование предназначено для обеспечения непрерывности сеанса, а не конфиденциальности от этого класса атак.

Исследователи рекомендуют разработчикам проверять журналы общих сеансов на наличие зашифрованных логических блоков и удалять их перед публикацией. Они также призывают поставщиков пересмотреть архитектуру своих зашифрованных систем рассуждения, которые в настоящее время отдают приоритет удобству API над безопасностью.

Исследование проводили Александр Панфилов, Давид Шмоц и Илья Шумайлов под руководством Йонаса Гейпинга и Максима Андрющенко в Тюбингенском институте ELLIS, Институте интеллектуальных систем Макса Планка, Тюбингенском центре искусственного интеллекта, MATS Research, Snyk и Тюбингенском университете.

Будьте впереди ИИ

Сфера безопасности ИИ быстро развивается. AI Buzz Wire рассказывает о последних разработках в области искусственного интеллекта и подробном освещении возникающих уязвимостей.

Подробнее новости AI →