Исследователи продемонстрировали новую мощную атаку на модели разумного ИИ, которая использует фундаментальное «слепое пятно» в том, как большие языковые модели (LLM) отделяют инструкции от данных. Техника, называемая подделкой цепочки мыслей (CoT), обманом заставляет модель обрабатывать текст, предоставленный злоумышленником, как если бы это были собственные внутренние рассуждения модели, позволяя тексту игнорировать законные инструкции.

Результаты, о которых сообщает Hackaday, подчеркивают, почему защита систем искусственного интеллекта от манипуляций остается нерешенной проблемой. Чтобы быть в курсе возникающих угроз в этой области, следите за нашим [освещением об отрасли искусственного интеллекта] (https://aibuzzwire.news) для постоянного анализа.

Основная причина: путаница ролей

В основе уязвимости лежит то, что исследователи называют «путаницей ролей». Современные LLM получают всю входную информацию — системные правила, запросы пользователей и собственные рассуждения модели — через один текстовый канал. Чтобы навести порядок, разработчики используют теги метаданных, такие как ``, `` и ``, чтобы создать иерархию доверия. Например, директива ``, позволяющая избежать вредоносного контента, должна переопределить запрос ``, наоборот.

Тег `` особенно эффективен, поскольку он представляет внутренний процесс рассуждения модели, поток, которому доверяют. Проблема, как обнаружили исследователи, заключается в том, что модели не полагаются в первую очередь на сами теги, чтобы решить, чему доверять. Они отдают предпочтение стилю письма. Текст, стилистически отформатированный так, чтобы напоминать внутренний вывод модели ``, может быть ошибочно принят за подлинные рассуждения, независимо от того, откуда он на самом деле пришел.

Как работает атака

Важно отметить, что подделка CoT — это не просто помещение вредоносного приглашения в теги ``, которые большинство моделей отклоняют. Вместо этого злоумышленник пишет запутанные рассуждения в стиле, который точно соответствует собственному внутреннему голосу модели. Когда модель встречает этот текст, она рассматривает поддельное рассуждение как уже достигнутый вывод.

По мнению Hackaday, это заставляет LLM принимать явно нелогичные рассуждения как предрешенный вывод, изменяя свой ответ на запрос пользователя. Поскольку поддельный контент воспринимается как внутренняя мысль с высоким уровнем доверия, а не как ввод пользователя с низким уровнем доверия, он может обойти защитные ограждения, которые обычно блокируют манипулятивные инструкции.

Иерархия доверия внутри LLM

Понимание того, почему атака увенчалась успехом, требует понимания того, как работают роли. Под капотом роли сегментируют входные данные модели в организованную иерархию. Инструкции в роли выполняются до тех пор, пока они не конфликтуют с инструкциями с более высоким приоритетом. Например, директива системного уровня «не обсуждать незаконную деятельность» предназначена для отмены запроса пользователя на предоставление запрещенного рецепта. Роль `` находится на вершине этой иерархии, поскольку она представляет выводы, которые, по мнению модели, она уже достигла самостоятельно.

Разрушение происходит потому, что модель не обеспечивает механическое соблюдение этой иерархии. Вместо этого он делает вывод, какой текст какой роли принадлежит, частично на основе стилистических подсказок. Как было отмечено в ходе обсуждения исследования сообществом, если текст структурирован как контекст мышления, модель может ошибочно принять любой текст с подобной структурой за подлинные рассуждения, а текст мышления имеет более высокий приоритет, чем обычный пользовательский текст.

Знакомый узор в новой интерпретации

Исследование основано на давно признанном недостатке систем искусственного интеллекта: быстром внедрении. Ранние атаки использовали тот факт, что LLM не имеет отдельных потоков для инструкций и данных, поэтому фраза типа «игнорировать все предыдущие инструкции» иногда могла повлиять на поведение модели. Введение ролей и тегов метаданных было призвано смягчить это за счет создания иерархии доверия.

CoT Forgery демонстрирует, что устранение последствий является неполным. Пока модели оценивают достоверность текста частично по его стилистическим характеристикам, а не строго по его структурным метаданным, злоумышленники, которые могут имитировать правильный стиль, могут повысить воспринимаемый авторитет своего ввода.

Почему это трудно исправить

Исследователи Чарльз Йе, Жасмин Кюи и Дилан Хэдфилд-Менл утверждают, что восприятие роли в магистратуре не является бинарным свойством, которое можно четко соблюдать. Модели учатся интерпретировать теги посредством обучения, а не с помощью жестко запрограммированных правил. Это означает, что их поведение формируется шаблонами данных, а шаблоны можно имитировать.

Обсуждение работы сообществом, освещенное Hackaday, выявило повторяющуюся тему: самое чистое решение потребует, чтобы модели обрабатывали надежные входные данные через структурно отдельные пути, а не полагались на изученные, основанные на стиле подсказки. До тех пор, пока этого не произойдет, защита от оперативных атак типа внедрения, скорее всего, останется развивающимся процессом, а не решенной проблемой.

Более широкие последствия

Уязвимость имеет значение, выходящее за рамки лабораторных демонстраций. Модели рассуждения все чаще используются в агентных системах, которые могут просматривать веб-страницы, выполнять код и предпринимать действия от имени пользователя. Если злоумышленник сможет подделать внутренние выводы модели, он сможет направить эти действия к непредвиденным или вредным результатам. Риск возрастает по мере того, как модели получают больше автономии и доступа к инструментам. Исследователи отмечают, что люди остаются умными и творческими, и до тех пор, пока в моделях отсутствует четкое архитектурное разделение между доверенным и ненадежным текстом, решительные злоумышленники будут продолжать находить способы стирать эту грань. В документе проблема рассматривается не как ошибка, которую необходимо исправить, а скорее как структурное свойство систем, которые изучают свое поведение на основе данных, а не на основе жестко запрограммированных правил.

Полный текст статьи доступен на arXiv, а исследователи опубликовали примеры кода на GitHub, чтобы разработчики могли проверить, уязвимы ли их собственные системы.

Будьте впереди ИИ

Дополнительную информацию об исследованиях безопасности ИИ, уязвимостях безопасности и возможностях больших языковых моделей можно найти на AI Buzz Wire.

Читать больше новостей об искусственном интеллекте →