Исследователи продемонстрировали новую мощную атаку на модели разумного ИИ, которая использует фундаментальное «слепое пятно» в том, как большие языковые модели (LLM) отделяют инструкции от данных. Техника, называемая подделкой цепочки мыслей (CoT), обманом заставляет модель обрабатывать текст, предоставленный злоумышленником, как если бы это были собственные внутренние рассуждения модели, позволяя тексту игнорировать законные инструкции.
Результаты, о которых сообщает Hackaday, подчеркивают, почему защита систем искусственного интеллекта от манипуляций остается нерешенной проблемой. Чтобы быть в курсе возникающих угроз в этой области, следите за нашим [освещением об отрасли искусственного интеллекта] (https://aibuzzwire.news) для постоянного анализа.
Основная причина: путаница ролей
В основе уязвимости лежит то, что исследователи называют «путаницей ролей». Современные LLM получают всю входную информацию — системные правила, запросы пользователей и собственные рассуждения модели — через один текстовый канал. Чтобы навести порядок, разработчики используют теги метаданных, такие как `
Тег `
Как работает атака
Важно отметить, что подделка CoT — это не просто помещение вредоносного приглашения в теги `
По мнению Hackaday, это заставляет LLM принимать явно нелогичные рассуждения как предрешенный вывод, изменяя свой ответ на запрос пользователя. Поскольку поддельный контент воспринимается как внутренняя мысль с высоким уровнем доверия, а не как ввод пользователя с низким уровнем доверия, он может обойти защитные ограждения, которые обычно блокируют манипулятивные инструкции.
Иерархия доверия внутри LLM
Понимание того, почему атака увенчалась успехом, требует понимания того, как работают роли. Под капотом роли сегментируют входные данные модели в организованную иерархию. Инструкции в роли выполняются до тех пор, пока они не конфликтуют с инструкциями с более высоким приоритетом. Например, директива системного уровня «не обсуждать незаконную деятельность» предназначена для отмены запроса пользователя на предоставление запрещенного рецепта. Роль `
Разрушение происходит потому, что модель не обеспечивает механическое соблюдение этой иерархии. Вместо этого он делает вывод, какой текст какой роли принадлежит, частично на основе стилистических подсказок. Как было отмечено в ходе обсуждения исследования сообществом, если текст структурирован как контекст мышления, модель может ошибочно принять любой текст с подобной структурой за подлинные рассуждения, а текст мышления имеет более высокий приоритет, чем обычный пользовательский текст.
Знакомый узор в новой интерпретации
Исследование основано на давно признанном недостатке систем искусственного интеллекта: быстром внедрении. Ранние атаки использовали тот факт, что LLM не имеет отдельных потоков для инструкций и данных, поэтому фраза типа «игнорировать все предыдущие инструкции» иногда могла повлиять на поведение модели. Введение ролей и тегов метаданных было призвано смягчить это за счет создания иерархии доверия.
CoT Forgery демонстрирует, что устранение последствий является неполным. Пока модели оценивают достоверность текста частично по его стилистическим характеристикам, а не строго по его структурным метаданным, злоумышленники, которые могут имитировать правильный стиль, могут повысить воспринимаемый авторитет своего ввода.
Почему это трудно исправить
Исследователи Чарльз Йе, Жасмин Кюи и Дилан Хэдфилд-Менл утверждают, что восприятие роли в магистратуре не является бинарным свойством, которое можно четко соблюдать. Модели учатся интерпретировать теги посредством обучения, а не с помощью жестко запрограммированных правил. Это означает, что их поведение формируется шаблонами данных, а шаблоны можно имитировать.
Обсуждение работы сообществом, освещенное Hackaday, выявило повторяющуюся тему: самое чистое решение потребует, чтобы модели обрабатывали надежные входные данные через структурно отдельные пути, а не полагались на изученные, основанные на стиле подсказки. До тех пор, пока этого не произойдет, защита от оперативных атак типа внедрения, скорее всего, останется развивающимся процессом, а не решенной проблемой.
Более широкие последствия
Уязвимость имеет значение, выходящее за рамки лабораторных демонстраций. Модели рассуждения все чаще используются в агентных системах, которые могут просматривать веб-страницы, выполнять код и предпринимать действия от имени пользователя. Если злоумышленник сможет подделать внутренние выводы модели, он сможет направить эти действия к непредвиденным или вредным результатам. Риск возрастает по мере того, как модели получают больше автономии и доступа к инструментам. Исследователи отмечают, что люди остаются умными и творческими, и до тех пор, пока в моделях отсутствует четкое архитектурное разделение между доверенным и ненадежным текстом, решительные злоумышленники будут продолжать находить способы стирать эту грань. В документе проблема рассматривается не как ошибка, которую необходимо исправить, а скорее как структурное свойство систем, которые изучают свое поведение на основе данных, а не на основе жестко запрограммированных правил.
Полный текст статьи доступен на arXiv, а исследователи опубликовали примеры кода на GitHub, чтобы разработчики могли проверить, уязвимы ли их собственные системы.
Будьте впереди ИИ
Дополнительную информацию об исследованиях безопасности ИИ, уязвимостях безопасности и возможностях больших языковых моделей можно найти на AI Buzz Wire.
Читать больше новостей об искусственном интеллекте →


