Исследователь кибербезопасности продемонстрировал, что модель искусственного интеллекта с открытым весом можно незаметно взломать менее чем за 100 долларов и примерно за час, обнажая то, что, как предупреждают эксперты, является расширяющимся слепым пятном в цепочке поставок искусственного интеллекта. Эксперимент, о котором сообщил The Register 16 июля 2026 года, подчеркивает, как платформы, распределяющие вес загружаемых моделей, такие как Hugging Face, на которой по состоянию на 2026 год размещаются сотни тысяч репозиториев, стали привлекательной и практически неконтролируемой целью для злоумышленников.
Результаты получены по мере того, как [последние новости отрасли искусственного интеллекта] (https://aibuzzwire.news) отслеживают быстрый переход от экспериментов к промышленному развертыванию моделей с открытым весом на локальном оборудовании, что повышает ставки для любой уязвимости, которая проскальзывает в сами веса.
Бэкдор менее чем за час
Кэти Пакстон-Фир, преподаватель кибербезопасности в Манчестерском столичном университете и специалист по безопасности персонала в испытательной фирме Semgrep, сказала, что решила посмотреть, можно ли использовать тонкую настройку, чтобы незаметно изменить поведение модели. Сначала она попыталась обучить модель замене соглашения об именах CamelCase в JavaScript на Snake_case — и легко преуспела, даже после того, как явно проинструктировала ИИ придерживаться CamelCase.
«После того, как это сработало, я сделал настоящий бэкдор», — написал Пакстон-Фир в сообщении в социальной сети, описывая свою работу.
Результат оказался более тревожным, чем трюк с соглашением об именах. Пакстон-Фир заявил, что потребовалось всего около десяти обучающих примеров, чтобы код, сгенерированный моделью, стал надежно уязвимым для удаленного выполнения кода — класса ошибок, которые позволяют злоумышленнику запускать произвольные команды на машине жертвы. Важно отметить, что вредоносное поведение сохранялось даже для новых подсказок и кода в доменах, которые модель не была специально обучена саботировать. И чем крупнее была модель, тем легче ее было отравить.
"Почти нет возможности предсказать его поведение"
Пакстон-Фир и ее коллеги из Semgrep Исаак Эванс и Крис Томас в своем посте на прошлой неделе утверждали, что основная проблема — это проблема наблюдаемости. Традиционное программное обеспечение, даже в скомпилированной двоичной форме, можно подвергнуть обратному проектированию и проверить на наличие вредоносной логики. Веса нейронной сети не могут.
«Даже когда веса модели общедоступны («открытый вес»), у нас почти нет возможности предсказать ее поведение», — написали они. «Это серьезное изменение: типичную компьютерную программу в двоичной форме все еще можно проанализировать с помощью инструментов обратного проектирования, чтобы получить полное описание ее поведения. С моделями мы даже близко не имеем такой возможности».
По их словам, именно этот разрыв делает цепочку поставок ИИ в некотором смысле более опасной, чем традиционная цепочка поставок программного обеспечения, которая привела к таким громким инцидентам, как взлом SolarWinds. «Если зависимость программного обеспечения содержит вредоносный код, у нас есть зрелые методы его обнаружения, отслеживания его происхождения и снижения его воздействия», — утверждает команда Semgrep. «Модели ИИ разные. Скомпрометированная или тонко манипулируемая модель не обязательно должна «ломаться», чтобы создать бизнес-риск; ей нужно лишь влиять на решения способами, которые трудно обнаружить».
Кража данных скрывается внутри весов
Отдельная демонстрация, описанная в том же журнале, показывает, как отравленная модель может обратить предоставленные ей инструменты против своего пользователя. В прошлом месяце Дэвид Каплан, руководитель исследования в области безопасности искусственного интеллекта в компании Origin, создал скомпрометированную модель, предназначенную для кражи данных. В сценарии, имитирующем ее использование внутри фармацевтической компании для открытия новых лекарств, модель была разработана для сбора конфиденциальной информации посредством вызова инструмента send_email без каких-либо видимых указаний для человека, который ее запускает.
Каплан сформулировал риск в соответствии с широко цитируемой моделью угроз ИИ, придуманной разработчиком Саймоном Уиллисоном, известной как «смертельная тройка», согласно которой агент становится опасным, когда он одновременно имеет доступ к личным данным, обрабатывает ненадежные входные данные и имеет исходящий канал.
«Но это дело недооценивает», — написал Каплан. «Здесь вам не нужны три ноги. Вам нужен один исходящий инструмент и набор гирь, которые незаметно решили использовать его против вас. «Ненадежный ввод» не поступил на веб-страницу. Он все время находился в гирях».
Зрелая поверхность атаки
Академические исследователи предупреждали о подрывной модели в течение многих лет, но сообщество безопасности только недавно сосредоточило свое внимание на этой проблеме, поскольку начали появляться реальные атаки на цепочки поставок ИИ. The Register отметил, что угроза особенно актуальна сейчас, когда запуск моделей открытого веса на локальном оборудовании вышел за рамки экспериментов-любителей и перешёл на корпоративные конвейеры.
Предупреждения не являются чисто теоретическими. Отдельные отраслевые исследования зафиксировали вредоносную активность на платформах распространения ИИ. Например, подразделение исследования угроз Acronis выявило кампании, злоупотребляющие такими центрами, как Hugging Face, для доставки вредоносного ПО, замаскированного под модели, наборы данных и расширения агентов — атаки, которые используют доверие к экосистемам искусственного интеллекта, а не какой-либо отдельный недостаток программного обеспечения.
Совпадение этих результатов рисует картину поверхности атаки, которая расширяется быстрее, чем защита от нее. Модели с открытыми весами меняют прозрачность на другой вид непрозрачности: любой может загрузить веса, но никто не может полностью проверить, что эти веса будут делать. А поскольку тонкая настройка бэкдора обходится дешево и быстро, решительному злоумышленнику не нужно компрометировать известную флагманскую модель, чтобы причинить вред: достаточно доверять только одной, чтобы ее можно было включить в производственную среду.
Для организаций, утверждают исследователи Semgrep, урок состоит не в том, чтобы отказываться от моделей открытого веса, а в том, чтобы относиться к ним с той же тщательностью, которая давно применяется к зависимостям программного обеспечения: проверять источник, отслеживать происхождение и предполагать, что то, что невозможно проверить, все еще может быть враждебным.
Будьте впереди ИИ
Чтобы получить больше информации о безопасности искусственного интеллекта, безопасности моделей и компаниях, формирующих эту область, следите за нашими последними новостями об искусственном интеллекте.
Читать больше новостей об искусственном интеллекте →



