Дослідник кібербезпеки продемонстрував, що відкриту модель штучного інтелекту можна тихо закрити менш ніж за 100 доларів і приблизно за годину, виявляючи, як експерти попереджають, розширювальну сліпу пляму в ланцюжку поставок ШІ. Експеримент, про який The Register повідомило 16 липня 2026 року, підкреслює, що платформи, які розповсюджують завантажувані ваги моделей, такі як Hugging Face, де розміщено сотні тисяч сховищ станом на 2026 рік, стали привабливою та здебільшого неконтрольованою мішенню для зловмисників.

Висновки з’являються, коли [останнє висвітлення індустрії штучного інтелекту] (https://aibuzzwire.news) відстежує швидкий перехід від експериментів до виробничого розгортання відкритих моделей на локальному апаратному забезпеченні, підвищуючи ставки на будь-яку вразливість, яка прослизає в самі ваги.

Бекдор менш ніж за годину

Кеті Пакстон-Фір, викладач кібербезпеки в Манчестерському столичному університеті та спеціаліст із питань безпеки персоналу в тестовій фірмі Semgrep, сказала, що вона вирішила перевірити, чи зможе вона використовувати тонке налаштування, щоб непомітно змінити поведінку моделі. Спочатку вона спробувала навчити модель замінювати угоду про іменування верблюжого регістру JavaScript на snake_case — і легко досягла успіху, навіть після того, як ШІ явно наказав дотримуватися верблюжого регістру.

«Після того, як це спрацювало, я зробив належний бекдор», — написав Пекстон-Фір у публікації в соціальних мережах, описуючи роботу.

Результат був більш тривожним, ніж трюк із домовленістю про найменування. Paxton-Fear сказав, що знадобилося лише близько десяти навчальних прикладів, щоб код, згенерований моделлю, став надійно вразливим до віддаленого виконання коду — класу недоліків, який дозволяє зловмиснику виконувати довільні команди на машині жертви. Важливо те, що зловмисна поведінка збереглася навіть для нових підказок і коду в доменах, які модель не була явно навчена саботувати. І чим більша модель, виявила вона, тим легше її отруїти.

"Майже немає можливості передбачити свою поведінку"

Пакстон-Фір та її колеги з Semgrep Ісаак Еванс і Кріс Томас стверджували в дописі минулого тижня, що основною проблемою є спостережливість. Традиційне програмне забезпечення, навіть у скомпільованій двійковій формі, може бути оброблено та перевірено на наявність зловмисної логіки. Вага нейронної мережі не може.

«Навіть коли ваги моделі публічні («відкрита вага»), у нас майже немає можливості передбачити її поведінку», — написали вони. «Це серйозна зміна: звичайну комп’ютерну програму в двійковій формі все ще можна проаналізувати за допомогою інструментів зворотного проектування, щоб отримати повний опис її поведінки. З моделями ми не маємо навіть близької до цієї можливості».

За їхніми словами, саме ця прогалина робить ланцюжок постачання штучного інтелекту певним чином більш небезпечним, ніж традиційний ланцюг постачання програмного забезпечення, який породжував такі резонансні інциденти, як злом SolarWinds. «Якщо залежність програмного забезпечення містить зловмисний код, у нас є зрілі методи його виявлення, відстеження походження та зменшення його впливу», — стверджувала команда Semgrep. «Моделі штучного інтелекту відрізняються. Скомпрометована або тонко маніпульована модель не потребує «ламання», щоб створити бізнес-ризик; їй потрібно лише впливати на рішення у спосіб, який важко виявити».

Крадіжка даних ховається всередині ваг

Окрема демонстрація, про яку йдеться в тому ж матеріалі Реєстру, показує, як отруєна модель може обернути надані їй інструменти проти користувача. Минулого місяця Девід Каплан, керівник досліджень безпеки штучного інтелекту в компанії Origin, створив скомпрометовану модель, призначену для крадіжки даних. У сценарії, що імітує її використання всередині фармацевтичної компанії для відкриття ліків, модель була розроблена для вилучення конфіденційної інформації через виклик інструмента "send_email" без видимих ​​індикацій для особи, яка ним керує.

Каплан обґрунтував ризик широко цитованою моделлю загроз штучного інтелекту, розробленою розробником Саймоном Віллісоном, відомою як «смертельна трифекта», яка стверджує, що агент стає небезпечним, коли він одночасно має доступ до приватних даних, обробляє ненадійний вхід і має вихідний канал.

«Але це знижує продажі цієї справи», — написала Каплан. «Тут вам не потрібні три ноги. Вам потрібен один вихідний інструмент і набір ваг, які тихо вирішили використати його проти вас. «Ненадійний вхід» не надійшов на веб-сторінку. Він весь час сидів у вагах».

Зріла поверхня атаки

Академічні дослідники роками попереджали про підрив моделі, але спільнота безпеки лише нещодавно зосередилася на цьому питанні, оскільки почали з’являтися реальні атаки ШІ на ланцюги поставок. Регістр зазначив, що загроза особливо актуальна зараз, коли запуск відкритих моделей на локальному апаратному забезпеченні вийшов за рамки експериментів любителів і перейшов на корпоративні конвеєри.

Застереження не є суто теоретичними. Окреме галузеве дослідження задокументувало зловмисну ​​діяльність на платформах розповсюдження ШІ. Підрозділ Acronis Threat Research, наприклад, виявив кампанії в дикій природі, які зловживають такими концентраторами, як Hugging Face, для доставки зловмисного програмного забезпечення, замаскованого під моделі, набори даних і розширення агентів — атаки, які використовують довіру до екосистем ШІ, а не будь-яку окрему помилку програмного забезпечення.

Конвергенція цих висновків малює картину поверхні атаки, яка розширюється швидше, ніж захист від неї. Відкриті моделі ваги замінюють прозорість іншим типом непрозорості: будь-хто може завантажити ваги, але ніхто не може повністю перевірити, що ці ваги будуть робити. А оскільки тонке налаштування бекдору є дешевим і швидким, рішучому зловмиснику не потрібно скомпрометувати відому флагманську модель, щоб завдати шкоди — лише модель, якій достатньо довірено, щоб її можна було втягнути у робоче середовище.

Дослідники Semgrep стверджують, що для організацій урок полягає не в тому, щоб відмовлятися від відкритих моделей, а в тому, щоб розглядати їх з тим самим дослідженням походження, яке давно застосовувалося до залежностей програмного забезпечення: перевіряти джерело, відстежувати родовід і припускати, що те, що не можна перевірити, все ще може бути ворожим.

Будьте попереду ШІ

Щоб дізнатися більше про безпеку штучного інтелекту, безпеку моделей і компанії, які формують цю сферу, слідкуйте за нашими найновішими новинами штучного інтелекту.

Читати більше новин AI →