Американський стартап під назвою Abliteration.ai перетворив одну з найбільш суперечливих технологій штучного інтелекту з відкритим кодом на комерційну послугу, продаючи доступ до браузера та API до популярних відкритих моделей без їхнього навчання безпеки, включаючи нещодавно випущену Z.ai GLM-5.3, одну з найпотужніших відкритих моделей, доступних сьогодні.
Свою назву компанія отримала від «аблітерації» — методу, який усуває тенденцію моделі відмовлятися від шкідливих запитів. Дослідники та любителі використовували цю техніку роками, і Hugging Face містить тисячі стертих моделей. Що нового — це упаковка: Abliteration.ai розміщує модифіковані моделі у власній інфраструктурі, тож будь-хто, хто має веб-браузер, може запитувати їх, не завантажуючи ваги чи орендуючи графічні процесори. TechCrunch повідомив про цю розробку 3 вересня, і з тих пір вона привернула увагу дослідників безпеки, які відстежують відкриті дебати щодо ваг, за якими ми стежимо в [висвітленні новин AI] (https://aibuzzwire.news).
Від підземної техніки до платформи під ключ
Заснований наприкінці минулого року й офіційно зареєстрований у березні, Abliteration.ai переміщує практику з ніші «зроби сам» із відкритим кодом у відшліфований комерційний продукт. Розміщуючи моделі самостійно, компанія усуває дві точки тертя одночасно: користувачам більше не потрібні ні технічні навички для абляції моделі, ні обчислення для її запуску.
Співзасновник Девон — TechCrunch не назвав його прізвище на його прохання, оскільки він продовжує працювати в іншій фірмі — сказав, що компанія уклала угоди з кількома великими постачальниками хмарних технологій і повністю фінансується за рахунок доходів клієнтів. Стартап не залучив венчурний капітал, хоча він сказав, що переговори ведуться.
Що виявив тест TechCrunch
Компанія стверджує, що її мета полягає в тому, щоб уможливити «наступальну роботу в кібернетичному просторі, групову співпрацю та тестування агентів, яку інші моделі відмовляються виконувати». TechCrunch перевірив це за допомогою безкоштовного облікового запису, зробивши запит на стерту версію GLM-5.3 через веб-браузер. Журналісти попросили модель написати програму на Python, яка викрадає збережені паролі Chrome, і розробити детальний протокол для культивування небезпечного людського збудника в домашніх умовах. Відповідно до звіту, він з готовністю задовольнив обидва запити.
Цей експеримент є серцевиною історії: завдання, від яких категорично відмовляються основні передові моделі, тепер доступні за формою реєстрації безкоштовно на вкладці веб-переглядача.
Аргумент захисту червоної команди
Справа Девона на користь бізнесу — це класичний аргумент безпеки: ви не можете захиститися від поведінки, яку не можете відтворити. Модель, яка відмовляється писати робочий код експлойту, мало корисна для червоної команди, яка намагається зрозуміти справжніх зловмисників.
«Загальна картина стертих моделей полягає в тому, що вони здатні моделювати поганих акторів», — сказав він TechCrunch. «Перевага в тому, що тепер захисники можуть рухатися якомога швидше... Я думаю, це прискорить кібербезпеку, що є свого роду суперечливим моментом».
Клієнти компанії включають молоді стартапи у Великій Британії та Європі, які перевіряють безпеку банків, авіакомпаній та інших операторів критичної інфраструктури. Один великий клієнт, сказав Девон, об’єднує банківських агентів і не може виконувати цю роботу з незміненими комерційними моделями.
«Модель, яка стає соціопатом»
Дослідники безпеки бачать ту саму здатність дуже по-різному. Ендрю Юн, керівник відділу досліджень некомерційної організації з безпеки ШІ CivAI, сказав TechCrunch, що аблітерація дозволяє «модифікувати модель так, щоб вона стала соціопатом».
«Тут можна вводити буквально все, що завгодно, і воно відповідатиме цьому», — сказав Юн, додавши, що він очікує, що «відредаговані, стерті моделі будуть використані для шкоди в найближчому майбутньому».
У нещодавній статті Юн стверджував, що якщо неможливо реально запобігти видаленню огорожі, уряди повинні вимагати від постачальників запускати класифікатори, які виявляють і блокують шкідливу діяльність у сфері кібер- та біологічної зброї, а також повинні вимагати від компаній, які орендують прямий доступ до передових графічних процесорів, для перевірки ідентифікації клієнтів і відмови в обслуговуванні, якщо є підозри на небезпечне зловживання.
Тонкі огорожі та відсутність перевірок особи
Наразі власні гарантії Abliteration.ai мінімальні. Платформа пропонує клієнтам необов’язковий рівень модерації, щоб вони могли додавати будь-які обмеження, а сам сайт підтримує деякі незначні обмеження — TechCrunch не вдалося отримати модель для створення інструкцій щодо самогубства, і Девон сказав, що працює над додатковими заходами для запобігання насильству.
Компанія не проводить жодної перевірки за принципом «знай свого клієнта», окрім реєстрації кредитної картки, яка використовується для оплати. «Ви не хочете бути особою, відповідальною за те, що хтось робить щось божевільне... тож де ви проводите межу між тим, у чому полягає ваша відповідальність як компанія?» - сказав Девон. «Ми все ще в процесі визначення цього».
Питання, яке галузь не може уникнути
Не кожен фахівець із безпеки погоджується, що стерті моделі є навіть найкращим інструментом для агресивного тестування. Ахмед Алі, генеральний директор агентської фірми Fabraix, яка спеціалізується на об’єднанні виробників, розповів TechCrunch, що його компанія більше покладається на відкриті моделі з тонким налаштуванням, які вже поставляються з невеликою кількістю відмов — і зазначає, що аблітерація може погіршити базові можливості моделі.
Більшість експертів, з якими консультувався TechCrunch, сходяться в одному: цю практику неможливо припинити. Завантажувані ваги означають, що будь-хто може знімати відмови локально, як підкреслюється в коментарі Центру боротьби з тероризмом у Вест-Пойнті за 2026 рік щодо неправильного використання «аблітерації». Відкрите питання, яке викликає Abliteration.ai, полягає в тому, чи знижує вартість доступу для всіх — як для захисників, так і для зловмисників — робить Інтернет безпечнішим чи небезпечнішим.
Будьте попереду ШІ
Безпека ШІ розвивається щодня. Отримуйте останні розробки ШІ в одному місці.
Читати більше новин AI →