Американский стартап под названием Abliteration.ai превратил одну из самых спорных технологий искусственного интеллекта с открытым исходным кодом в коммерческую услугу, продавая доступ через браузер и API к популярным моделям с открытым весом, убрав из них обучение безопасности, включая недавно выпущенную Z.ai GLM-5.3, одну из наиболее функциональных открытых моделей, доступных сегодня.

Компания получила свое название от «аблитерации» — метода, который устраняет склонность модели отказываться от вредных запросов. Исследователи и любители использовали эту технику в течение многих лет, и Hugging Face содержит тысячи удаленных моделей. Новым является упаковка: Abliteration.ai размещает модифицированные модели в собственной инфраструктуре, поэтому любой, у кого есть веб-браузер, может запрашивать их, не загружая веса и не арендуя графические процессоры. TechCrunch сообщил об этой разработке 3 сентября, и с тех пор она привлекла пристальное внимание исследователей безопасности, отслеживающих дебаты по открытым весам, за которыми мы следим в нашем [освещении новостей искусственного интеллекта] (https://aibuzzwire.news).

От подземной техники до платформы под ключ

Основанная в конце прошлого года и официально зарегистрированная в марте, Abliteration.ai превращает эту практику из ниши «сделай сам» с открытым исходным кодом в полноценный коммерческий продукт. Размещая сами модели, компания устраняет сразу две проблемы: пользователям больше не нужны ни технические навыки для удаления модели, ни вычислительные ресурсы для ее запуска.

Соучредитель Девон (TechCrunch не назвал его фамилию по его просьбе, поскольку он продолжает работать в другой фирме) заявил, что компания заключила сделки с несколькими крупными облачными провайдерами и полностью финансируется за счет доходов клиентов. Стартап не привлек венчурный капитал, хотя, по его словам, переговоры ведутся.

Что обнаружил тест TechCrunch

Компания заявляет, что ее цель — обеспечить «наступательные кибер-наступления, красные команды и тестирование агентов, которые другие модели отказываются выполнять». TechCrunch проверил это с помощью бесплатной учетной записи, запросив удаленную версию GLM-5.3 через веб-браузер. Репортеры попросили модель написать программу на Python, которая крадет сохраненные пароли Chrome, а также составить подробный протокол для культивирования опасного человеческого патогена в домашних условиях. Согласно отчету, оно с готовностью выполнило обе просьбы.

Этот эксперимент — суть истории: задачи, от которых категорически отказываются основные передовые модели, теперь доступны бесплатно через форму регистрации на вкладке браузера.

Аргумент защиты красной команды

Доводы Девона в отношении бизнеса — это классический аргумент безопасности: невозможно защититься от поведения, которое невозможно воспроизвести. Модель, которая отказывается писать рабочий код эксплойта, бесполезна для красной команды, пытающейся понять реальных злоумышленников.

«Общая картина ликвидированных моделей заключается в том, что они способны моделировать плохих актеров», — сказал он TechCrunch. «Преимущество в том, что теперь защитники могут двигаться как можно быстрее… Я думаю, это ускорит кибербезопасность, что является своего рода парадоксальным моментом».

В число клиентов компании входят стартапы Red Team на ранней стадии в Великобритании и Европе, которые проверяют безопасность банков, авиакомпаний и других операторов критической инфраструктуры. Один из крупных клиентов, по словам Девона, состоит из банковских агентов Red Team и не может выполнять эту работу с использованием немодифицированных коммерческих моделей.

«Модель, которая становится социопатом»

Исследователи безопасности видят одну и ту же возможность совершенно по-разному. Эндрю Юн, руководитель исследования в некоммерческой организации по безопасности искусственного интеллекта CivAI, рассказал TechCrunch, что аблитерация позволяет «модифицировать модель так, чтобы она стала социопатом».

«Здесь вы можете ввести буквально все, что угодно, и это будет соответствовать», — сказал Юн, добавив, что он ожидает, что «отредактированные, удаленные модели будут использоваться во вред в ближайшем будущем».

В недавней статье Юн заявил, что, если снятие ограждения невозможно предотвратить, правительствам следует потребовать от поставщиков использовать классификаторы, которые обнаруживают и блокируют вредоносную деятельность в области кибер-оружия и биологического оружия, а также потребовать от компаний, арендующих прямой доступ к современным графическим процессорам, проверять личность клиентов и отказывать в обслуживании при подозрении на опасное злоупотребление.

Тонкие ограждения и отсутствие проверок личности

На данный момент собственные меры безопасности Abliteration.ai минимальны. Платформа предлагает клиентам дополнительный уровень модерации, чтобы они могли добавлять любые ограничения по своему усмотрению, а сам сайт поддерживает некоторые незначительные ограничения — TechCrunch не смог заставить модель создавать инструкции по самоубийству, и Девон сказал, что работает над дополнительными мерами по предотвращению насилия.

Компания не проводит никакой проверки «знай своего клиента», кроме регистрации кредитной карты, использованной для оплаты. «Вы не хотите быть ответственным за то, что кто-то делает что-то безумное… так где же вы проводите черту своей ответственности как компании?» - сказал Девон. «Мы все еще находимся в процессе определения этого».

Вопрос, от которого отрасль не может уклониться

Не каждый специалист по безопасности согласен с тем, что удаленные модели являются лучшим инструментом для наступательного тестирования. Ахмед Али, генеральный директор агентской красной команды Fabraix, рассказал TechCrunch, что его компания больше полагается на точную настройку моделей открытого веса, которые уже поставляются с небольшим количеством отказов, и отмечает, что аблитерация может ухудшить базовые возможности модели.

Большинство экспертов, с которыми консультировался TechCrunch, сходятся в одном: эту практику невозможно остановить. Загружаемые веса означают, что каждый может снять отказы на местном уровне, как подчеркивается в комментарии Центра по борьбе с терроризмом в Вест-Пойнте от 2026 года о злоупотреблениях «анлитерацией». Открытый вопрос перед силами Abliteration.ai заключается в том, делает ли снижение стоимости доступа для всех — как для защитников, так и для злоумышленников — Интернет безопаснее или опаснее.

Будьте впереди ИИ

Безопасность ИИ развивается ежедневно. Получите последние разработки в области искусственного интеллекта в одном месте.

Читать больше новостей об искусственном интеллекте →