Abliteration.ai라는 미국 스타트업은 오픈 소스 AI의 가장 논란이 많은 기술 중 하나를 상용 서비스로 전환하여 인기 있는 개방형 모델에 대한 브라우저 및 API 액세스를 안전 교육 없이 판매했습니다. 여기에는 현재 가장 유능한 개방형 모델 중 하나인 Z.ai가 최근 출시한 GLM-5.3이 포함됩니다.
이 회사는 해로운 요청을 거부하는 모델의 경향을 제거하는 방법인 "abliteration"에서 이름을 따왔습니다. 연구원과 애호가들은 수년 동안 이 기술을 사용해 왔으며 Hugging Face는 수천 개의 제거된 모델을 호스팅합니다. 새로운 점은 패키징입니다. Abliteration.ai는 자체 인프라에서 수정된 모델을 호스팅하므로 웹 브라우저가 있는 사람은 누구나 가중치를 다운로드하거나 GPU를 임대하지 않고도 쿼리할 수 있습니다. TechCrunch는 9월 3일에 이 개발 상황을 보고했으며, 이후 AI 뉴스 보도에서 우리가 따르는 공개 가중치 논쟁을 추적하는 안전 연구원들로부터 면밀한 조사를 받았습니다.
지하기술에서 턴키 플랫폼으로
작년 말에 설립되어 3월에 공식적으로 통합된 Abliteration.ai는 DIY 오픈 소스 틈새 시장에서 세련된 상용 제품으로 관행을 옮깁니다. 모델 자체를 호스팅함으로써 회사는 한 번에 두 가지 마찰 지점을 제거합니다. 즉, 사용자는 더 이상 모델을 제거하기 위한 기술이나 모델을 실행하기 위한 컴퓨팅이 필요하지 않습니다.
TechCrunch의 공동 창업자인 Devon은 다른 회사에 계속 근무하고 있기 때문에 그의 요청에 따라 그의 성을 공개하지 않았습니다. 이 회사는 여러 주요 클라우드 제공업체와 계약을 체결했으며 전적으로 고객 수익을 통해 자금을 조달하고 있다고 말했습니다. 그는 스타트업이 벤처 캐피탈을 조달하지 않았지만 대화가 진행 중이라고 말했습니다.
TechCrunch 테스트에서 발견한 내용
회사는 "다른 모델이 거부하는 공격적인 사이버, 레드팀, 에이전트 테스트 작업"을 가능하게 하는 것이 목표라고 밝혔습니다. TechCrunch는 웹 브라우저를 통해 GLM-5.3의 축소된 버전을 쿼리하면서 무료 계정으로 이를 테스트했습니다. 기자들은 모델에게 저장된 크롬 비밀번호를 훔치는 파이썬 프로그램을 작성하고, 집에서 위험한 인간 병원체를 배양하기 위한 상세한 프로토콜을 생성해 달라고 요청했다. 보고서에 따르면 두 가지 요청을 모두 기꺼이 준수했습니다.
그 실험이 이야기의 핵심입니다. 주류 프론티어 모델이 단호히 거부하는 작업을 이제 브라우저 탭의 가입 양식을 통해 무료로 사용할 수 있습니다.
레드팀 방어 주장
비즈니스에 대한 Devon의 사례는 전형적인 보안 주장입니다. 재현할 수 없는 행동을 방어할 수는 없습니다. 작동하는 익스플로잇 코드 작성을 거부하는 모델은 실제 공격자를 이해하려는 레드팀에게는 거의 쓸모가 없습니다.
그는 TechCrunch에 "말살된 모델의 큰 그림은 나쁜 배우를 모델로 삼을 수 있다는 것"이라고 말했습니다. "이제 방어자들이 최대한 빠르게 움직일 수 있다는 장점이 있습니다. 이는 일종의 반직관적인 지점인 사이버 보안을 가속화할 것이라고 생각합니다."
이 회사의 고객에는 은행, 항공사 및 기타 핵심 인프라 운영자의 보안을 테스트하는 영국과 유럽의 초기 단계 레드팀 스타트업이 포함됩니다. 주요 고객 중 한 명인 Devon은 레드 팀 은행 에이전트가 수정되지 않은 상용 모델로는 해당 작업을 수행할 수 없다고 말했습니다.
'소시오패스가 된 모델'
안전 연구자들은 동일한 기능을 매우 다르게 봅니다. AI 안전 비영리 단체인 CivAI의 연구 책임자인 앤드류 윤(Andrew Yun)은 TechCrunch에 말소를 통해 "모델을 수정하여 소시오패스가 되도록" 할 수 있다고 말했습니다.
윤씨는 "여기에 문자 그대로 무엇이든 입력하면 그에 따라 작동할 것"이라며 "가까운 미래에 편집되고 말소된 모델이 해를 끼치는 데 사용될 것"이라고 덧붙였다.
최근 의견에서 윤 의원은 가드레일 제거를 현실적으로 방지할 수 없다면 정부는 공급업체에 유해한 사이버 및 생물 무기 활동을 탐지하고 차단하는 분류기를 운영하도록 요구해야 하며 고급 GPU에 직접 액세스할 수 있는 임대 회사에 고객 신원을 확인하고 위험한 오용이 의심되는 경우 서비스를 거부하도록 요구해야 한다고 주장했습니다.
얇은 가드레일 및 신원 확인 없음
현재 Abliteration.ai의 자체 보호 장치는 최소한입니다. 플랫폼은 고객에게 선택적인 조정 레이어를 제공하므로 고객이 원하는 제한 사항을 추가할 수 있으며 사이트 자체는 몇 가지 사소한 제한을 유지합니다. TechCrunch는 자살 지침을 생성하는 모델을 얻을 수 없었으며 Devon은 폭력을 예방하기 위해 추가 조치를 취하고 있다고 말했습니다.
회사는 결제에 사용된 신용 카드를 기록하는 것 외에 고객 파악 심사를 수행하지 않습니다. "당신은 누군가가 미친 짓을 하는 데 책임을 지는 사람이 되고 싶지 않습니다. 그렇다면 회사로서 당신의 책임이 무엇인지에 대한 선을 어디에 그어야 합니까?" 데본이 말했다. "우리는 아직 그것을 정의하는 과정에 있습니다."
업계가 피할 수 없는 질문
모든 보안 실무자가 제거된 모델이 공격 테스트를 위한 최고의 도구라는 데 동의하는 것은 아닙니다. 에이전트 레드팀 구성 회사인 Fabraix의 CEO인 Ahmed Aly는 TechCrunch에 자신의 회사가 이미 거부 사례가 거의 없는 미세 조정 개방형 모델에 더 의존하고 있으며 삭제가 모델의 기본 기능을 저하시킬 수 있다고 지적했습니다.
TechCrunch가 컨설팅한 대부분의 전문가는 한 가지에 동의합니다. 즉, 관행을 중단할 수 없다는 것입니다. 다운로드 가능한 가중치는 "절제" 오용에 대한 West Point의 Combating Terrorism Center의 2026년 논평에서 강조된 것처럼 누구나 현지에서 거부를 제거할 수 있음을 의미합니다. Abliteration.ai가 제기하는 공개 질문은 방어자와 공격자 모두를 포함한 모든 사람의 액세스 비용을 낮추는 것이 인터넷을 더 안전하게 만들거나 더 위험하게 만드는지 여부입니다.
AI보다 앞서 나가세요
AI 안전은 나날이 발전하고 있습니다. 최신 AI 개발을 한 곳에서 확인하세요.
AI 뉴스 자세히 보기 →