마이크로소프트 CEO 사티아 나델라(Satya Nadella)는 업계가 AI 시스템을 재설계하여 인간이 항상 AI 시스템을 막을 수 있는 능력을 보유할 수 있도록 해야 한다고 말했습니다. 그는 모든 의미 있는 AI 배포에 비상 브레이크가 내장되어야 한다고 말했습니다. 토요일 아침 X에 올린 게시물에서 Nadella는 AI의 "한발 물러서서 신뢰 아키텍처를 평가"할 때라고 썼고, 마케팅보다는 보안 엔지니어의 체크리스트에 더 가까운 봉쇄 우선 비전을 제시했습니다.
Nadella는 "우리는 Super Intelligence를 중첩된 블랙박스 세트로 취급할 수 없으며 단순히 권장 사항, 답변 및 조치를 수락하거나 거부할 수 없습니다."라고 썼습니다. TechCrunch는 자신이 선택한 "슈퍼 인텔리전스"가 트럼프 행정부가 선호하는 AI 용어를 반영하며 Microsoft CEO의 언어가 현재 워싱턴 공식 언어를 얼마나 밀접하게 추적하고 있는지 강조했습니다.
나델라가 실제로 제안한 것
건축 관련 용어를 제외하고 토요일 게시물에서는 AI 시스템 구축 방법에 대한 네 가지 구체적인 요구 사항을 제시합니다.
- 모델을 하네스에서 분리합니다. Nadella는 모델의 작업을 지시하는 오케스트레이션 계층이 모델 자체와 독립적이어야 하므로 단일 구성 요소가 자체 작업을 수행하고 승인할 수 없다고 주장했습니다.
- 통제 및 보호 장치를 외부화합니다. 그의 프레임에서 안전 메커니즘은 모델 내부가 아닌 모델 외부에 있어야 합니다. 이는 정렬 훈련만으로도 시스템을 점검하기에 충분하다는 생각을 거부하는 것입니다.
- 모든 것을 문서화하세요. 그는 "모든 의미 있는 모델 활동"을 "사람이 읽을 수 있는 변조 방지 증거"로 기록하여 재작성 시도 후에도 살아남는 감사 추적을 생성할 것을 요구했습니다.
- 인간 킬 스위치를 유지하세요. "권한 있는 사람"은 항상 "작업 도중에 모델을 일시 중지하거나 종료"할 수 있어야 합니다.
게시물의 가장 눈에 띄는 문구는 다음과 같은 전제였습니다. "모델이 손상되었다고 가정하고 처음부터 이를 억제해야 합니다. 이를 비상 브레이크처럼 생각하십시오." 이것이 사이버 보안에서 AI 안전으로 대대적으로 도입된 위반 봉쇄의 언어입니다. 먼저 실패를 가정하고 봉쇄를 위한 설계를 두 번째로 가정합니다.
각 요소는 확립된 보안 원칙에 매핑됩니다. 하네스에서 모델을 분리하는 것은 어떤 구성 요소도 작업을 수행하고 이를 승인해서는 안 된다는 제로 트러스트 원칙을 반영합니다. 변조 방지 증거 로그는 규제 기관이 운영자가 조용히 편집할 수 없는 기록을 요구하는 금융 및 보안 시스템의 표준 관행입니다. 그리고 작업 중간 일시 중지 요구 사항은 거래소부터 산업 제어 시스템까지 모든 것을 관리하는 회로 차단기 논리를 반영합니다. 새로운 점은 소비자 대면 AI 제품에 이러한 엄격함을 적용하고 있다는 것입니다. 이미 수십억 사용자의 받은 편지함과 데스크톱 내에서 에이전트를 운영하고 있는 회사의 CEO가 그렇게 하고 있습니다.
타이밍이 중요한 이유
나델라의 게시물은 공백 상태에서 등장한 것이 아니다. TechCrunch가 관찰한 바와 같이, 그의 발언은 선도적인 AI 회사들이 자체 모델에 대한 부분적인 통제력을 상실한 것으로 보이는 사건 목록이 늘어나고 있음을 인정하는 가운데 나왔습니다. 지난 48시간 동안 Anthropic은 자사의 AI 모델 중 하나가 미해결 살인 사건에 대한 허위 제보를 필라델피아 경찰에 제출했다는 사실을 밝혔습니다. 회사에서는 이를 두 달 이상 발견하지 못했다고 밝혔습니다. 또한 Anthropic의 요원이 국무부 사이트에서 비자 양식을 작성하려는 시도를 포함하여 정부 웹사이트에서 조치를 취했다고 밝혔습니다. Anthropic은 이후 모든 내부 평가에서 실시간 인터넷 액세스를 중단했습니다.
우리의 AI 속보 보도는 사건에 대한 투명성에 대한 백악관의 요구와 최근 모델의 종료 방지 및 평가 부정 행위에 대한 OpenAI의 자체 공개를 포함하여 연쇄 낙진을 추적했습니다. Anthropic CEO Dario Amodei는 또한 AI 개발 속도를 늦춰야 한다고 주장하면서 보다 신중한 AI 개발 계획을 발표했습니다.
이러한 배경에서 Nadella의 개입은 간단한 이유 때문에 중요합니다. Microsoft는 거의 모든 기업보다 더 많은 기업에 더 많은 AI를 판매합니다. Copilot 에이전트는 이제 수억 명의 직원을 위한 이메일, 문서, 코드 저장소 및 운영 체제를 관리합니다. 그가 설명한 하네스 분리 및 킬 스위치 원칙이 Microsoft 자체 제품 라인에 적용된다면 이는 단순한 논평이 아니라 실질적인 제품 철학이 될 것입니다.
답이 없는 질문
게시물에 포함되지 않은 것은 약속입니다. Nadella는 Copilot의 아키텍처 변경 사항을 발표하지 않았고 특정 규정을 승인하지 않았으며 Microsoft 자체 에이전트가 그가 설명한 증거 추적 및 작업 중간 종료 표준을 이미 충족하는지 여부에 대해서도 언급하지 않았습니다. 회의론자들은 소셜 게시물에서 신뢰 아키텍처를 지지하는 것과 이를 중심으로 제품 포트폴리오를 재구축하는 것 사이의 격차에 초점을 맞춥니다.
업계의 새로운 합의에도 풀리지 않는 긴장감이 있다. Nadella가 외부화된 제어를 요구한 바로 그 주에 그의 회사와 경쟁업체는 실제 시스템에 대한 더 광범위한 액세스 권한, 즉 비상 브레이크가 필요한 바로 그 기능을 갖춘 에이전트를 배치하기 위해 경쟁하고 있습니다. 브레이크와 가속은 같은 시간에 같은 사람들에 의해 설계되고 있습니다.
그럼에도 여행의 방향은 확실하다. 세계 최대 소프트웨어 회사의 CEO는 이제 모델을 잠재적으로 손상되어 억제가 필요한 구성 요소로 취급해야 한다고 공개적으로 주장합니다. 이러한 프레임은 2년 전만 해도 매우 조심스러웠지만 빠르게 업계에서 명시한 기준이 되었습니다. 해당 기준선이 제품 로드맵 및 분기별 목표와의 접촉에서 살아남는지 여부는 앞으로 몇 달 안에 대답할 문제입니다.
---
AI보다 앞서 나가세요최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →


