Google DeepMind는 8월 27일에 독점적인 최첨단 AI 모델에 대한 세계 최초의 이중 맹검 평가를 발표했습니다. 이는 외부 전문가가 상대방의 비밀을 보지 않고도 Google 모델을 스트레스 테스트할 수 있도록 설계된 암호화 설정입니다.

William Isaac, Sol Messing 및 Kristian Lum의 DeepMind 블로그 게시물에 설명된 파일럿은 암호화된 보안 환경 내에서 기밀 벤치마크를 통해 Gemini Flash Lite 모델을 실행합니다. Google DeepMind는 이 노력에 대해 싱가포르 AI 안전 연구소, OpenMined, AVERI 및 MLCommons와 협력하고 있으며 방법론을 설명하는 기술 보고서를 발표했습니다.

이번 발표는 AI 평가의 가장 지속적인 약점 중 하나인 벤치마크 오염을 해결합니다. AI 연구 뉴스를 추적하는 독자들에게 이는 타사 모델 테스트를 검증 가능하게 깔끔하게 만들기 위한 보다 구체적인 시도 중 하나를 나타냅니다.

오염 문제에 대한 설명

DeepMind는 강의실 비유로 발표를 시작합니다. 학생이 실수로 시험 문제를 미리 본 경우 만점은 아무 의미가 없습니다. 동일한 논리가 프론티어 모델에도 적용됩니다. 모델이 훈련 데이터, 유출된 평가 세트 또는 사전 최적화를 통해 이미 벤치마크의 질문에 노출된 경우 결과 점수가 실제 성능을 엄청나게 과장할 수 있습니다.

이것은 가상적인 우려가 아닙니다. 벤치마크 오염은 수년 동안 현장을 괴롭혔으며, 연구자들은 인기 있는 테스트 세트가 웹 규모 교육 자료로 유출되고 모델이 알려진 평가에서 잘 수행되도록 조용히 조정될 수 있음을 반복적으로 보여주었습니다. 정부와 기업이 벤치마크 점수를 사용하여 조달 및 정책 결정을 내릴 때 부풀려진 숫자는 실제 결과를 가져옵니다.

DeepMind는 모델의 능력이 향상됨에 따라 민감한 평가 범주(사이버 보안 테스트 및 정부 평가 최고)에서 위험이 가장 높다고 주장합니다. 여기서 오염된 점수는 오해의 소지가 있을 뿐만 아니라 잠재적으로 위험할 수도 있습니다.

오래된 절충안: 귀하의 프롬프트 또는 우리의 가중치

역사적으로 위험이 큰 외부 평가는 불편한 선택을 강요했습니다. 평가자는 테스트 프롬프트를 모델 제공자에게 넘겨주어 제공자가 테스트 질문을 미리 보게 될 위험을 감수하거나 제공자가 모델 가중치를 평가자에게 넘겨주어 가장 귀중한 지적 재산이 손실될 위험을 감수합니다.

DeepMind는 제로 로깅 프로토콜과 엄격한 계약상 보호 장치가 오랫동안 외부 테스트 프롬프트를 기밀로 유지해 왔지만 이는 수학이 아닌 정책에 의해 시행되는 약속이라고 썼습니다. 이중 맹검 평가는 이러한 신뢰를 암호화 증명으로 대체합니다.

암호화 상자 작동 방식

파일럿에서는 Google Cloud의 기밀 컴퓨팅 포트폴리오의 일부인 Confidential Space를 사용하여 DeepMind가 암호화 '상자'라고 설명하는 것을 만듭니다. 내부에는 평가의 절반인 기밀 벤치마크와 독점 모델이 해당 소유자에게 비공개로 유지되며 환경은 해당 사실을 암호화하여 확인합니다.

결과는 진정한 이중맹검입니다. 외부 평가자는 Gemini 모델 가중치를 볼 수 없으며 Google은 평가자의 테스트 프롬프트를 볼 수 없습니다. 아키텍처 자체가 원칙적으로 누출을 불가능하게 만들기 때문에 어느 쪽도 상대방의 약속을 신뢰할 필요가 없습니다. 또한 이 설정은 향후 테스트에 앞서 모델 성능을 최적화하기 위해 나중에 평가 데이터를 사용하는 것을 방지하여 일반적으로 오염이 다시 발생하는 루프를 닫습니다.

AI 감독이 중요한 이유

더 넓은 의미는 하나의 Gemini 모델을 넘어서는 것입니다. AI 안전 연구소, 학술 연구실, 규제 기관과 같은 독립 조직은 공급업체가 가중치를 양도할 수 없고 평가자가 벤치마크를 양도하지 않기 때문에 폐쇄 프론티어 모델을 엄격하게 평가하기 위해 수년 동안 노력해 왔습니다. 모든 주요 AI 안전 연구소는 프론티어 연구소와 평가 계약을 체결할 때 이 문제와 씨름해 왔습니다.

파일럿이 유지되면 데이터 주권과 지적 재산이 독립적인 조사를 거쳐도 살아남을 수 있는 템플릿을 제공합니다. DeepMind는 이 파일럿이 "모델 감독을 위한 새로운 개척지를 확립하여 더 넓은 업계가 더 안전하고 신뢰할 수 있으며 널리 신뢰할 수 있는 AI 시스템을 구축하는 데 도움이 되기를 희망합니다"라고 말했습니다.

파트너 목록은 그 자체로 주목할 만합니다. 싱가포르 AI 안전 연구소(Singapore AI Safety Institute)는 가장 활발한 국가 평가 기관 중 하나입니다. OpenMined는 개인 정보 보호 계산 도구를 구축합니다. MLCommons는 업계 벤치마킹을 표준화합니다. AVERI는 정부, 학계 및 산업 표준 기관을 포괄하는 컨소시엄을 구성합니다. 이러한 컨소시엄은 시연이 아닌 표준이 되기 위해 이중 맹검 평가를 채택해야 합니다.

평가 무결성을 둘러싼 군비 경쟁

이번 발표는 AI 기업이 스스로 등급을 매기는 방식에 대한 조사가 높아지는 가운데 이루어졌습니다. 연구소에서는 유리한 벤치마크를 선택한다는 비난이 점점 커지고 있으며, 독립적인 순위표는 공급업체의 통제를 벗어나 있기 때문에 영향력을 갖게 되었습니다. 이중 맹검 평가는 공급업체 자체 인프라 내에서 독립 운동을 확장합니다. 이는 역사적으로 모델 테스트 방법의 모든 세부 사항을 제어해야 한다고 주장해 온 회사에 있어서 주목할 만한 변화입니다.

현재 파일럿에서는 하나의 모델과 일련의 기밀 벤치마크를 다루고 있습니다. 그러나 암호학적으로 검증되고 오염 없는 평가가 기술적으로 일상화되면 기업과 규제 기관이 모든 최전방 연구실에서 기대하는 것이 바뀔 수 있으며 검증 가능한 주장을 점점 더 많이 구축하는 시장에서 "점수 신뢰"가 더 어려워질 수 있습니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →