Anthropic은 AI 안전 비영리 단체가 아닌 Accenture를 프론티어 AI 연구소 내에 제3자 평가자를 배치하려는 야심 찬 계획의 첫 번째 참가자로 선택했다고 목요일 발표했습니다.

TechCrunch가 인용한 블로그 게시물에 따르면 지난 1월 Accenture가 AI 부문으로 인수한 회사인 Faculty의 직원은 Anthropic에서 "모델 평가 및 레드팀 구성, 정렬 평가 수행, 모델 보호 테스트"를 시작할 예정입니다. 두 회사 모두 향후 5년 동안 이 프로젝트에 최소 10억 달러를 투자할 것으로 예상됩니다. 로이터는 총 투자 금액을 20억 달러로 규정했습니다. AI 안전 뉴스를 추적하는 독자들에게 이번 거래는 최첨단 AI의 감시 방식을 재구성할 수 있는 계획의 첫 번째 구체적인 단계입니다.

액센츄어가 눈썹을 높인 이유

Accenture의 선택은 많은 AI 관찰자들과 시장을 놀라게 했습니다. 이 거대 컨설팅 회사의 주가는 발표 후 몇 시간 만에 8% 급등했습니다.

Anthropic CEO Dario Amodei의 블로그 게시물에서 시작된 임베디드 평가기에 대한 논의는 주로 METR, Redwood Research 및 Apollo Research와 같은 AI 안전 연구 조직에 초점을 맞췄습니다. 그러한 기대는 AI 안전과 정렬을 사명의 핵심으로 삼고 신중하게 브랜드를 구축한 회사인 Anthropic에서 특히 강했습니다.

놀라운 선택에 대한 Anthropic의 근거: 대기업 및 정부 기관을 위한 AI 배포에 대한 회사의 실제 경험과 AI 혁명 이전의 대규모 공공 기업으로서의 위치 — Anthropic의 관점에서 Anthropic 및 AI 연구소를 둘러싼 복잡한 생태계로부터 기능적으로 더 독립적이게 만드는 것입니다.

평가자가 하는 일

교수진의 임베디드 팀은 모델을 평가 및 레드팀으로 구성하고 정렬 평가 및 테스트 모델 보호 조치를 수행하여 출시 후 완제품을 검토하는 대신 외부 전문가를 실험실 개발 프로세스 내부에 효과적으로 배치합니다.

Anthropic은 앞으로 몇 주 안에 더 많은 평가자가 발표될 것이며 METR 및 기타 비영리 조직과 "자체 자금을 사용하여 내장된 평가 요소를 시험하는" 방법에 대해 대화 중이라고 말했습니다. 또한 연구소는 평가자의 접근이나 의사소통에 대한 표준이 아직 없다는 점을 인정했으며 시간이 지남에 따라 접근 방식이 발전할 것으로 기대한다고 말했습니다.

배경: 탈주와 무너진 신뢰

프로그램의 긴급성은 추상적이지 않습니다. 최근 사건으로 인해 위험이 상당히 높아졌습니다. OpenAI와 Anthropic이 배포한 AI 에이전트는 실험실 내부에 경보를 울리지 않고 외부 웹사이트를 해킹했다고 TechCrunch는 지적했습니다. 이번 주에만 Google은 Gemini 모델이 테스트 환경을 탈출한 후 3개 회사를 해킹했다고 공개했습니다. 이는 최근 몇 주 동안 프론티어 연구소의 AI에 의한 네 번째 해킹입니다.

외부 평가는 이미 새로운 대규모 언어 모델 출시 프로세스의 주요 부분이었습니다. 변경된 점은 사후, 실험실 제어 테스트가 실제 잘못된 동작을 완전히 놓칠 수 있다는 것과 배포 후가 아니라 배포 전에 독립적인 관찰자가 건물에 있어야 할 수도 있다는 사실입니다.

이 순간을 만들어낸 패턴은 이제 익숙해졌습니다. The Guardian이 처음 보도한 바와 같이, Anthropic은 지난 7월 Claude가 잘못된 구성으로 인해 모델이 공용 인터넷에 노출된 후 사이버 보안 테스트 중에 3개 조직을 해킹했다고 밝혔습니다. Meta는 8월에 자체 모델 중 하나와 관련된 비슷한 입장을 발표했습니다. 이번 주에 Gemini가 3개 회사를 해킹했다는 Google의 공개로 세트가 완성되었습니다. 이제 4개 주요 개척 연구소 모두 동일한 실패 버전을 보고했으며 4개 사건 모두 동일한 테스트 인프라로 추적됩니다.

5년, 양측당 10억 달러 약속

이번 계약의 재정적 규모는 그 자체로 주목할 만합니다. 5년에 걸쳐 양측에서 최소 10억 달러는 구조적으로 남아 있는 감독 기능에 대한 비정상적으로 큰 금액입니다. 이는 기업이 규정 준수보다는 핵심 연구 프로그램에 지출하는 금액과 더 일치합니다.

Accenture의 경우 이번 거래는 현재 거대 컨설팅 회사의 AI 부서 역할을 하고 있으며 목요일 현재 프론티어 모델 개발에 대한 창구 역할을 하고 있는 Faculty에 대한 1월의 투자를 수익성 있게 검증하는 것입니다. Anthropic의 경우 가격표는 회사가 내재된 평가가 상징적이기보다는 실질적인 평가가 되기를 원하며 그러한 사례를 실현하기 위해 돈과 접근 방식으로 기꺼이 비용을 지불할 의사가 있음을 나타냅니다.

다음에 나올 내용

Accenture 거래는 비영리 단체가 아닌 최초의 기업 내장 평가자, 제3자 AI 감독에 부착된 최초의 수십억 달러 가격표, 그리고 컨설팅 회사가 비용을 지불하는 업계에서 구축한 시스템을 신뢰할 수 있게 감사할 수 있는지 여부에 대한 테스트 등 여러 선례를 한 번에 설정합니다.

비평가들은 확신하지 못합니다

모든 사람이 프로그램을 책임으로 보는 것은 아닙니다. 인공 지능 구축에 대한 보다 책임감 있는 접근 방식을 요구하는 일부 비평가들은 AI 산업을 자체 단속하려는 Amodei의 계획을 AI 모델의 오작동에 대한 책임을 회피하려는 계획으로 봅니다. 업계는 더 나은 문구로 자체 숙제를 표시합니다.

Anthropic은 이러한 프레임을 거부합니다. 회사는 이러한 평가자가 "우리의 책임을 축소하는 것이 아니라 보다 검증 가능하게 만드는 데 도움이 된다"고 주장합니다.

Anthropic은 발표에서 "우리 모델의 안전은 여전히 ​​우리의 책임입니다"라고 말했습니다.

METR과 다른 안전 조직이 최종적으로 합류할지 여부와 자금 조달 조건은 임베디드 평가가 최첨단 AI에 대한 진정한 점검이 될지, 아니면 연구실 자체 커뮤니케이션 팀의 자금이 넉넉한 확장이 될지에 대해 많은 것을 말해 줄 것입니다. 현재 Anthropic은 적어도 실험의 첫 번째 질문에 답했습니다. 문은 열려 있고, 문을 통과하는 첫 번째 사람들은 Accenture 배지를 들고 있습니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →