지난 토요일 The Guardian이 보고한 내부 문서에 따르면 옥스퍼드 대학교는 OpenAI가 "OpenAI 훈련 세트를 채우는 데 사용되는 디지털화된 자료를 사용하여 Bodleian Library의 역사적 텍스트에 대해 AI 모델을 훈련할 수 있도록 허용했습니다. 이는 파트너십이 공개적으로 발표되었을 때 한 번도 언급되지 않은 목적입니다.

옥스포드는 2025년 3월 디지털화 프로젝트로 이 협업을 공개했으며, OpenAI 소프트웨어를 사용하여 세계에서 가장 유명한 도서관 중 하나의 텍스트를 스캔하면 학생과 연구자가 콘텐츠를 더 광범위하게 이용할 수 있게 될 것이라고 밝혔습니다. 발표에서 언급되지 않은 것은 해당 자료가 OpenAI의 상용 모델 교육에 사용될 것이라는 것입니다. Guardian이 검토한 내부 문서는 그 목적을 명시적으로 밝히며, AI 산업을 위한 원자재를 조용히 공급하는 명문 문화 기관의 현재까지 가장 명확한 사례 중 하나를 표시합니다.

목적을 밝히지 않은 파트너십

합의의 세부 사항은 정보 요청의 자유를 통해 나타났으며, Bodleian의 자체 거버넌스 위원회 구성원을 포함한 직원들이 ChatGPT 뒤에 있는 회사와 파트너십을 맺는 데 따르는 평판 위험에 대한 우려를 기록하는 대학 회의록이 나타났습니다. 직원들은 또한 에너지 집약적 기술 회사와의 거래가 대학의 환경 보호 노력에 미칠 영향을 제기했습니다.

OpenAI 대변인은 "현재의 AI 모델이 미래를 위해 세계의 역사적 지식을 보존"할 수 있게 된 것을 회사가 "자랑스럽게 생각한다"며 이 프로그램을 옹호했습니다. 대변인은 "10억 명이 넘는 사람들이 일상생활에서 이 기술을 사용하고 있기 때문에 다양한 문화, 역사, 관점을 반영하는 것이 중요하다"고 덧붙였다.

튜더풍 발라드부터 박사학위 논문까지

디지털화 규모가 상당하다. 2025년 6월까지 19세기와 20세기에 작성된 유럽 및 미국 대학의 박사 학위 논문을 포함하여 역사적 논문에서 스캔한 125,000개의 이미지가 Bodleian 컬렉션의 OpenAI와 공유되었습니다. 스캔된 다른 자료에는 한때 튜더 왕조의 거리 모퉁이에서 유포되었던 노래 가사와 악보인 16세기 "브로드사이드 발라드" 10,000개의 희귀 컬렉션이 포함되어 있습니다.

그 어느 것도 전통적인 의미에서 비밀이 아닙니다. Bodleian의 역사적 소장품 중 대부분은 공개 도메인 저작물이며 저작권법은 오래된 텍스트에 대한 훈련 모델에 거의 제한을 두지 않습니다. 그러나 학자를 위한 도서관을 디지털화하는 것과 상업용 교육 세트를 채우는 것 사이의 차이점은 역사적으로 기관이 큰 소리로 언급할 것으로 예상되었던 종류의 차이점입니다. 옥스포드는 그렇지 않았습니다. 그리고 누락은 법적 권리에 대해 말하는 것보다 대학과 자체 커뮤니티 간의 투명성에 대해 말하는 것보다 덜 중요합니다.

새로운 데이터 개척지로서의 라이브러리

도서관 서가에 대한 쇄도에는 단순한 경제적 동인이 있습니다. 개방형 웹에는 유용한 데이터가 부족합니다. 스크랩된 웹 사이트가 AI 생성 자료로 포화됨에 따라 해당 콘텐츠에 대한 교육은 순환적이고 품질이 저하되며 개발자는 사람이 쓴 신선한 텍스트의 소스로 물리적이고 종종 역사적인 도서 컬렉션으로 전환했습니다.

증상은 고속도로에서 볼 수 있습니다. Guardian의 보고에 따르면 중고 서점에서는 18세기 아프리카의 농기구에 대한 안내서, 1950년대 자동차 운전자의 전기 등 모호한 제목에 대한 주문이 쇄도하고 있다고 합니다. 바로 그러한 책이 온라인 어디에도 디지털화된 형태로 존재하지 않을 가능성이 높기 때문입니다. 서점에서는 이번 구매가 차세대 AI 모델에 대한 새로운 데이터를 나타내는 것이라고 추측했습니다.

OpenAI는 학계와 문화 기관 전반에 걸쳐 동일한 플레이북을 추구했습니다. 이 회사는 NextGenAI라는 프로젝트에 따라 Boston Public Library, Caltech, MIT 및 Michigan University와 계약을 체결했으며 Oxford는 프로젝트의 유일한 영국 회원입니다. 수천 년에 걸친 컬렉션을 보유하고 있는 유럽에서 가장 오래된 도서관 중 하나인 보들리안(Bodleian) 도서관은 어느 정도 가장 유명한 도서관입니다.

문화 기관에 미치는 영향

옥스포드 사건은 이미 전 세계 박물관, 기록 보관소, 도서관을 통해 진행되고 있는 논쟁을 더욱 심화시킬 것 같습니다. 기술 회사가 컬렉션을 무료로 디지털화하겠다고 제안하면 실제로 교환되는 것은 무엇입니까? 디지털화는 접근성, 보존, 검색 가능성 등 진정한 공공 혜택을 제공합니다. 그러나 옥스퍼드 문서는 가치가 양방향으로 흐르며, 훈련 세트 사용이 발표할 만큼 중요하지는 않더라도 OpenAI에 중요하다고 제안합니다.

예산이 부족한 기관의 경우 이러한 유혹을 이해할 수 있습니다. 전문적인 디지털화에는 비용이 많이 들고 OpenAI와 같은 회사는 이를 무료로 제공하고 있습니다. 평판 위험을 걱정했던 Bodleian의 거버넌스 위원회 구성원은 나중에 FOI 문서에서 확인한 내용, 즉 의도 여부에 관계없이 대학 브랜드가 데이터 수집 노력에 정당성을 부여하고 있다는 사실을 직관한 것으로 보입니다.

이제 문제는 다른 기관이 AI 파트너십에서 투명성 조항(훈련 사용에 대한 명시적 공개, 민감한 자료에 대한 거부, 공유 내용과 이유에 대한 공개 보고)을 주장할지 여부입니다. 그렇게 될 때까지 세계의 훌륭한 컬렉션은 계속해서 훈련 데이터가 될 것입니다. 한 번에 하나의 조용한 디지털화 프로젝트가 될 것입니다.

---

AI보다 앞서 나가세요

AI 훈련 데이터를 위한 전쟁은 기술을 훨씬 넘어서는 산업을 재편하고 있습니다. 최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →