화요일 네이처 커뮤니케이션즈(Nature Communications)에 발표된 MIT 컴퓨터 과학자들의 새로운 연구는 AI 저작권에 대한 논쟁을 재편할 수 있는 발견을 제공합니다. 확산 모델이 더 많은 데이터에 대해 훈련됨에 따라 그 출력은 특정 훈련 자료를 추적하는 것이 점점 더 불가능해집니다. 연구자들은 이 현상을 '귀속 붕괴'라고 부릅니다. 빠르게 움직이는 생성 AI의 세계를 추적하는 독자들에게 이 논문은 이번 주 AI Buzz Wire에서 다루는 가장 중요한 연구 결과 중 하나입니다.

"생성 확산 모델의 출력은 종종 귀속되지 않습니다"라는 제목의 이 논문은 MIT 컴퓨터 과학 및 인공 지능 연구소(CSAIL)에 소속된 Zheng Dai와 David K. Gifford가 저술했습니다. 핵심 질문은 믿을 수 없을 정도로 간단했습니다. 생성 모델이 이미지를 생성할 때 해당 출력을 담당하는 교육 데이터에서 특정 항목을 찾을 수 있습니까?

연구원들이 발견한 것

대답은 점점 더 '아니요'입니다. 연구원들은 생성된 샘플에 대한 책임이 있는 훈련 데이터의 일부를 찾는 작업으로 정의되는 속성이 "모델이 충분히 큰 데이터 코퍼스에 대해 훈련되는 경우 불가능할 수 있음"을 보여줍니다.

저자는 "모델이 훈련된 데이터가 많을수록 생성된 샘플의 기여도가 낮아지는 현상을 발견했습니다. 이 현상을 이후 속성 붕괴라고 부릅니다."라고 썼습니다.

이를 테스트하기 위해 팀은 비용이 많이 드는 재교육 없이 이미 교육된 모델에서 특정 교육 사례를 제거할 수 있는 "절제" 방법론을 개발했습니다. 그런 다음 그들은 대규모 가상 실험을 실행했습니다. 특정 이미지나 제작자의 작업 전체가 훈련 세트에 포함된 적이 없다면 모델은 무엇을 생성할까요?

연구의 가장 놀라운 결과 중 일부에서 연구원들은 충분히 큰 데이터 세트에 대해 훈련된 모델의 경우 모나리자 또는 레오나르도 다빈치의 모든 작품을 제거할 수 있으며 모델이 여전히 이미지나 예술적 스타일을 재현할 수 있다는 사실을 발견했습니다. 결과의 원인이 되는 단일 교육 항목은 없습니다.

저작권 소송에서 중요한 이유

이번 조사 결과는 활발한 법적 전쟁터 한가운데에 놓여 있습니다. Midjourney 및 Stable Diffusion과 같은 확산 모델은 훈련 데이터에 있는 자신의 작업 복사본을 통해 AI 시스템이 출력과 스타일을 재현할 수 있다고 주장하는 아티스트로부터 소송을 제기했습니다.

2023년부터 진행 중인 저작권 소송 중 Andersen et al. v. Stability AI Ltd., 원고는 Midjourney가 모델 훈련에 사용된 데이터 세트를 공개하도록 강제하려고 노력해 왔습니다. 그들은 Midjourney가 "모델이 아티스트의 표현 콘텐츠를 모방할 수 있도록 하기 위한 명시적인 목적으로 특정 아티스트의 이름과 관련된 이미지를 스크랩하여" 트레이닝 세트를 구축했다고 주장합니다.

MIT 연구는 그러한 인과관계를 확립하는 것이 규모에 따라 기술적으로 불가능할 수 있음을 시사합니다. 연구의 세부 사항을 처음 보도한 The Register가 지적했듯이, 이 연구는 AI 규제를 더 쉽게 만들기보다는 더 어렵게 만들 가능성이 높습니다. 이는 저자가 작업을 시작했을 때 기대했던 것과는 정반대입니다.

공정한 사용에 대한 질문

MIT의 보도 자료에서 Gifford는 이번 연구 결과가 양방향을 모두 만족시킨다고 주장했습니다. 생성된 출력이 개별 훈련 데이터와 아무런 관련이 없다면 모델은 단순한 복사 기계가 아니라 진정으로 창의적일 수 있습니다.

Gifford는 "이는 공정한 사용, 결과물 자체가 소설 작품으로서 저작권을 가질 수 있는지 여부, 모델에서 나온 내용이 인터넷상의 어떤 것에도 귀속되지 않을 때 작가가 어떻게 보상을 받는지에 대한 의문을 제기합니다."라고 Gifford는 말했습니다.

그 의미는 이미지 생성기 이상으로 확장됩니다. 확산 모델은 시청각 미디어 생성을 위한 지배적인 아키텍처가 되었으며 단백질 구조 모델링 및 치료 발견을 포함한 과학 응용 분야에서 점점 더 많이 사용되고 있습니다. 머신 언러닝, 데이터 중독 감지, 모델 해석성, 공정성 감사 및 개인 정보 보호 규정 준수를 위한 기여 도구도 제안되었습니다.

어트리뷰션 스타트업을 위한 경고

이 연구는 또한 성장하는 AI 출처 및 콘텐츠 검증 도구 산업에 대한 경고를 담고 있습니다. 연구자들은 생성된 출력을 시각적으로 유사한 훈련 이미지와 일치시키는 유사성 기반 속성이 대규모 훈련 데이터 체제에서 잘못된 속성을 생성한다는 것을 발견했습니다.

즉, "이 AI 이미지는 해당 아티스트의 포트폴리오에서 나온 것입니다"라고 주장하는 도구는 모델이 수십억 개의 이미지에 대해 훈련될 때 단순히 잘못된 것일 수 있습니다. 출처 분쟁을 해결하기 위해 기술적 귀속을 기대하는 플랫폼, 법원 및 규제 기관의 경우 MIT 결과는 그러한 확실성이 프론티어 규모 모델에 도달하지 못할 수 있음을 시사합니다.

다음에 나올 내용

이 논문은 EU AI법의 투명성 요구 사항 및 아티스트 보상 시스템 제안에 대한 논의를 포함하여 진행 중인 소송 및 정책 토론에서 인용될 것으로 예상됩니다. 가장 큰 생산 모델에 대한 귀속 감퇴가 유지된다면 특정 저작물에 대한 출력 추적을 기반으로 한 보상 체계는 항목 수준 추적이 아닌 집단 라이선스를 중심으로 재설계되어야 할 수도 있습니다.

이 연구는 또한 AI 개발자에게 미묘한 점을 제기합니다. 귀속불가능성은 실제로 저작권이 있는 데이터 교육에 대한 공정 사용 주장을 강화하는 동시에 개별 결과물의 특정 피해를 입증하는 아티스트의 능력을 약화시킬 수 있습니다. 저작권 싸움의 양측은 데이터에서 사용할 무언가를 찾을 것입니다.

AI보다 앞서 나가세요

더 많은 최신 AI 연구 및 분석을 보려면 AI Buzz Wire를 방문하여 AI 산업에 대한 일일 보도를 확인하세요.

AI 뉴스 자세히 보기 →