인공 지능 회사는 수십만 권의 골동품 및 절판 서적을 구입하고 그 내용을 훈련 데이터 세트에 입력한 다음 물리적 볼륨을 파괴하고 있습니다. 연구원과 서점은 산업 규모의 관행이 차세대 언어 모델을 촉진하면서도 문화 유산을 지우고 있다고 말합니다. 법원 문서에 처음으로 등장한 이 공개는 현재 유럽 서적 판매 커뮤니티 전체에 반향을 일으키며 AI 저작권 전쟁의 새로운 국면을 열었습니다. 업계를 재편하는 훈련 데이터 논란에 대한 AI 속보에 대해 아래 세부 정보는 깨끗한 텍스트 찾기가 희귀 도서의 모닥불로 변한 과정을 추적합니다.

연습 방법

2026년 법원 절차 중 Anthropic이 공개하고 The Washington Post가 보도한 문서에 따르면 이 프로세스는 의도적으로 산업화되었습니다. 서류에는 스캐닝 계약자의 "유압식 절단기"가 책을 "깔끔하게 절단"하여 페이지를 "고속, 고품질, 생산 수준 스캐너에서 스캔"할 수 있는 방법이 설명되어 있습니다. 문서에는 일단 디지털화되면 스캐닝 회사가 "완성된 책을 수거하기 위해 재활용 회사와 일정을 잡을 것"이라고 기록되어 있습니다.

즉, 책은 반환되지 않습니다. 디지털 텍스트로 축소된 다음 펄프화됩니다.

기업이 오래되고 인쇄된 책을 원하는 이유

실제 책에 대한 욕구는 AI 개발자의 문제가 악화되는 데서 비롯됩니다. 개방형 인터넷은 AI가 생성한 텍스트로 점점 더 오염되고 있습니다. 법률 블로그 Verfassungsblog가 "AI가 책 세계를 먹고 있다"라는 제목의 분석에서 설명했듯이 합성 콘텐츠에 대한 교육은 모델 품질을 저하시킬 위험이 있습니다. 연구자들은 이를 모델 붕괴라고 부르는 현상을 말합니다. 대조적으로 2022년 이전에 인쇄된 책은 사람이 쓴 것으로 보장됩니다.

법적 계산도 있습니다. 회사들은 자신이 소유한 실제 책을 스캔하는 것이 미국 저작권법의 "공정 사용" 조항에 속할 수 있다고 판단했습니다. 이는 저작권이 있는 웹 콘텐츠를 스크랩하는 것보다 더 강력한 방어책이라고 생각합니다. 법원이 그 주장을 받아들일지 여부는 여전히 공개적인 문제로 남아 있지만, 그렇다고 해서 구매 열풍이 멈추지는 않았습니다.

Zoom Books 현상

유럽에서는 Zoom Books라는 캐나다 온라인 서점에 관심이 집중되었습니다. Verfassungsblog에 따르면 이 서점은 상업적 수요가 거의 남아 있지 않은 수십만 권의 논픽션 타이틀을 확보하고 있습니다. 잘 알려지지 않은 학술 저작물, 지역 역사, 전문 기술 매뉴얼 등 이러한 책은 중고 서적 판매자에게는 거의 가치가 없지만 AI 연구소를 위한 이전에 개발되지 않은 교육 자료의 풍부한 정맥을 나타냅니다.

미래주의는 "사본이 거의 남지 않았음에도 불구하고 엄청난 규모로" 파괴가 일어나고 있다고 보고했는데, 이는 일부 타이틀의 경우 스캔하고 파쇄한 사본이 유통 중인 마지막 살아남은 판 중 하나일 수 있음을 의미합니다.

서점과 연구자들의 반발

이 보고서는 대량 구매자가 중고 시장을 왜곡하고 기록보관소가 보존할 수 있는 것보다 더 빨리 희귀본을 제거하고 있다고 말하는 골동품 서적 판매상을 놀라게 했습니다. Anadolu Agency는 유럽 도서 시장 전반에 걸쳐 증가하는 우려를 인정하면서 청구 범위에 대해 회의적인 입장을 표명한 터키의 골동품 서점의 말을 인용했습니다. 인도 타임지(Times of India)와 Boing Boing의 보도에서는 이러한 추세를 AI 기업이 인터넷 이전 인쇄로 후퇴하여 "자신의 AI 슬로프에서 탈출"하려는 직접적인 결과로 구성했습니다.

보존주의자들은 어떤 책이 스캔되고 폐기되었는지 추적하는 중앙 등록 기관이 없기 때문에 폐기가 특히 문제가 된다고 주장합니다. 생존 가능성이 낮은 타이틀이 파쇄되면 손실은 영구적일 수 있습니다. 단, 해당 타이틀을 스캔한 회사가 일반적으로 공유하지 않는 디지털 복사본을 공유하기로 선택하지 않는 한 말입니다.

저작권 전쟁의 새로운 국면

도서 구매 캠페인은 두 가지 아직 해결되지 않은 법적 싸움의 교차점에 있습니다. 저작권이 있는 저작물에 대해 허가 없이 AI 모델을 훈련시키는 것이 공정 사용에 해당하는지, 스캔 후 물리적 소스를 파기하면 미적분학이 변경되는지 여부입니다. 법원은 지금까지 AI 개발자에게 유리한 판결과 제작자의 주장을 보호하는 판결 등 엇갈린 신호를 보냈습니다.

AI 기업의 경우 계산은 간단합니다. 인쇄된 책은 온라인에서 찾기가 점점 더 어려워지고 있는 조밀하고 고품질의 인간이 작성한 텍스트를 제공합니다. 희귀본을 보호하는 도서관, 기록 보관소 및 수집가의 경우 교환이 훨씬 덜 유리합니다. 대체할 수 없는 물리적 유물이 훈련 토큰으로 축소된 다음 펄프로 재활용됩니다.

이러한 관행은 투명성에 대한 의문도 제기합니다. Anthropic의 공개는 소송에서 강요되었기 때문에 나왔습니다. 비슷한 전략을 추구하는 다른 회사가 얼마나 많은지, 이미 폐기된 책의 수는 얼마나 되는지, 위험에 처한 도서를 스캔하고 폐기하기 전에 보존하기 위한 업계 전반의 표준이 나올지는 아직 알 수 없습니다.

아무도 수량화할 수 없는 규모의 문제

이러한 추세를 단속하기 어렵게 만드는 이유 중 하나는 확산성입니다. 단일 대규모 아카이브나 데이터베이스와 달리 도서 구매 캠페인은 부동산 판매, 도서관 폐쇄 판매, 온라인 마켓플레이스 등 수천 건의 개별 거래에 분산되어 있으며, 여기서 논픽션 도서 팔레트를 구매하는 대량 구매자는 뚜렷한 위험 신호를 제기하지 않습니다. 그러나 수십만 건의 구매에 걸쳐 집계된 누적 효과는 물리적 기록에서 틈새 시장의 저유통 지식을 조용히 제거하는 것입니다.

사서와 기록 보관인은 손실이 균등하게 분배되지 않는다고 경고했습니다. 대중 시장 베스트셀러는 셀 수 없이 많은 사본으로 살아남지만, AI 트레이너에게 가장 매력적인 제목(소량 인쇄된 전문적이고 정보 밀도가 높은 작품)은 바로 다른 곳에서는 보존될 가능성이 가장 적은 작품입니다. 일단 파기되면 회사 서버 내부에 잠긴 독점 교육 데이터로만 존재할 수 있으며, 원래 이를 생산하고 의존했던 대중은 접근할 수 없습니다.

AI보다 앞서 나가세요

훈련-데이터 전쟁이 심화되고 있으며 그 이해관계는 기업 대차대조표를 훨씬 뛰어넘습니다. 더 많은 AI 뉴스를 읽고 법원, 규제 기관, 보호론자가 어떻게 대응하는지 알아보려면 AI Buzz Wire를 계속 팔로우하세요.

AI 뉴스 자세히 보기 →