구글은 파산 경매에서 파산한 저비용 항공사 스피릿 항공(Spirit Airlines)의 대규모 기업 데이터를 1천만 달러에 인수했으며, 최근에는 AI 기업들이 공개 인터넷에 한 번도 접근한 적이 없는 텍스트에 대해 실제 돈을 지불할 것이라는 조짐이 나타났습니다.
지난주에 제출되어 2026년 8월 18일 The Register가 보고한 법원 문서에 따르면, Google의 낙찰은 AI 모델 훈련을 위한 데이터를 제공하는 회사인 Mercor를 적어도 한 명 더 앞섰습니다. Axios는 Google이 Spirit의 이메일, 채팅 및 문서에 대한 파산 경매에서 승리했음을 별도로 확인했습니다. 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.
전형적인 초저가 미국 항공사였던 Spirit은 2020년 코로나19로 인한 충격에서 결코 재정적으로 회복되지 못했습니다. 수년간 손실이 증가한 후 이 항공사는 2026년 5월에 영구적으로 파산하고 청산에 들어갔으며 현재 자산은 채권자에게 상환하기 위해 경매되고 있습니다. 이러한 자산 중 하나는 이메일, 통화 녹음, 채팅 로그, 비행 기록 등 운영상의 소진을 기록하는 아카이브였습니다. 이는 AI 개발자가 필요하다고 말하는 방대하고 지저분하며 인간이 생성한 텍스트와 정확히 같습니다.
1000만 달러에 구입한 것
법원 서류의 숫자는 놀랄 만큼 광범위한 데이터 세트를 설명합니다. 이 저장소에는 Microsoft Teams의 1억 개 이상의 이메일과 5억 개 항목, 1,700만 개 OneDrive 파일, 2,050만 개 SharePoint 항목이 포함되어 있습니다. 또한 Google은 예약 변경부터 수하물 불만 사항에 이르기까지 실제 인간 대화의 금광인 3천만 건 이상의 고객 서비스 통화 기록과 1,500만 건 이상의 고객 서비스 채팅 기록을 확보했습니다.
아카이브는 고객 상호 작용을 넘어 항공사의 운영 핵심까지 확장됩니다. 이번 판매에는 약 60만 장의 ServiceNow 티켓, Oracle Responsys 마케팅 플랫폼의 활성 이메일 주소 1,370만 개, 기내 Wi-Fi 판매 기록 1,100만 개가 포함됩니다. 운영 측면에서 데이터는 763,000회 이상의 항공편, 5백만 명의 승무원 조합, 120만 개 이상의 연료 전표 및 787,452개의 항공기 부품 구매 내역을 설명합니다.
구글은 AI 서비스를 개선하기 위해 데이터를 구입했다고 밝힌 것으로 알려졌다. Register는 검색 대기업이 Spirit의 기록에서 도메인별 모델(예: 항공 운영 보조원)의 원시 자료를 볼 수도 있고, 모델이 일상적인 업무를 보다 확실하게 처리하는 데 도움이 될 수 있는 일상적인 비즈니스 기록의 큰 모음을 볼 수도 있다고 지적했습니다.
항공사의 아카이브가 갑자기 가치를 갖게 된 이유
이번 경매는 AI 회사가 훈련 데이터를 소싱하는 방식의 조용한 변화를 보여줍니다. 공용 인터넷은 이미 반복적으로 스크레이핑되었으며, 이제 선도적인 연구실에서는 신선하고 전문적이며 결정적으로 사람이 작성한 텍스트가 보장된 텍스트를 찾고 있습니다. 2022년 이전에 생산된 모든 것에는 정의상 AI 생성 콘텐츠가 없습니다. 이는 연구자들이 합성 텍스트에 대해 집중적으로 훈련된 모델이 출력 품질이 점진적으로 저하되는 "모델 붕괴" 위험이 있다고 경고했기 때문에 중요합니다.
동일한 논리가 낯선 인수를 촉진하고 있습니다. 이번 주 TechCrunch와 404 Media는 Amazon이 희귀하고 절판된 책을 구입하여 등뼈를 잘라낸 후 라스베거스의 한 시설에서 스캔했다고 보도했습니다. 텍스트는 인터넷 어디에도 존재하지 않기 때문에 부분적으로 높이 평가되었습니다. Spirit의 아카이브는 기업과 동일합니다. 독점적이고 웹 크롤러가 접근할 수 없으며 실제 고객과 실제 지원 에이전트 간의 확실한 교환이 밀집되어 있습니다.
Underbidder로서 Mercor의 존재가 말해주고 있습니다. 전체 비즈니스가 AI 교육 데이터를 공급하는 회사는 항공사의 이메일 및 통화 기록에 대해 Google 가격에 근접할 의향이 있습니다. 이는 파산 경매가 전문 브로커가 공급하는 거대 기업에 맞서 입찰하는 교육 자료를 위한 기능적인 시장이 되었다는 증거입니다.
개인 정보 보호 관련 질문 거래 추적
법원 서류에 따르면 스피릿의 데이터는 판매되기 전에 신원이 확인되지 않았으며, 구글은 아카이브에서 발견된 나머지 개인 정보를 모두 삭제하겠다고 약속했습니다.
그 스크러빙이 완벽한지 여부는 또 다른 문제입니다. The Register에서는 "필연적인 SNAFU"(열띤 고객 서비스 통화에서 얻은 일부 개인 정보가 결국 모델 출력이나 검색 결과에 다시 나타날 것이라는 거의 확실성)의 증거를 기다리고 있다고 지적했습니다. 녹음된 전화 통화 및 지원 채팅은 완전히 익명화하기가 매우 어렵습니다. 음성, 이름, 예약 참조 및 일정 세부 정보는 모두 비식별화 파이프라인에서 살아남을 수 있습니다.
이전 Spirit 고객의 경우 선택 해제가 불가능합니다. 데이터가 파산 자산이 되면 유산이 보유한 다른 재산과 마찬가지로 판매됩니다. 개인 정보 보호 옹호자들은 청산이 개인 이력(비행 취소에 대한 조난 전화, 가족 비상 사태 이후 제기된 불만 사항)을 고객이 정보 공유를 결코 선택하지 않은 회사가 만든 제품에 대한 입력으로 변환한다고 오랫동안 경고해 왔습니다.
새로운 부실자산으로서의 데이터
Spirit 매각은 더 넓은 패턴을 예고할 수 있습니다. 소매, 여행, 통신 및 금융 전반에 걸쳐 어려움을 겪고 있는 회사들은 AI 개발자들이 물리적 장비보다 더 가치를 둘 수 있는 아카이브에 앉아 있습니다. 채권자의 경우 게이트, 브랜드 및 항공기 임대와 함께 데이터를 판매하면 추가 현금을 회수할 수 있습니다. AI 연구소의 경우 독점 데이터는 다른 모든 사람과 기본적으로 동일한 공용 인터넷에서 훈련된 모델을 차별화하는 몇 안 되는 남은 방법 중 하나입니다.
특히 Google의 경우 1,000만 달러는 AI 인프라 지출에 비해 용돈입니다. 전략적 가치는 독점성에 있습니다. Google이 Spirit을 완전히 인수한 후에는 어떤 경쟁자도 Spirit의 고객 서비스 대화에 라이선스를 부여할 수 없습니다.
이번 거래는 또한 규제 당국이 AI 회사가 훈련 데이터를 얻는 방법을 면밀히 조사함에 따라 이루어졌습니다. 스크랩된 콘텐츠에 대한 출판사와 저자의 소송은 미국 법원을 통해 진행되고 있으며 EU의 AI 법은 훈련 데이터에 대한 투명성 요구 사항을 부과합니다. 비식별화 및 PII 스크러빙 약속이 첨부된 경매에서 데이터를 완전히 구매하는 것이 규정 준수 친화적인 경로로 떠오르고 있습니다. Spirit 고객의 세부 정보가 챗봇의 답변에 처음 나타날 때 개인 정보 보호 세부 사항이 처음으로 테스트되더라도 마찬가지입니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →