Google приобрела огромную корпоративную базу данных обанкротившегося бюджетного перевозчика Spirit Airlines за 10 миллионов долларов на аукционе по банкротству, что является последним признаком того, что компании, занимающиеся искусственным интеллектом, будут платить реальные деньги за текст, который никогда не появлялся в открытом Интернете.

Согласно судебному документу, поданному на прошлой неделе и опубликованному The Register 18 августа 2026 года, выигравшая заявка Google обошла как минимум еще одного серьезного претендента: Mercor, компанию, которая предоставляет данные для обучения моделей искусственного интеллекта. Axios отдельно подтвердила, что Google выиграла аукцион по банкротству электронных писем, чатов и документов Spirit. Подробнее об этой истории — в нашем последние разработки в ИИ.

Spirit, когда-то типичная сверхбюджетная американская авиакомпания, так и не оправилась в финансовом отношении от шока, который Covid-19 вызвал для путешествий в 2020 году. После нескольких лет растущих убытков в мае 2026 года авиаперевозчик окончательно приостановил деятельность и вступил в ликвидацию, а ее активы теперь проданы с аукциона для погашения долгов перед кредиторами. Как выяснилось, одним из этих активов был архив операционных выхлопов: электронные письма, записи разговоров, журналы чатов и записи полетов — именно тот обширный, беспорядочный, созданный человеком текст, который, по словам разработчиков ИИ, им нужен.

Что куплено за 10 миллионов долларов

Цифры в материалах суда описывают набор данных поразительной широты. В сокровищницу входят более 100 миллионов электронных писем и 500 миллионов элементов из Microsoft Teams, а также 17 миллионов файлов OneDrive и 20,5 миллионов элементов SharePoint. Google также приобрел более 30 миллионов записанных звонков в службу поддержки клиентов и более 15 миллионов записей чатов службы поддержки клиентов — золотая жила настоящего человеческого диалога, от изменений в бронировании до жалоб на багаж.

Архив выходит за рамки взаимодействия с клиентами и затрагивает операционное ядро ​​авиакомпании. Продажа охватывает около 600 000 билетов ServiceNow, 13,7 миллионов активных адресов электронной почты с маркетинговой платформы Oracle Responsys и записи о 11 миллионах продаж Wi-Fi на борту. Что касается эксплуатации, данные описывают более 763 000 полетов, пять миллионов пар экипажей, более 1,2 миллиона пропусков топлива и историю закупок 787 452 деталей самолетов.

Сообщается, что Google заявила, что купила данные для улучшения своих услуг искусственного интеллекта. The Register отмечает, что поисковый гигант может увидеть в записях Spirit исходный материал для модели, специфичной для конкретной области (например, помощника по авиационным операциям), или просто большой массив повседневных деловых записей, которые могли бы помочь моделям более надежно справляться с повседневными задачами на рабочем месте.

Почему архивы авиакомпании внезапно стали ценными

Аукцион иллюстрирует тихий сдвиг в том, как компании, занимающиеся искусственным интеллектом, получают данные для обучения. Общественный Интернет уже неоднократно подвергался взломам, и пограничные лаборатории теперь ищут свежий, специализированный текст и, что особенно важно, гарантированно написанный человеком. Все, что будет произведено до 2022 года, по определению не содержит контента, созданного искусственным интеллектом, и это важно, поскольку исследователи предупреждают, что модели, интенсивно обучаемые на синтетическом тексте, рискуют «разрушиться моделью», то есть прогрессирующим ухудшением качества продукции.

Та же самая логика стимулирует приобретения незнакомцев. На этой неделе TechCrunch и 404 Media сообщили, что Amazon скупает редкие и вышедшие из печати книги, отрезая их корешки и сканируя их на предприятии в Лас-Вегасе — тексты ценятся отчасти потому, что их нигде нет в Интернете. Архив Spirit является корпоративным эквивалентом: закрытый, недоступный для веб-сканеров и насыщенный аутентичным обменом данными между реальными клиентами и реальными агентами поддержки.

Присутствие компании Mercor в качестве покупателя, предлагающего более низкую цену, говорит о многом. Компания, весь бизнес которой поставляет данные для обучения ИИ, была готова приблизиться к цене Google за электронные письма и журналы вызовов авиакомпаний — свидетельство того, что аукционы по банкротству стали функционирующей площадкой для обучения корпораций, где специализированные брокеры конкурируют с гигантами, которых они поставляют.

Вопросы о конфиденциальности определяют сделку

Согласно материалам суда, данные Spirit были деидентифицированы перед тем, как их выставили на продажу, а Google пообещал удалить всю оставшуюся личную информацию, которую обнаружит в архиве.

Другой вопрос, окажется ли эта очистка идеальной. The Register многозначительно отметил, что ожидает доказательств «неизбежных SNAFU» — почти уверенности в том, что некоторые личные детали из горячего звонка в службу поддержки клиентов в конечном итоге всплывут в выходных данных модели или результатах поиска. Записанные телефонные звонки и чаты поддержки, как известно, трудно полностью анонимизировать: голоса, имена, ссылки на бронирование и детали маршрута — все это может пережить конвейеры деидентификации.

Для бывших клиентов Spirit отказ от участия не предусмотрен. Как только данные становятся активом банкротства, они продаются, как и любое другое имущество, которым владеет имущество. Защитники конфиденциальности уже давно предупреждают, что ликвидация превращает личные истории — сигнал бедствия об отмене рейса, жалобу, поданную после семейного происшествия, — в исходные данные для продуктов, созданных компаниями, которым клиент никогда не решался поделиться информацией.

Данные как новый проблемный актив

Продажа Spirit может предвещать более широкую картину: проблемные компании в сфере розничной торговли, путешествий, телекоммуникаций и финансов сидят в архивах, которые разработчики ИИ могут ценить больше, чем физическое оборудование. Для кредиторов продажа данных вместе с воротами, брендами и арендой самолетов приносит дополнительные деньги. Для лабораторий искусственного интеллекта собственные данные — один из немногих оставшихся способов дифференцировать модели, обученные, по сути, в том же общедоступном Интернете, что и все остальные.

В частности, для Google 10 миллионов долларов — это карманная мелочь по сравнению с расходами на инфраструктуру искусственного интеллекта. Стратегическая ценность заключается в эксклюзивности: ни один конкурент не сможет лицензировать диалог по обслуживанию клиентов Spirit после того, как Google полностью выкупит его.

Сделка также состоялась, поскольку регулирующие органы внимательно изучают, как компании, занимающиеся искусственным интеллектом, получают данные для обучения. Иски издателей и авторов по поводу скопированного контента рассматриваются в судах США, а Закон ЕС об искусственном интеллекте налагает требования прозрачности в отношении обучающих данных. Прямая покупка данных на аукционе с обязательствами по деидентификации и очистке PII становится безопасным способом соблюдения требований — даже если этот мелкий шрифт конфиденциальности будет проверен в первый раз, когда данные клиента Spirit появятся в ответе чат-бота.

---

Будьте в курсе ИИ

Последние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.

Читать больше новостей об ИИ →