На аукціоні з банкрутства компанія Google придбала величезну корпоративну базу даних зруйнованого бюджетного перевізника Spirit Airlines за 10 мільйонів доларів США, що свідчить про те, що компанії зі штучним інтелектом платитимуть реальні гроші за текст, який ніколи не торкався відкритого Інтернету.
Відповідно до судового документа, поданого минулого тижня та повідомленого The Register 18 серпня 2026 року, виграшна заявка Google випередила принаймні ще одного серйозного претендента: Mercor, компанію, яка надає дані для навчання моделей ШІ. Axios окремо підтвердила, що Google виграв аукціон із банкрутства електронних листів, чатів і документів Spirit. For more context on this story, see our ongoing artificial intelligence updates.
Spirit, яка колись була типовою наддешевою авіакомпанією США, так і не оговталася у фінансовому плані після шоку, який завдала подорожам у 2020 році COVID-19. Після багатьох років зростаючих збитків у травні 2026 року перевізник назавжди припинив роботу та оголосив про ліквідацію, а його активи тепер продані з аукціону, щоб розплатитися з кредиторами. Виявляється, одним із цих активів був архів операційних вихлопів: електронні листи, записи дзвінків, журнали чатів і записи польотів — саме такий величезний, брудний, створений людьми текст, який, як кажуть розробники ШІ, їм потрібен.
Що куплено на 10 мільйонів доларів
Цифри в судовій документації описують набір даних надзвичайної ширини. Скарб містить понад 100 мільйонів електронних листів і 500 мільйонів елементів від Microsoft Teams, а також 17 мільйонів файлів OneDrive і 20,5 мільйонів елементів SharePoint. Google також придбала понад 30 мільйонів записаних дзвінків у службу підтримки клієнтів і понад 15 мільйонів записів чатів служби підтримки клієнтів — це золота жила справжнього людського діалогу, від зміни бронювання до скарг на багаж.
Архів охоплює не тільки взаємодію з клієнтами, але й операційне ядро авіакомпанії. Продаж охоплює приблизно 600 000 квитків ServiceNow, 13,7 мільйонів активних адрес електронної пошти з маркетингової платформи Oracle Responsys і записи про 11 мільйонів продажів Wi-Fi у літаку. Що стосується операцій, дані описують понад 763 000 польотів, п’ять мільйонів пар екіпажів, понад 1,2 мільйона запасів палива та історію закупівель 787 452 деталей для літаків.
Повідомляється, що Google заявив, що придбав дані для покращення своїх служб ШІ. Регістр зазначив, що пошуковий гігант може побачити в записах Spirit вихідний матеріал для конкретної моделі — наприклад, помічника з авіаційних операцій — або просто великий корпус повсякденних бізнес-записів, які могли б допомогти моделям більш достовірно виконувати рутинні робочі завдання.
Чому архіви авіакомпанії раптово стали цінними
Аукціон ілюструє тиху зміну в тому, як компанії зі штучним інтелектом отримують навчальні дані. Загальнодоступний Інтернет вже неодноразово перевірявся, і прикордонні лабораторії зараз шукають свіжий, спеціалізований текст і — що важливо — гарантовано написаний людиною. Усе, створене до 2022 року, за визначенням, не містить контенту, створеного штучним інтелектом, що має значення, оскільки дослідники попереджають, що моделі, які інтенсивно тренувалися на синтетичному тексті, ризикують «колапсом моделі», тобто прогресивним погіршенням якості результату.
Ця ж логіка спонукає до придбання незнайомців. Цього тижня TechCrunch і 404 Media повідомили, що Amazon купує рідкісні та вичерпані книги, відрізає їхні корінці та сканує їх у закладі в Лас-Вегасі — тексти, які цінуються частково тому, що їх немає ніде в Інтернеті. Архів Spirit є корпоративним еквівалентом: приватний, недоступний для веб-сканерів і насичений автентичними обмінами між реальними клієнтами та реальними агентами підтримки.
Показовою є присутність Mercor як учасника, що занижує ставки. Компанія, весь бізнес якої постачає навчальні дані зі штучного інтелекту, була готова наблизитися до ціни Google за електронну пошту та журнали викликів авіакомпанії — доказ того, що аукціони банкрутства стали функціонуючим ринком для навчальних корпусів, де спеціалізовані брокери змагаються проти гігантів, яких вони постачають.
Запитання щодо конфіденційності Слідкуйте за угодою
Дані Spirit були деідентифіковані перед виставленням на продаж, згідно з судовою заявою, і Google пообіцяла очистити будь-яку особисту інформацію, що залишилася, знайдену в архіві.
Інша справа, чи виявиться це очищення ідеальним. Реєстр чітко зазначив, що він очікує доказів «неминучих SNAFU» — майже впевненості, згідно з його словами, що деякі особисті деталі гарячого дзвінка в службу підтримки зрештою знову з’являться у виведених моделях чи результатах пошуку. Відомо, що записані телефонні дзвінки та чати служби підтримки важко повністю анонімізувати: голоси, імена, посилання на бронювання та деталі маршруту можуть пережити конвеєри деідентифікації.
Для колишніх клієнтів Spirit немає можливості відмовитися. Щойно дані стають активом банкрутства, вони продаються, як і будь-яке інше майно, що є у власності. Прихильники конфіденційності давно попереджають, що ліквідація перетворює особисті історії — сигнал лиха про скасований рейс, скаргу, подану після надзвичайної ситуації в сім’ї — на вхідні дані для продуктів, створених компаніями, з якими клієнт ніколи не ділився інформацією.
Дані як новий проблемний актив
Розпродаж Spirit може передвіщати ширшу картину: компанії з роздрібної торгівлі, подорожей, телекомунікацій і фінансів, що перебувають у скруті, сидять на архівах, які розробники штучного інтелекту можуть цінувати більше, ніж фізичне обладнання. Для кредиторів продаж даних разом із орендою ґейтів, брендів і літаків повертає додаткові гроші. Для лабораторій штучного інтелекту приватні дані є одним із небагатьох способів диференціювати моделі, навчені фактично в тому ж публічному Інтернеті, що й усі інші.
Конкретно для Google 10 мільйонів доларів — це кишенькові гроші проти її витрат на інфраструктуру ШІ. Стратегічна цінність полягає в ексклюзивності: жоден конкурент не може отримати ліцензію на діалог з обслуговування клієнтів Spirit після того, як Google його повністю купив.
Угода також укладається, оскільки регулятори ретельно перевіряють, як компанії ШІ отримують навчальні дані. Позови від видавців і авторів щодо скопійованого вмісту розглядаються в судах США, а Закон ЄС про штучний інтелект встановлює вимоги щодо прозорості навчальних даних. Пряма купівля даних на аукціоні з доданими зобов’язаннями щодо деідентифікації та очищення ідентифікаційної інформації стає зручним шляхом — навіть якщо цей дрібний шрифт конфіденційності буде перевірено, коли вперше дані клієнта Spirit з’являться у відповіді чат-бота.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →