Google heeft op een faillissementsveiling de enorme hoeveelheid bedrijfsgegevens van de failliete lagekostenmaatschappij Spirit Airlines voor 10 miljoen dollar verworven, een teken dat AI-bedrijven echt geld zullen betalen voor tekst die nog nooit op het open internet is verschenen.
Volgens een gerechtelijk document dat vorige week werd ingediend en op 18 augustus 2026 door The Register werd gerapporteerd, versloeg het winnende bod van Google minstens één andere serieuze concurrent: Mercor, een bedrijf dat gegevens levert voor het trainen van AI-modellen. Axios bevestigde afzonderlijk dat Google de faillissementsveiling voor de e-mails, chats en documenten van Spirit heeft gewonnen. Voor meer context over dit verhaal, zie ons AI-nieuws.
Spirit, ooit de archetypische ultra-low-cost luchtvaartmaatschappij van de VS, is nooit financieel hersteld van de schok die COVID-19 in 2020 op de reizen teweegbracht. Na jaren van oplopende verliezen ging de luchtvaartmaatschappij in mei 2026 definitief aan de grond en ging failliet, waarbij haar activa nu worden geveild om de schuldeisers terug te betalen. Een van die bezittingen, zo blijkt, was een archief van operationele uitlaatgassen: e-mails, gespreksopnamen, chatlogboeken en vluchtgegevens – precies het soort enorme, rommelige, door mensen gegenereerde tekst die AI-ontwikkelaars zeggen nodig te hebben.
Wat $ 10 miljoen gekocht
De cijfers in de rechtbankdossiers beschrijven een dataset van opmerkelijke omvang. De schat omvat meer dan 100 miljoen e-mails en 500 miljoen items van Microsoft Teams, naast 17 miljoen OneDrive-bestanden en 20,5 miljoen SharePoint-items. Google heeft ook meer dan 30 miljoen opgenomen klantenservicegesprekken en meer dan 15 miljoen chatrecords van de klantenservice verzameld – een goudmijn aan echte menselijke dialoog, van boekingswijzigingen tot bagageklachten.
Het archief reikt verder dan de interacties met klanten en reikt tot de operationele kern van de luchtvaartmaatschappij. De verkoop omvat ongeveer 600.000 ServiceNow-tickets, 13,7 miljoen actieve e-mailadressen van Oracle's Responsys-marketingplatform en records van 11 miljoen wifi-verkopen tijdens de vlucht. Aan de operationele kant beschrijven de gegevens meer dan 763.000 vluchten, vijf miljoen bemanningscombinaties, meer dan 1,2 miljoen tankbeurten en de aankoopgeschiedenis van 787.452 vliegtuigonderdelen.
Google heeft naar verluidt gezegd dat het de gegevens heeft gekocht om zijn AI-diensten te verbeteren. Het Register merkte op dat de zoekgigant in de archieven van Spirit het ruwe materiaal kan zien voor een domeinspecifiek model – een assistent voor luchtvaartoperaties bijvoorbeeld – of eenvoudigweg een groot corpus van alledaagse bedrijfsgegevens die modellen kunnen helpen routinematige werkplektaken geloofwaardiger af te handelen.
Waarom de archieven van een luchtvaartmaatschappij opeens waardevol zijn
De veiling illustreert een stille verschuiving in de manier waarop AI-bedrijven trainingsgegevens verzamelen. Het openbare internet is al herhaaldelijk geschrapt, en grenslaboratoria zoeken nu naar tekst die nieuw en gespecialiseerd is en – cruciaal – gegarandeerd door mensen geschreven is. Alles wat vóór 2022 is geproduceerd, is per definitie vrij van door AI gegenereerde inhoud, wat van belang is omdat onderzoekers hebben gewaarschuwd dat modellen die zwaar zijn getraind op synthetische tekst het risico lopen dat het model instort, een progressieve verslechtering van de uitvoerkwaliteit.
Diezelfde logica zorgt voor vreemdere overnames. Deze week meldden TechCrunch en 404 Media dat Amazon zeldzame en uitverkochte boeken heeft gekocht, de ruggen ervan heeft afgesneden en ze heeft gescand in een faciliteit in Las Vegas – teksten die deels gewaardeerd worden omdat ze nergens op internet bestaan. Het archief van Spirit is het bedrijfsequivalent: eigen, onbereikbaar voor webcrawlers en rijk aan authentieke uitwisselingen tussen echte klanten en echte ondersteuningsagenten.
De aanwezigheid van Mercor als onderbieder is veelzeggend. Een bedrijf waarvan het hele bedrijf AI-trainingsgegevens levert, was bereid in de buurt te komen van de prijs van Google voor de e-mails en oproeplogs van een luchtvaartmaatschappij – een bewijs dat faillissementsveilingen een functionerende marktplaats zijn geworden voor het trainen van corpora, waarbij gespecialiseerde makelaars bieden tegen de giganten die zij leveren.
Privacyvragen vormen het sluitstuk van de deal
Volgens de rechtbank zijn de gegevens van Spirit geanonimiseerd voordat ze te koop werden aangeboden, en Google heeft beloofd alle resterende persoonlijke informatie die het in het archief aantreft, te verwijderen.
Of dat schrobben perfect blijkt te zijn, is een andere zaak. Het Register merkte nadrukkelijk op dat het wacht op bewijs van de ‘onvermijdelijke SNAFU’s’ – de bijna zekerheid, in zijn verhaal, dat een persoonlijk detail van een verhit telefoontje naar de klantenservice uiteindelijk weer naar boven zal komen in een modeluitvoer of zoekresultaat. Opgenomen telefoongesprekken en ondersteuningchats zijn notoir moeilijk volledig te anonimiseren: stemmen, namen, boekingsreferenties en routegegevens kunnen allemaal de de-identificatiepijplijnen overleven.
Voor voormalige Spirit-klanten is er geen opt-out. Zodra gegevens een faillissementsactivum worden, worden ze verkocht zoals elk ander eigendom dat de boedel bezit. Voorstanders van privacy waarschuwen al lang dat bij liquidatie persoonlijke geschiedenissen – een noodoproep over een geannuleerde vlucht, een klacht ingediend na een noodsituatie in het gezin – worden omgezet in input voor producten die zijn gebouwd door bedrijven waarmee de klant nooit informatie heeft willen delen.
Gegevens als het nieuwe noodlijdende bezit
De verkoop van Spirit kan een breder patroon aankondigen: noodlijdende bedrijven in de detailhandel, de reisbranche, de telecomsector en de financiële sector zitten in archieven die AI-ontwikkelaars mogelijk meer waarderen dan fysieke apparatuur. Voor crediteuren levert de verkoop van gegevens naast gates, merken en vliegtuigleases extra geld op. Voor AI-laboratoria zijn bedrijfseigen gegevens een van de weinige overgebleven manieren om modellen te onderscheiden die zijn getraind op in wezen hetzelfde openbare internet als dat van alle anderen.
Specifiek voor Google is 10 miljoen dollar kleingeld ten opzichte van de uitgaven voor de AI-infrastructuur. De strategische waarde ligt in exclusiviteit: geen enkele rivaal kan Spirit's klantenservicedialoog licentiëren nadat Google het rechtstreeks heeft gekocht.
De deal komt ook tot stand nu toezichthouders nauwkeurig onderzoeken hoe AI-bedrijven trainingsgegevens verkrijgen. Rechtszaken van uitgevers en auteurs over geschrapte inhoud lopen via Amerikaanse rechtbanken, en de AI-wet van de EU legt transparantie-eisen op rond trainingsgegevens. Het rechtstreeks kopen van gegevens op een veiling, met daaraan verbonden verplichtingen op het gebied van de-identificatie en het opschonen van PII, is in opkomst als de nalevingsvriendelijke weg – zelfs als de kleine lettertjes van de privacy voor het eerst worden getest wanneer de gegevens van een Spirit-klant in het antwoord van een chatbot voor het eerst naar voren komen.
---
Blijf Voorop met AIHet laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.
Lees meer AI-nieuws →