Google ने दिवालियेपन की नीलामी में 10 मिलियन डॉलर में ढह चुकी कम लागत वाली वाहक स्पिरिट एयरलाइंस के विशाल कॉर्पोरेट डेटा भंडार का अधिग्रहण कर लिया है, यह नवीनतम संकेत है कि एआई कंपनियां उस टेक्स्ट के लिए वास्तविक पैसे का भुगतान करेंगी जिसने कभी भी खुले इंटरनेट को नहीं छुआ है।
पिछले सप्ताह दायर किए गए और 18 अगस्त, 2026 को द रजिस्टर द्वारा रिपोर्ट किए गए एक अदालती दस्तावेज़ के अनुसार, Google की विजेता बोली ने कम से कम एक अन्य गंभीर दावेदार को पछाड़ दिया: मर्कोर, एक कंपनी जो AI मॉडल के प्रशिक्षण के लिए डेटा की आपूर्ति करती है। एक्सियोस ने अलग से पुष्टि की कि Google ने स्पिरिट के ईमेल, चैट और दस्तावेज़ों के लिए दिवालियापन नीलामी जीती है। For more context on this story, see our ongoing breaking AI news.
स्पिरिट, जो कभी आदर्श अल्ट्रा-लो-कॉस्ट अमेरिकी एयरलाइन थी, 2020 में यात्रा करने के लिए COVID-19 के कारण आए झटके से आर्थिक रूप से कभी उबर नहीं पाई। वर्षों के बढ़ते घाटे के बाद, वाहक ने मई 2026 में स्थायी रूप से खुद को बंद कर लिया और परिसमापन में प्रवेश किया, अब इसकी संपत्तियां लेनदारों को चुकाने के लिए नीलाम की जा रही हैं। उन संपत्तियों में से एक, यह पता चला है, परिचालन निकास का एक संग्रह था: ईमेल, कॉल रिकॉर्डिंग, चैट लॉग और उड़ान रिकॉर्ड - बिल्कुल उसी तरह का विशाल, गन्दा, मानव-जनित पाठ जो एआई डेवलपर्स का कहना है कि उन्हें ज़रूरत है।
$10 मिलियन में क्या खरीदा
अदालत में दाखिल संख्याएँ उल्लेखनीय विस्तार के डेटासेट का वर्णन करती हैं। इस निधि में 17 मिलियन वनड्राइव फ़ाइलों और 20.5 मिलियन SharePoint आइटमों के साथ-साथ Microsoft Teams के 100 मिलियन से अधिक ईमेल और 500 मिलियन आइटम शामिल हैं। Google ने 30 मिलियन से अधिक रिकॉर्ड की गई ग्राहक सेवा कॉल और 15 मिलियन से अधिक ग्राहक सेवा चैट रिकॉर्ड भी हासिल किए - बुकिंग परिवर्तन से लेकर सामान की शिकायतों तक, वास्तविक मानव संवाद की सोने की खान।
यह संग्रह ग्राहकों की बातचीत से परे एयरलाइन के परिचालन केंद्र तक पहुंचता है। बिक्री में लगभग 600,000 सर्विसनाउ टिकट, ओरेकल के रिस्पॉन्सिस मार्केटिंग प्लेटफॉर्म से 13.7 मिलियन सक्रिय ईमेल पते और 11 मिलियन इन-फ्लाइट वाई-फाई बिक्री के रिकॉर्ड शामिल हैं। परिचालन पक्ष पर, डेटा 763,000 से अधिक उड़ानों, पांच मिलियन क्रू पेयरिंग, 1.2 मिलियन से अधिक ईंधन स्लिप और 787,452 विमान भागों के खरीद इतिहास का वर्णन करता है।
कथित तौर पर Google ने कहा है कि उसने अपनी AI सेवाओं को बेहतर बनाने के लिए डेटा खरीदा है। रजिस्टर ने नोट किया कि खोज दिग्गज स्पिरिट के रिकॉर्ड में एक डोमेन-विशिष्ट मॉडल के लिए कच्चा माल देख सकते हैं - उदाहरण के लिए एक विमानन संचालन सहायक - या बस रोजमर्रा के व्यावसायिक रिकॉर्ड का एक बड़ा संग्रह जो मॉडल को नियमित कार्यस्थल कार्यों को अधिक विश्वसनीय रूप से संभालने में मदद कर सकता है।
किसी एयरलाइन के अभिलेख अचानक मूल्यवान क्यों हो गए हैं
नीलामी इस बात को दर्शाती है कि एआई कंपनियां प्रशिक्षण डेटा कैसे प्राप्त करती हैं। सार्वजनिक इंटरनेट को पहले ही बार-बार ख़त्म किया जा चुका है, और अग्रणी प्रयोगशालाएँ अब ऐसे पाठ की तलाश कर रही हैं जो ताज़ा, विशिष्ट और - महत्वपूर्ण रूप से - मानव-लिखित होने की गारंटी हो। 2022 से पहले उत्पादित कोई भी चीज़, परिभाषा के अनुसार, एआई-जनित सामग्री से मुक्त है, जो मायने रखती है क्योंकि शोधकर्ताओं ने चेतावनी दी है कि सिंथेटिक टेक्स्ट जोखिम "मॉडल पतन" पर भारी प्रशिक्षण वाले मॉडल, आउटपुट गुणवत्ता में प्रगतिशील गिरावट का जोखिम उठाते हैं।
वही तर्क अजनबी अधिग्रहणों को प्रेरित कर रहा है। इस हफ्ते, टेकक्रंच और 404 मीडिया ने बताया कि अमेज़ॅन दुर्लभ और आउट-ऑफ-प्रिंट किताबें खरीद रहा है, उनकी रीढ़ काट रहा है और उन्हें लास वेगास में एक सुविधा में स्कैन कर रहा है - पाठ आंशिक रूप से मूल्यवान हैं क्योंकि वे इंटरनेट पर कहीं भी मौजूद नहीं हैं। स्पिरिट का संग्रह कॉर्पोरेट समकक्ष है: मालिकाना, वेब क्रॉलर्स द्वारा पहुंच योग्य नहीं, और वास्तविक ग्राहकों और वास्तविक समर्थन एजेंटों के बीच प्रामाणिक आदान-प्रदान के साथ सघन।
अंडरबिडर के रूप में मर्कोर की उपस्थिति बता रही है। एक कंपनी जिसका पूरा व्यवसाय एआई प्रशिक्षण डेटा की आपूर्ति कर रहा है, एक एयरलाइन के ईमेल और कॉल लॉग के लिए Google की कीमत के करीब आने को तैयार थी - सबूत है कि दिवालियापन नीलामी प्रशिक्षण निगम के लिए एक कामकाजी बाज़ार बन गई है, जिसमें विशेषज्ञ दलाल उन दिग्गजों के खिलाफ बोली लगा रहे हैं जो वे आपूर्ति करते हैं।
गोपनीयता प्रश्न सौदे का पीछा करते हैं
अदालत में दायर याचिका के अनुसार, बिक्री के लिए रखे जाने से पहले स्पिरिट के डेटा की पहचान रद्द कर दी गई थी, और Google ने संग्रह में पाई गई किसी भी शेष व्यक्तिगत जानकारी को साफ़ करने का वादा किया है।
वह स्क्रबिंग सही साबित होती है या नहीं, यह दूसरी बात है। रजिस्टर ने स्पष्ट रूप से उल्लेख किया है कि वह "अपरिहार्य SNAFUs" के साक्ष्य की प्रतीक्षा कर रहा है - लगभग निश्चितता, उसके बताने में, कि एक गर्म ग्राहक सेवा कॉल से कुछ व्यक्तिगत विवरण अंततः एक मॉडल आउटपुट या खोज परिणाम में फिर से सामने आएंगे। रिकॉर्ड किए गए फ़ोन कॉल और समर्थन चैट को पूरी तरह से गुमनाम करना बेहद कठिन है: आवाज़ें, नाम, बुकिंग संदर्भ और यात्रा कार्यक्रम विवरण सभी अज्ञात पाइपलाइनों से बच सकते हैं।
पूर्व स्पिरिट ग्राहकों के लिए, कोई ऑप्ट-आउट नहीं है। एक बार जब डेटा दिवालियापन संपत्ति बन जाता है, तो इसे संपत्ति के पास मौजूद किसी भी अन्य संपत्ति की तरह बेच दिया जाता है। गोपनीयता की वकालत करने वालों ने लंबे समय से चेतावनी दी है कि परिसमापन व्यक्तिगत इतिहास - रद्द की गई उड़ान के बारे में एक संकटपूर्ण कॉल, पारिवारिक आपातकाल के बाद दायर की गई शिकायत - को उन कंपनियों द्वारा बनाए गए उत्पादों के इनपुट में बदल देता है जिनके साथ ग्राहक ने कभी भी जानकारी साझा करने का विकल्प नहीं चुना है।
नई संकटग्रस्त संपत्ति के रूप में डेटा
स्पिरिट की बिक्री एक व्यापक पैटर्न का पूर्वाभास दे सकती है: खुदरा, यात्रा, दूरसंचार और वित्त क्षेत्र की संकटग्रस्त कंपनियां उन अभिलेखों पर बैठी हैं जिन्हें एआई डेवलपर्स भौतिक उपकरणों से अधिक महत्व दे सकते हैं। लेनदारों के लिए, गेट्स, ब्रांड और विमान पट्टों के साथ डेटा बेचने से अतिरिक्त नकदी प्राप्त होती है। एआई प्रयोगशालाओं के लिए, मालिकाना डेटा अनिवार्य रूप से उसी सार्वजनिक इंटरनेट पर प्रशिक्षित मॉडलों को अलग करने के कुछ बचे हुए तरीकों में से एक है, जो बाकी सभी के इंटरनेट पर है।
विशेष रूप से Google के लिए, $10 मिलियन उसके AI अवसंरचना व्यय के विरुद्ध जेब परिवर्तन है। रणनीतिक मूल्य विशिष्टता में निहित है: Google द्वारा इसे सीधे खरीदने के बाद कोई भी प्रतिद्वंद्वी स्पिरिट के ग्राहक सेवा संवाद को लाइसेंस नहीं दे सकता है।
यह सौदा इसलिए भी सफल हुआ क्योंकि नियामक इस बात की जांच कर रहे हैं कि एआई कंपनियां प्रशिक्षण डेटा कैसे प्राप्त करती हैं। स्क्रैप की गई सामग्री पर प्रकाशकों और लेखकों के मुकदमे अमेरिकी अदालतों के माध्यम से चल रहे हैं, और ईयू का एआई अधिनियम प्रशिक्षण डेटा के आसपास पारदर्शिता आवश्यकताओं को लागू करता है। नीलामी में सीधे डेटा खरीदना, पहचान न करने और पीआईआई-स्क्रबिंग प्रतिबद्धताओं के साथ, अनुपालन-अनुकूल मार्ग के रूप में उभर रहा है - भले ही उस गोपनीयता फाइन प्रिंट का परीक्षण पहली बार चैटबॉट के उत्तर में स्पिरिट ग्राहक के विवरण की सतह पर किया जाएगा।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →