Googleは、破綻した格安航空会社スピリット航空の膨大な企業データの宝庫を破産オークションで1,000万ドルで買収した。これは、AI企業がオープンなインターネットに触れたことのないテキストにリアルマネーを支払うという最新の兆候である。
先週提出され、2026年8月18日にThe Registerが報じた裁判所文書によると、Googleの落札額は、少なくとも1社の他の有力な競争相手、つまりAIモデルのトレーニング用データを提供するMercor社を破ったという。アクシオスは別途、スピリットの電子メール、チャット、文書の破産オークションでグーグルが落札したことを認めた。 この件の詳細は、AIの最新動向をご覧ください。
かつて米国の典型的な超格安航空会社だったスピリットは、2020年に新型コロナウイルス感染症が旅行にもたらしたショックから財務的に立ち直ることはできなかった。損失が何年も膨れ上がった後、この航空会社は2026年5月に永久運航を停止して清算に入り、その資産は現在、債権者に返済するために競売にかけられている。それらの資産の 1 つは、電子メール、通話録音、チャット ログ、飛行記録など、業務上の排出物のアーカイブであったことが判明しました。これはまさに、AI 開発者が必要としている、人間が生成した膨大で乱雑な種類のテキストです。
1,000 万ドルで買ったもの
裁判所への提出書類にある数字は、驚くべき広範なデータセットを表しています。この宝庫には、Microsoft Teams からの 1 億件以上の電子メールと 5 億件のアイテムに加え、1,700 万件の OneDrive ファイルと 2,050 万件の SharePoint アイテムが含まれています。 Google はまた、3,000 万件を超えるカスタマー サービスの通話記録と 1,500 万件を超えるカスタマー サービスのチャット記録を取得しました。これは、予約の変更から荷物の苦情に至るまで、実際の人間の対話の宝庫です。
アーカイブは顧客とのやり取りを超えて、航空会社の運営の中核にまで及びます。このセールでは、約60万枚のServiceNowチケット、OracleのResponsysマーケティングプラットフォームからの1,370万件のアクティブな電子メールアドレス、および1,100万件の機内Wi-Fi販売記録が対象となる。運用面では、データには 76 万 3,000 回以上のフライト、500 万件以上の乗務員の組み合わせ、120 万件以上の燃料明細、および 78 万 7,452 個の航空機部品の購入履歴が記載されています。
GoogleはAIサービスを改善するためにデータを購入したと発表したと報じられている。レジスター紙は、この検索大手がスピリットの記録の中に、分野固有のモデル(たとえば、航空運航アシスタント)の原材料、あるいは単にモデルが職場の日常業務をより信頼性をもって処理するのに役立つ日常業務記録の大規模なコーパスが含まれている可能性があると指摘した。
航空会社のアーカイブが突然価値を持つようになった理由
このオークションは、AI企業がトレーニングデータを調達する方法における静かな変化を示している。公共のインターネットはすでに繰り返しスクレイピングされており、フロンティアラボは現在、新鮮で専門的で、そして重要なことに人間が書いたものであることが保証されているテキストを探しています。 2022 年より前に作成されたものには、定義上、AI によって生成されたコンテンツは含まれていません。合成テキストで大量にトレーニングされたモデルは、出力品質の進行性の低下である「モデル崩壊」のリスクを研究者が警告しているため、これは重要です。
同じ論理が見知らぬ企業の買収を引き起こしている。今週、TechCrunch と 404 Media は、Amazon が希少本や絶版本を購入し、背表紙を切り落としてラスベガスの施設でスキャンしていると報じた。書籍が珍重されているのは、インターネット上のどこにも存在しないためでもある。 Spirit のアーカイブは、企業に相当するものです。独自のものであり、Web クローラーによって到達できず、実際の顧客と実際のサポート エージェント間の本物のやりとりが密集しています。
アンダー入札者としてのメルコールの存在がそれを物語っている。事業全体が AI トレーニング データの提供である企業は、航空会社の電子メールと通話記録の対価として Google の価格に近づくことを厭わなかった。これは、破産オークションがトレーニング コーパスの市場として機能しており、専門のブローカーが供給する大手企業に入札していることを示す証拠である。
プライバシーに関する質問が取引の後に残る
裁判所への提出文書によると、スピリットのデータは売りに出す前に匿名化されており、グーグルはアーカイブ内に残っている個人情報を発見した場合は消去することを約束したという。
そのスクラブが完璧であることが証明されるかどうかは別の問題です。レジスターは、「避けられないSNAFU」の証拠を待っていると鋭く指摘した。つまり、白熱した顧客サービス通話からの個人情報の一部が、最終的にはモデル出力または検索結果に再浮上することはほぼ確実であるということだ。録音された通話やサポート チャットは、完全に匿名化することが難しいことで知られています。音声、名前、予約番号、旅程の詳細はすべて、匿名化パイプラインを通過する可能性があります。
Spirit の元顧客にはオプトアウトはありません。データが破産資産となると、遺産が保有する他の資産と同様に売却されます。プライバシー擁護派は、清算によって個人履歴(飛行機が欠航になったという遭難電話や家族の緊急事態の後に提出された苦情など)が、顧客が決して情報共有を選択しなかった企業が開発した製品へのインプットに変換されてしまうと長年警告してきた。
新たなディストレスト資産としてのデータ
スピリットの売却は、より広範なパターンを予見する可能性がある。小売、旅行、通信、金融の苦境に立たされた企業は、AI開発者が物理的な機器よりも価値を置く可能性のあるアーカイブに保管されている。債権者にとっては、ゲート、ブランド、航空機リースと並行してデータを販売することで、追加の現金を回収できます。 AI ラボにとって、独自のデータは、他のユーザーと本質的に同じ公共インターネット上でトレーニングされたモデルを区別するための、残された数少ない方法の 1 つです。
特に Google にとって、AI インフラストラクチャへの支出に対して 1,000 万ドルは小遣い程度です。戦略的価値は独占性にあります。Google がスピリットを完全に買収した後は、競合他社はスピリットの顧客サービス ダイアログのライセンスを取得できません。
この取引は、AI企業がトレーニングデータを取得する方法を規制当局が精査している中でも成立した。スクレイピングされたコンテンツをめぐる出版社や著者からの訴訟は米国の裁判所で進行中であり、EUのAI法はトレーニングデータに関する透明性要件を課している。匿名化と PII スクラビングの約束を付けて、オークションでデータを完全に購入することが、コンプライアンスに配慮した方法として浮上しつつあります。たとえチャットボットの回答で Spirit の顧客の詳細が初めて明らかになったときに、そのプライバシーの細目がテストされることになるとしてもです。
---
AIの最新情報をお届けAIの最新ニュース、分析、ブレイクスルーを一箇所で。
AIニュースをもっと読む →