谷歌在破产拍卖中以 1000 万美元收购了倒闭的廉价航空公司 Spirit Airlines 的大量企业数据,这是人工智能公司将为从未接触过开放互联网的文本支付真金白银的最新迹象。
根据 The Register 于 2026 年 8 月 18 日报道的上周提交的一份法庭文件,谷歌的中标击败了至少另一个强有力的竞争者:Mercor,一家为训练人工智能模型提供数据的公司。 Axios 单独证实,谷歌赢得了 Spirit 电子邮件、聊天记录和文件的破产拍卖。 更多相关背景,请参阅我们的AI最新动态。
精神航空曾经是典型的美国超低成本航空公司,但在财务上从未从 2020 年 COVID-19 给旅行业带来的冲击中恢复过来。经过多年的亏损,该航空公司于 2026 年 5 月永久停飞并进入清算,其资产现在被拍卖以偿还债权人。事实证明,其中一项资产是运营废气档案:电子邮件、通话录音、聊天记录和飞行记录——正是人工智能开发人员所说的他们需要的那种庞大、混乱、人工生成的文本。
1000 万美元买了什么
法庭文件中的数字描述了一个非常广泛的数据集。该数据库包括来自 Microsoft Teams 的超过 1 亿封电子邮件和 5 亿个项目,以及 1700 万个 OneDrive 文件和 2050 万个 SharePoint 项目。谷歌还获得了超过 3000 万条客户服务电话录音和超过 1500 万条客户服务聊天记录——从预订变更到行李投诉的真实人类对话的金矿。
该档案不仅涉及客户互动,还涉及航空公司的运营核心。此次销售涵盖约 600,000 张 ServiceNow 机票、来自 Oracle Responsys 营销平台的 1370 万个活跃电子邮件地址以及 1100 万个机上 Wi-Fi 销售记录。在运营方面,数据描述了超过 763,000 次航班、500 万机组人员配对、超过 120 万份燃油单以及 787,452 个飞机零部件的购买历史。
据报道,谷歌表示购买这些数据是为了改进其人工智能服务。 The Register 指出,这家搜索巨头可能会在 Spirit 的记录中看到特定领域模型的原材料(例如航空运营助理),或者只是大量日常业务记录,可以帮助模型更可靠地处理日常工作场所任务。
为什么航空公司的档案突然变得有价值
这次拍卖表明人工智能公司在获取训练数据的方式上发生了悄然的转变。公共互联网已经被反复抓取,前沿实验室现在正在寻找新鲜的、专业的、而且最重要的是保证是人类编写的文本。根据定义,2022 年之前制作的任何内容都不含人工智能生成的内容,这一点很重要,因为研究人员警告说,大量训练合成文本的模型存在“模型崩溃”的风险,即输出质量逐渐下降。
同样的逻辑正在推动陌生人收购。本周,TechCrunch 和 404 Media 报道称,亚马逊一直在购买稀有和绝版书籍,将它们的书脊切下来并在拉斯维加斯的一家工厂进行扫描——这些文本之所以受到重视,部分原因是它们在互联网上不存在。 Spirit 的档案相当于企业的档案:专有,网络爬虫无法访问,并且充满了真实客户和真实支持代理之间的真实交流。
Mercor 作为出价较低者的出现很能说明问题。一家整个业务都在提供人工智能培训数据的公司愿意以接近谷歌的价格出售一家航空公司的电子邮件和通话记录——这证明破产拍卖已经成为一个有效的培训语料库市场,专业经纪人与他们提供的巨头进行竞价。
隐私问题影响交易
根据法庭文件,Spirit 的数据在出售之前已被去识别化,谷歌已承诺清除在档案中发现的任何剩余个人信息。
这种擦洗是否完美则是另一回事。 《纪事报》明确指出,它正在等待“不可避免的问题”的证据——从它的说法来看,几乎可以肯定的是,激烈的客户服务电话中的一些个人细节最终将在模型输出或搜索结果中重新出现。众所周知,电话录音和支持聊天很难完全匿名:声音、姓名、预订参考和行程细节都可以在去身份化管道中幸存下来。
对于以前的 Spirit 客户来说,没有选择退出的机会。一旦数据成为破产资产,它就会像遗产持有的任何其他财产一样被出售。隐私倡导者长期以来一直警告说,清算会将个人历史记录——关于航班取消的求救电话、家庭紧急情况后提出的投诉——转化为客户从未选择与之共享信息的公司生产的产品的输入。
数据成为新的不良资产
Spirit 的出售可能预示着一种更广泛的模式:零售、旅游、电信和金融领域陷入困境的公司正坐拥人工智能开发人员比物理设备更看重的档案。对于债权人来说,将数据与登机口、品牌和飞机租赁一起出售可以收回额外的现金。对于人工智能实验室来说,专有数据是区分在与其他人基本上相同的公共互联网上训练的模型的少数剩余方法之一。
特别是对于谷歌来说,1000 万美元对于其人工智能基础设施支出来说只是零花钱。战略价值在于排他性:在谷歌彻底收购 Spirit 后,任何竞争对手都无法获得其客户服务对话的许可。
这笔交易也达成之际,监管机构正在审查人工智能公司如何获取训练数据。出版商和作者就抓取内容提起的诉讼正在美国法院审理,欧盟的人工智能法案对训练数据提出了透明度要求。在拍卖中直接购买数据,并附加去身份识别和 PII 清理承诺,正在成为一种合规友好的途径——即使当 Spirit 客户的详细信息首次出现在聊天机器人的答案中时,隐私细则将受到测试。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →