Numa das investigações mais inventivas sobre o apetite insaciável da indústria da IA ​​por dados de formação, jornalistas da 404 Media colocaram um dispositivo de rastreio dentro de um carregamento de livros raros que suspeitavam que seriam comprados para formação em IA – e seguiram-no por todo o país até uma instalação da Amazon em Las Vegas onde, segundo o veículo, os livros são digitalizados e destruídos.

A história, publicada segunda-feira pelo editor fundador da 404 Media, Emanuel Maiberg, identifica o destino como a instalação VGT3 da Amazon em Las Vegas. De acordo com a investigação, a Amazon tem comprado grandes quantidades de livros, escaneando-os em busca de dados de treinamento de IA e destruindo os volumes físicos no processo – uma operação que o veículo diz não ter sido relatada anteriormente.

As descobertas acrescentam um novo nome importante a uma prática que tem incomodado silenciosamente livreiros e arquivistas há meses, e chegam à medida que a atenção do público se volta cada vez mais para onde as empresas de IA realmente obtêm os seus dados. Acompanhe nossa cobertura contínua das guerras de dados de treinamento em AI Buzz Wire.

Um dispositivo de rastreamento em uma caixa de livros

A metodologia por trás da investigação é o que a torna notável. Em vez de confiar em documentos ou entrevistas, a 404 Media incorporou um rastreador GPS num carregamento de livros raros que o veículo suspeitava que seriam adquiridos por uma empresa de IA e depois monitorizou a viagem do pacote até ao seu destino final.

Esse destino – a instalação VGT3 da Amazon – é descrito no relatório como o site onde a Amazon escaneia livros em busca de dados de treinamento de IA. A investigação completa, que detalha a operação de compra e sua escala, está à disposição dos assinantes da 404 Media.

A história se espalhou rapidamente pelos círculos de desenvolvedores e de política tecnológica depois de chegar à primeira página do Hacker News na segunda-feira, onde comentaristas debateram as implicações culturais e legais da destruição de livros raros para treinar sistemas comerciais de IA.

Amazon se junta a uma lista crescente

O relatório é o capítulo mais recente de uma controvérsia mais ampla sobre o destino dos livros físicos na era da IA. No início deste Verão, livreiros e investigadores documentaram como as empresas de IA compravam centenas de milhares de volumes antigos e esgotados, alimentando-os em conjuntos de dados de formação e destruindo as cópias físicas – uma prática que os críticos descrevem como o apagamento em escala industrial do património cultural.

O que distingue o novo relatório é que ele nomeia uma instalação específica, uma empresa específica e uma cadeia de abastecimento específica. Até agora, grande parte da discussão baseava-se em reivindicações agregadas de livreiros e em processos judiciais. Uma remessa rastreada oferece dados concretos: uma caixa de livros raros, um comprador e um prédio.

Por que a demanda por dados de treinamento continua aumentando

A economia por trás da prática é simples. É amplamente relatado que os modelos de Frontier AI consumiram a maior parte do texto de alta qualidade prontamente disponível na web aberta, levando as empresas a procurar fontes de acesso mais difícil: livros, arquivos e corpora licenciados. Volumes raros e esgotados são atraentes precisamente porque é improvável que apareçam em conjuntos de dados padrão extraídos da web.

Para os críticos, a destruição de livros físicos para alimentar essa procura tornou-se um símbolo da relação extractiva da indústria com a cultura humana – os dados como um recurso a ser explorado independentemente do que se perde no processo. Para as empresas envolvidas, os livros digitalizados representam uma zona jurídica cinzenta que os tribunais e os legisladores ainda estão a analisar, especialmente à medida que os litígios de direitos de autor sobre dados de formação passam por múltiplas jurisdições.

Nem a digitalização nem a digitalização em si requerem destruição - a destruição, observam editores e arquivistas, parece ser uma medida de poupança de custos, uma vez que armazenar volumes físicos é mais caro do que despolpá-los depois de o seu conteúdo ter sido capturado.

O problema da preservação

Os arquivistas há muito argumentam que digitalização não é preservação. Uma digitalização captura o texto de um livro, mas não as suas margens, a sua história de encadernação, as suas qualidades materiais – as características que fazem de um volume raro um artefacto histórico e não um contentor de palavras. Destruir a cópia física após a digitalização fecha a porta para exames futuros e, diferentemente dos arquivos digitais, um livro compactado não pode ser digitalizado novamente à medida que a tecnologia de imagem melhora.

The economics of the book trade compound the loss. Rare and out-of-print volumes survive in small numbers. When buyers with AI-scale budgets enter the market, they can outbid libraries and collectors for the remaining copies — and when those copies are destroyed after scanning, the surviving population of a given edition can shrink permanently within months.

Bookseller associations in Europe have been among the most vocal critics of the practice, and the 404 Media investigation gives their warnings a concrete footprint: a facility, a supply chain, and a named corporate buyer.

What Comes Next

The investigation is likely to intensify scrutiny of Amazon's role in the AI data supply chain, a position that is otherwise dominated by its cloud business. It may also renew calls in Europe and the United States for rules requiring the preservation of cultural materials used in AI training, an idea that has been floated by bookseller associations and some policymakers as the scale of book-buying has become clearer.

For now, the most concrete outcome of the investigation is informational: a named facility, a documented journey, and a public record that the book trade's warnings were not abstract. The rare books in the tracked shipment ended their journey in Las Vegas. Their contents, presumably, live on in a training corpus.

Follow the AI Data Wars

Training data, copyright fights, and the ethics of AI at scale — covered daily at AI Buzz Wire.

Read more AI news →