A Universidade de Oxford permitiu que a OpenAI treinasse seus modelos de IA em textos históricos de sua Biblioteca Bodleian, com material digitalizado usado para “preencher o conjunto de treinamento da OpenAI”, de acordo com documentos internos relatados pelo The Guardian no sábado – um propósito que nunca foi mencionado quando a parceria foi anunciada publicamente.
Oxford revelou a colaboração em março de 2025 como um projeto de digitalização, dizendo que a utilização do software OpenAI para digitalizar textos de uma das bibliotecas mais famosas do mundo tornaria o conteúdo mais amplamente disponível para estudantes e investigadores. O que o anúncio não dizia era que o material alimentaria o treinamento dos modelos comerciais da OpenAI. Documentos internos revistos pelo Guardian tornam esse propósito explícito, marcando um dos exemplos mais claros até à data de uma instituição cultural de prestígio que fornece discretamente matéria-prima para a indústria da IA.
Uma parceria com um propósito não declarado
Os detalhes do acordo surgiram através de um pedido de liberdade de informação, que resultou em atas de reuniões da universidade registrando preocupações dos funcionários – incluindo membros do próprio comitê de governança do Bodleian – sobre o risco de reputação da parceria com a empresa por trás do ChatGPT. A equipe também levantou o efeito que um acordo com uma empresa de tecnologia com uso intensivo de energia teria sobre os compromissos ambientais da universidade.
Um porta-voz da OpenAI defendeu o programa, dizendo que a empresa estava “orgulhosa” em garantir que “os modelos de IA de hoje preservem o conhecimento histórico do mundo para o futuro”. “Com mais de um bilhão de pessoas usando esta tecnologia na vida cotidiana, é importante que ela reflita diferentes culturas, histórias e perspectivas”, acrescentou o porta-voz.
Das baladas Tudor às teses de doutorado
A escala da digitalização é substancial. Até junho de 2025, 125 mil imagens digitalizadas de dissertações históricas foram compartilhadas com a OpenAI da coleção Bodleian, incluindo teses de doutorado de universidades europeias e americanas escritas nos séculos XIX e XX. Outro material digitalizado inclui uma coleção rara de 10.000 "baladas laterais" do século XVI - letras de músicas e notas musicais que antes circulavam nas esquinas das ruas Tudor.
Nada disso é secreto no sentido convencional; grande parte do acervo histórico de Bodleian são obras de domínio público, e a lei de direitos autorais impõe poucas restrições aos modelos de treinamento em textos tão antigos. Mas a distinção entre digitalizar uma biblioteca para académicos e preencher um conjunto de formação comercial é o tipo de distinção que historicamente se espera que as instituições declarem em voz alta. A de Oxford não o fez - e a omissão importa menos pelo que diz sobre direitos legais do que pelo que diz sobre transparência entre uma universidade e a sua própria comunidade.
Bibliotecas como a nova fronteira de dados
A corrida pelas prateleiras das bibliotecas tem um fator económico simples: a web aberta está a ficar sem dados úteis. À medida que sites copiados ficam saturados com material gerado por IA, o treinamento sobre esse conteúdo se torna circular e degradado, e os desenvolvedores recorrem a coleções de livros físicos, muitas vezes históricos, como fonte de texto novo e escrito por humanos.
Os sintomas são visíveis nas ruas principais. O Guardian relata que os livreiros de segunda mão têm assistido a uma onda de encomendas de títulos obscuros – um guia de instrumentos agrícolas na África do século XVIII, biografias de condutores de automóveis dos anos 1950 – precisamente porque é improvável que tais livros existam em formato digital em qualquer lugar online. Os livreiros especularam que as compras representam dados novos para a próxima geração de modelos de IA.
A OpenAI seguiu o mesmo manual em todas as instituições acadêmicas e culturais. A empresa fechou acordos com a Biblioteca Pública de Boston, Caltech, MIT e a Universidade de Michigan no âmbito de um projeto chamado NextGenAI, com Oxford como o único membro do projeto no Reino Unido. A Bodleian, uma das bibliotecas mais antigas da Europa, com uma coleção que abrange milênios, é de longe a adição mais célebre.
O que isso significa para as instituições culturais
O episódio de Oxford irá provavelmente aguçar um debate que já atravessa museus, arquivos e bibliotecas em todo o mundo: quando uma empresa tecnológica se oferece para digitalizar uma colecção gratuitamente, o que está realmente a ser trocado? A digitalização traz benefícios públicos genuínos — acesso, preservação, capacidade de pesquisa. Mas os documentos de Oxford sugerem que o valor flui nos dois sentidos e que o uso do conjunto de treinamento era material para a OpenAI, mesmo que não fosse material suficiente para ser anunciado.
Para as instituições que enfrentam orçamentos apertados, a tentação é compreensível: a digitalização profissional é cara e empresas como a OpenAI oferecem-se para fazê-la gratuitamente. Os membros do comité de governação da Bodleian, preocupados com o risco de reputação, parecem ter intuído o que os documentos da FOI confirmaram mais tarde - que a marca da universidade estava a emprestar legitimidade a um esforço de aquisição de dados, fosse essa a intenção ou não.
A questão agora é se outras instituições insistirão em cláusulas de transparência nas suas parcerias de IA: divulgação explícita da utilização da formação, exclusões de material sensível e relatórios públicos sobre o que foi partilhado e porquê. Até que isso aconteça, as grandes coleções do mundo continuarão a se transformar em dados de treinamento — um projeto silencioso de digitalização por vez.
---
Fique à frente da IAA batalha pelos dados de treinamento em IA está remodelando setores que vão muito além da tecnologia. Receba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.
Leia mais notícias sobre IA →