La Universidad de Oxford permitió a OpenAI entrenar sus modelos de IA en textos históricos de su Biblioteca Bodleian, con material digitalizado utilizado para "poblar el conjunto de entrenamiento de OpenAI", según documentos internos informados por The Guardian el sábado, un propósito que nunca se mencionó cuando se anunció públicamente la asociación.

Oxford presentó la colaboración en marzo de 2025 como un proyecto de digitalización y dijo que el uso del software OpenAI para escanear textos de una de las bibliotecas más famosas del mundo haría que el contenido estuviera más disponible para estudiantes e investigadores. Lo que no decía el anuncio es que el material alimentaría el entrenamiento de los modelos comerciales de OpenAI. Los documentos internos revisados ​​por The Guardian hacen explícito ese propósito, lo que marca uno de los ejemplos más claros hasta la fecha de una prestigiosa institución cultural que suministra silenciosamente [materia prima para la industria de la IA] (https://aibuzzwire.news).

Una asociación con un propósito no declarado

Los detalles del acuerdo surgieron a través de una solicitud de libertad de información, que reveló actas de reuniones universitarias que registraban las preocupaciones del personal, incluidos los miembros del propio comité de gobierno de Bodleian, sobre el riesgo para la reputación de asociarse con la empresa detrás de ChatGPT. El personal también planteó el efecto que tendría un acuerdo con una empresa de tecnología de uso intensivo de energía en los compromisos ambientales de la universidad.

Un portavoz de OpenAI defendió el programa y dijo que la compañía estaba "orgullosa" de garantizar que "los modelos de IA de hoy preserven el conocimiento histórico del mundo para el futuro". "Con más de mil millones de personas que utilizan esta tecnología en la vida cotidiana, es importante que refleje diferentes culturas, historias y perspectivas", añadió el portavoz.

De las baladas Tudor a las tesis doctorales

La escala de la digitalización es sustancial. Hasta junio de 2025, se habían compartido con OpenAI 125.000 imágenes escaneadas de disertaciones históricas de la colección Bodleiana, incluidas tesis doctorales de universidades europeas y estadounidenses escritas en los siglos XIX y XX. Otro material escaneado incluye una rara colección de 10.000 "baladas de andanada" del siglo XVI: letras de canciones y notas musicales que alguna vez circularon en las esquinas de las calles Tudor.

Nada de esto es secreto en el sentido convencional; Gran parte de los fondos históricos del Bodleian son obras de dominio público, y la ley de derechos de autor impone pocas restricciones a los modelos de formación sobre textos tan antiguos. Pero la distinción entre digitalizar una biblioteca para académicos y poblar un conjunto de capacitación comercial es el tipo de distinción que históricamente se esperaba que las instituciones expresaran en voz alta. Oxford no lo hizo, y la omisión importa menos por lo que dice sobre los derechos legales que por lo que dice sobre la transparencia entre una universidad y su propia comunidad.

Bibliotecas como la nueva frontera de los datos

La avalancha por los estantes de las bibliotecas tiene un simple impulso económico: la web abierta se está quedando sin datos útiles. A medida que los sitios web eliminados se saturan con material generado por IA, la capacitación sobre ese contenido se vuelve circular y degradada, y los desarrolladores han recurrido a colecciones de libros físicos, a menudo históricos, como fuente de texto nuevo escrito por humanos.

Los síntomas son visibles en la calle principal. The Guardian informa que los libreros de segunda mano han visto una avalancha de pedidos de títulos oscuros (una guía de implementos agrícolas en África del siglo XVIII, biografías de conductores de automóviles de la década de 1950) precisamente porque es poco probable que tales libros existan en forma digitalizada en cualquier lugar en línea. Los libreros especularon que las compras representan datos nuevos para la próxima generación de modelos de IA.

OpenAI ha seguido el mismo manual en instituciones académicas y culturales. La empresa ha llegado a acuerdos con la Biblioteca Pública de Boston, Caltech, el MIT y la Universidad de Michigan en el marco de un proyecto llamado NextGenAI, en el que Oxford es el único miembro del proyecto en el Reino Unido. La Bodleian, una de las bibliotecas más antiguas de Europa con una colección que abarca milenios, es, con diferencia, la adición con más historia.

Qué significa para las instituciones culturales

Es probable que el episodio de Oxford agudice un debate que ya se desarrolla en museos, archivos y bibliotecas de todo el mundo: cuando una empresa de tecnología ofrece digitalizar una colección de forma gratuita, ¿qué se intercambia realmente? La digitalización aporta beneficios públicos genuinos: acceso, preservación y capacidad de búsqueda. Pero los documentos de Oxford sugieren que el valor fluye en ambos sentidos, y que el uso del conjunto de entrenamiento fue material para OpenAI incluso si no fue lo suficientemente material como para anunciarlo.

Para las instituciones que enfrentan presupuestos ajustados, la tentación es comprensible: la digitalización profesional es costosa y empresas como OpenAI ofrecen hacerlo sin costo alguno. Los miembros del comité de gobierno de Bodleian que estaban preocupados por el riesgo para la reputación parecen haber intuido lo que los documentos de la FOI confirmaron más tarde: que la marca de la universidad estaba dando legitimidad a un esfuerzo de adquisición de datos, fuera esa la intención o no.

La pregunta ahora es si otras instituciones insistirán en cláusulas de transparencia en sus asociaciones de IA: divulgación explícita del uso de la capacitación, exclusión voluntaria de material sensible e informes públicos sobre lo que se compartió y por qué. Hasta que lo hagan, las grandes colecciones del mundo seguirán convirtiéndose en datos de entrenamiento: un silencioso proyecto de digitalización a la vez.

---

Manténgase a la vanguardia de la IA

La batalla por los datos de entrenamiento de IA está remodelando industrias mucho más allá de la tecnología. Obtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.

Leer más noticias sobre IA →