L'Université d'Oxford a autorisé OpenAI à entraîner ses modèles d'IA sur des textes historiques de sa bibliothèque Bodleian, avec du matériel numérisé utilisé pour « alimenter l'ensemble de formation OpenAI », selon des documents internes rapportés par The Guardian samedi – un objectif qui n'a jamais été mentionné lors de l'annonce publique du partenariat.
Oxford a dévoilé cette collaboration en mars 2025 en tant que projet de numérisation, affirmant que l'utilisation du logiciel OpenAI pour numériser des textes de l'une des bibliothèques les plus célèbres au monde rendrait le contenu plus largement accessible aux étudiants et aux chercheurs. Ce que l'annonce ne disait pas, c'est que le matériel alimenterait la formation des modèles commerciaux d'OpenAI. Les documents internes examinés par le Guardian rendent cet objectif explicite, constituant l'un des exemples les plus clairs à ce jour d'une institution culturelle prestigieuse fournissant discrètement des matières premières pour l'industrie de l'IA.
Un partenariat au but non déclaré
Les détails de l'accord ont été révélés grâce à une demande d'accès à l'information, qui a fait apparaître des procès-verbaux de réunions universitaires enregistrant les préoccupations du personnel – y compris des membres du comité de gouvernance de Bodleian – concernant le risque de réputation lié au partenariat avec la société derrière ChatGPT. Le personnel a également évoqué l'effet qu'aurait un accord avec une entreprise technologique à forte intensité énergétique sur les engagements environnementaux de l'université.
Un porte-parole d'OpenAI a défendu le programme, affirmant que l'entreprise était « fière » de garantir que « les modèles d'IA d'aujourd'hui préservent les connaissances historiques du monde pour l'avenir ». "Avec plus d'un milliard de personnes utilisant cette technologie dans leur vie quotidienne, il est important qu'elle reflète différentes cultures, histoires et perspectives", a ajouté le porte-parole.
Des ballades Tudor aux thèses de doctorat
L’ampleur de la numérisation est considérable. En juin 2025, 125 000 images numérisées de thèses historiques avaient été partagées avec OpenAI à partir de la collection Bodleian, y compris des thèses de doctorat d'universités européennes et américaines rédigées aux 19e et 20e siècles. D'autres documents numérisés comprennent une rare collection de 10 000 « ballades » du XVIe siècle – des paroles de chansons et des notes de musique qui circulaient autrefois aux coins des rues Tudor.
Rien de tout cela n’est secret au sens conventionnel du terme ; une grande partie des fonds historiques de Bodleian sont des œuvres du domaine public, et la loi sur le droit d'auteur impose peu de restrictions sur les modèles de formation sur des textes aussi anciens. Mais la distinction entre numériser une bibliothèque pour les universitaires et alimenter un ensemble de formation commerciale est le genre de distinction que les institutions sont historiquement censées énoncer à haute voix. Ce n'est pas le cas d'Oxford – et cette omission importe moins pour ce qu'il dit sur les droits légaux que pour ce qu'il dit sur la transparence entre une université et sa propre communauté.
Les bibliothèques comme nouvelle frontière des données
La ruée vers les étagères des bibliothèques a un moteur économique simple : le Web ouvert manque de données utiles. À mesure que les sites Web récupérés sont saturés de matériel généré par l’IA, la formation sur ce contenu devient circulaire et dégradée, et les développeurs se sont tournés vers des collections de livres physiques, souvent historiques, comme source de nouveaux textes écrits par des humains.
Les symptômes sont visibles dans la rue principale. Le Guardian rapporte que les bouquinistes ont constaté une vague de commandes de titres obscurs – un guide sur les outils agricoles dans l’Afrique du XVIIIe siècle, des biographies d’automobilistes des années 1950 – précisément parce qu’il est peu probable que de tels livres existent sous forme numérisée en ligne. Les libraires ont émis l’hypothèse que ces achats représentaient de nouvelles données pour la prochaine génération de modèles d’IA.
OpenAI a suivi le même modèle dans les universités et les institutions culturelles. La société a conclu des accords avec la Bibliothèque publique de Boston, Caltech, le MIT et l'Université du Michigan dans le cadre d'un projet appelé NextGenAI, Oxford étant le seul membre britannique du projet. La Bodleian, l’une des plus anciennes bibliothèques d’Europe avec une collection s’étendant sur des millénaires, est de loin l’ajout le plus riche en histoire.
Ce que cela signifie pour les institutions culturelles
L’épisode d’Oxford risque d’aiguiser un débat déjà en cours dans les musées, les archives et les bibliothèques du monde entier : lorsqu’une entreprise technologique propose de numériser gratuitement une collection, qu’est-ce qui est réellement échangé ? La numérisation apporte de véritables avantages publics : accès, préservation et possibilité de recherche. Mais les documents d'Oxford suggèrent que la valeur circule dans les deux sens et que l'utilisation de l'ensemble de formation était importante pour OpenAI, même si elle n'était pas suffisamment importante pour être annoncée.
Pour les institutions confrontées à des budgets serrés, la tentation est compréhensible : la numérisation professionnelle coûte cher, et des entreprises comme OpenAI proposent de le faire gratuitement. Les membres du comité de gouvernance de Bodleian, inquiets du risque de réputation, semblent avoir eu l'intuition de ce que les documents de FOI ont confirmé plus tard : que la marque de l'université donnait une légitimité à un effort d'acquisition de données, que telle soit l'intention ou non.
La question est maintenant de savoir si d’autres institutions insisteront sur des clauses de transparence dans leurs partenariats en matière d’IA : divulgation explicite de l’utilisation de la formation, désinscription des contenus sensibles et rapports publics sur ce qui a été partagé et pourquoi. En attendant, les plus grandes collections du monde continueront à devenir des données de formation – un projet de numérisation discret à la fois.
---
Gardez une longueur d'avance sur l'IALa bataille pour les données de formation en IA remodèle des secteurs bien au-delà de la technologie. Recevez les dernières actualités, analyses et avancées en matière d'IA, le tout en un seul endroit.
Lire plus d'actualités sur l'IA →