De Universiteit van Oxford stond OpenAI toe om zijn AI-modellen te trainen op historische teksten uit de Bodleian Library, met gedigitaliseerd materiaal dat werd gebruikt om “de OpenAI-trainingsset te vullen”, volgens interne documenten die zaterdag door The Guardian werden gerapporteerd – een doel dat nooit werd genoemd toen het partnerschap publiekelijk werd aangekondigd.
Oxford onthulde de samenwerking in maart 2025 als een digitaliseringsproject en zei dat het gebruik van OpenAI-software om teksten uit een van 's werelds beroemdste bibliotheken te scannen de inhoud breder beschikbaar zou maken voor studenten en onderzoekers. Wat de aankondiging niet zei, was dat het materiaal de training van de commerciële modellen van OpenAI zou voeden. Interne documenten die door The Guardian zijn beoordeeld, maken dat doel expliciet en vormen een van de duidelijkste voorbeelden tot nu toe van een prestigieuze culturele instelling die stilletjes [grondstof voor de AI-industrie] levert (https://aibuzzwire.news).
Een partnerschap met een onuitgesproken doel
Details van de regeling kwamen naar voren via een verzoek om vrijheid van informatie, waarbij notulen van universiteitsvergaderingen naar voren kwamen waarin de zorgen van medewerkers – waaronder leden van Bodleian's eigen bestuurscommissie – over het reputatierisico van de samenwerking met het bedrijf achter ChatGPT waren vastgelegd. Medewerkers wezen ook op het effect dat een deal met een energie-intensief technologiebedrijf zou hebben op de milieuverplichtingen van de universiteit.
Een woordvoerder van OpenAI verdedigde het programma en zei dat het bedrijf ‘trots’ was om ervoor te zorgen dat ‘de AI-modellen van vandaag de historische kennis van de wereld voor de toekomst behouden’. “Aangezien meer dan een miljard mensen deze technologie in het dagelijks leven gebruiken, is het belangrijk dat deze verschillende culturen, geschiedenissen en perspectieven weerspiegelt”, voegde de woordvoerder eraan toe.
Van Tudor-ballades tot proefschriften
De omvang van de digitalisering is aanzienlijk. In juni 2025 waren 125.000 gescande afbeeldingen uit historische proefschriften uit de Bodleian-collectie met OpenAI gedeeld, inclusief proefschriften van Europese en Amerikaanse universiteiten geschreven in de 19e en 20e eeuw. Ander gescand materiaal omvat een zeldzame verzameling van 10.000 zestiende-eeuwse ‘broadside ballads’ – songteksten en muzieknoten die ooit op de straathoeken van Tudor circuleerden.
Niets ervan is geheim in de conventionele zin; Een groot deel van de historische bezittingen van Bodleian zijn werken uit het publieke domein, en de auteursrechtwetgeving legt weinig beperkingen op aan het trainen van modellen op zulke oude teksten. Maar het onderscheid tussen het digitaliseren van een bibliotheek voor wetenschappers en het bevolken van een commerciële opleidingsset is het soort onderscheid waarvan van instellingen historisch gezien werd verwacht dat ze dit hardop uitdrukten. Dat van Oxford niet – en de weglating doet er minder toe voor wat het zegt over wettelijke rechten dan voor wat het zegt over transparantie tussen een universiteit en haar eigen gemeenschap.
Bibliotheken als de nieuwe datagrens
De haast om bibliotheekplanken te bemachtigen heeft een simpele economische drijfveer: het open web heeft bijna geen bruikbare gegevens meer. Naarmate afgedankte websites verzadigd raken met door AI gegenereerd materiaal, wordt de training over die inhoud circulair en verslechtert, en ontwikkelaars hebben zich tot fysieke, vaak historische, boekencollecties gewend als bron van nieuwe, door mensen geschreven tekst.
De symptomen zijn zichtbaar in de winkelstraat. The Guardian meldt dat tweedehandsboekverkopers een golf van bestellingen hebben gezien voor obscure titels – een gids voor landbouwwerktuigen in het 18e-eeuwse Afrika, biografieën van automobilisten uit de jaren vijftig – juist omdat het onwaarschijnlijk is dat dergelijke boeken ergens online in gedigitaliseerde vorm zullen bestaan. Boekverkopers speculeerden dat de aankopen nieuwe gegevens vertegenwoordigen voor de volgende generatie AI-modellen.
OpenAI heeft hetzelfde draaiboek gevolgd in de academische wereld en culturele instellingen. Het bedrijf heeft overeenkomsten gesloten met de Boston Public Library, Caltech, MIT en de Universiteit van Michigan in het kader van een project genaamd NextGenAI, met Oxford als het enige Britse lid van het project. De Bodleian, een van de oudste bibliotheken in Europa met een collectie die duizenden jaren beslaat, is met afstand de meest legendarische toevoeging.
Wat het betekent voor culturele instellingen
De Oxford-episode zal waarschijnlijk een debat verscherpen dat al door musea, archieven en bibliotheken wereldwijd loopt: wanneer een technologiebedrijf aanbiedt een collectie gratis te digitaliseren, wat wordt er dan feitelijk uitgewisseld? Digitalisering brengt echte publieke voordelen met zich mee: toegang, bewaring en doorzoekbaarheid. Maar de Oxford-documenten suggereren dat de waarde in beide richtingen stroomt, en dat het gebruik van de trainingssets essentieel was voor OpenAI, ook al was het niet materieel genoeg om aan te kondigen.
Voor instellingen die met krappe budgetten te maken hebben, is de verleiding begrijpelijk: professionele digitalisering is duur, en bedrijven als OpenAI bieden aan om dit kosteloos te doen. De leden van de bestuurscommissie van Bodleian, die zich zorgen maakten over het reputatierisico, lijken aan te voelen wat de FOI-documenten later bevestigden: dat het merk van de universiteit legitimiteit verleende aan een poging tot gegevensverzameling, of dat nu de bedoeling was of niet.
De vraag is nu of andere instellingen zullen aandringen op transparantieclausules in hun AI-partnerschappen: expliciete openbaarmaking van trainingsgebruik, opt-outs voor gevoelig materiaal en openbare rapportage over wat er is gedeeld en waarom. Zolang dat niet het geval is, zullen de grootste collecties ter wereld trainingsgegevens blijven worden: één stil digitaliseringsproject tegelijk.
---
Blijf AI een stap voorDe strijd om AI-trainingsgegevens verandert industrieën die veel verder gaan dan de technologie. Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.
Lees meer AI-nieuws →