University of Oxford tillät OpenAI att träna sina AI-modeller på historiska texter från dess Bodleian Library, med digitaliserat material som användes för att "befolka OpenAI-utbildningssetet", enligt interna dokument som rapporterades av The Guardian på lördagen - ett syfte som aldrig nämndes när partnerskapet offentliggjordes.

Oxford avslöjade samarbetet i mars 2025 som ett digitaliseringsprojekt och sa att att använda OpenAI-mjukvara för att skanna texter från ett av världens mest kända bibliotek skulle göra innehållet mer allmänt tillgängligt för studenter och forskare. Vad tillkännagivandet inte sa var att materialet skulle mata utbildningen av OpenAI:s kommersiella modeller. Interna dokument som granskats av Guardian gör detta syfte tydligt och markerar ett av de tydligaste exemplen hittills på en prestigefylld kulturinstitution som i tysthet levererar råmaterial till AI-industrin.

Ett partnerskap med ett outtalat syfte

Detaljer om arrangemanget framkom genom en begäran om informationsfrihet, som visade universitetsmötesprotokoll som registrerade oro från personal - inklusive medlemmar av Bodleians egen styrningskommitté - om ryktesrisken med att samarbeta med företaget bakom ChatGPT. Personalen tog också upp vilken effekt ett avtal med ett energiintensivt teknikföretag skulle få på universitetets miljöåtagande.

En talesperson för OpenAI försvarade programmet och sa att företaget var "stolt" över att säkerställa att "dagens AI-modeller bevarar världens historiska kunskap för framtiden." "Med mer än en miljard människor som använder den här tekniken i vardagen är det viktigt att den speglar olika kulturer, historia och perspektiv", tillade talesmannen.

Från Tudor-ballader till doktorsavhandlingar

Digitaliseringens omfattning är betydande. I juni 2025 hade 125 000 bilder skannade från historiska avhandlingar delats med OpenAI från Bodleian-samlingen, inklusive doktorsavhandlingar från europeiska och amerikanska universitet skrivna på 1800- och 1900-talen. Annat material som skannats inkluderar en sällsynt samling av 10 000 "bredsidesballader" från 1500-talet - sångtexter och musiknoter som en gång cirkulerade i Tudors gathörn.

Inget av det är hemligt i konventionell mening; mycket av Bodleians historiska innehav är offentliga verk, och upphovsrättslagen sätter få begränsningar för utbildningsmodeller på så gamla texter. Men skillnaden mellan att digitalisera ett bibliotek för forskare och att befolka en kommersiell utbildningsuppsättning är den typ av distinktion som institutioner historiskt har förväntats säga högt. Oxfords gjorde det inte - och utelämnandet spelar mindre roll för vad den säger om juridiska rättigheter än för vad den säger om transparens mellan ett universitet och det egna samhället.

Bibliotek som den nya datagränsen

Rusningen efter bibliotekshyllor har en enkel ekonomisk drivkraft: den öppna webben håller på att ta slut på användbar data. När skrapade webbplatser blir mättade med AI-genererat material, blir utbildningen i det innehållet cirkulär och försämrad, och utvecklare har vänt sig till fysiska, ofta historiska, boksamlingar som en källa till färsk, mänskligt skriven text.

Symtomen är synliga på huvudgatan. The Guardian rapporterar att begagnade bokhandlare har sett en mängd beställningar på obskyra titlar – en guide till jordbruksredskap i 1700-talets Afrika, biografier om 1950-talets bilförare – just för att sådana böcker sannolikt inte kommer att finnas i digitaliserad form någonstans på nätet. Bokhandlare spekulerade i att köpen representerade färska data för nästa generations AI-modeller.

OpenAI har eftersträvat samma spelbok över akademi och kulturinstitutioner. Företaget har träffat avtal med Boston Public Library, Caltech, MIT och University of Michigan under ett projekt som kallas NextGenAI, med Oxford som projektets enda brittiska medlem. Bodleian, ett av de äldsta biblioteken i Europa med en samling som sträcker sig över årtusenden, är på ett avstånd det mest kända tillägget.

Vad det betyder för kulturinstitutioner

Oxford-avsnittet kommer sannolikt att skärpa en debatt som redan pågår genom museer, arkiv och bibliotek över hela världen: när ett teknikföretag erbjuder sig att digitalisera en samling gratis, vad är det egentligen som utbyts? Digitalisering ger genuina allmänna fördelar – tillgång, bevarande, sökbarhet. Men Oxford-dokumenten tyder på att värdet flyter åt båda hållen, och att användningen av träningssetet var väsentligt för OpenAI även om det inte var tillräckligt material för att tillkännage.

För institutioner som står inför snäva budgetar är frestelsen förståelig: professionell digitalisering är dyr, och företag som OpenAI erbjuder sig att göra det utan kostnad. Medlemmarna i Bodleians styrelsekommitté som oroade sig för ryktesrisk verkar ha insett vad FOI-dokumenten senare bekräftade - att universitetets varumärke gav legitimitet till en datainsamlingssatsning, oavsett om det var avsikten eller inte.

Frågan är nu om andra institutioner kommer att insistera på öppenhetsklausuler i sina AI-partnerskap: explicit avslöjande av utbildningsanvändning, opt-out för känsligt material och offentlig rapportering om vad som delades och varför. Tills de gör det kommer världens stora samlingar att fortsätta att bli träningsdata – ett tyst digitaliseringsprojekt i taget.

---

Stay ahead of AI

Kampen om AI-utbildningsdata omformar branscher långt bortom tekniken. Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.

Läs mer AI-nyheter →