Oxfordská univerzita umožnila OpenAI trénovat své modely umělé inteligence na historických textech z její Bodleian Library, s digitalizovaným materiálem použitým k „vyplnění školicí sady OpenAI“, podle interních dokumentů, o kterých v sobotu informoval The Guardian – účel, který nebyl nikdy zmíněn, když bylo partnerství veřejně oznámeno.

Oxford představil spolupráci v březnu 2025 jako projekt digitalizace s tím, že použití softwaru OpenAI ke skenování textů z jedné z nejslavnějších světových knihoven by umožnilo širší dostupnost obsahu pro studenty a výzkumné pracovníky. Oznámení neuvádělo, že materiál bude živit školení komerčních modelů OpenAI. Interní dokumenty zkontrolované Guardianem tento účel výslovně uvádějí a představují jeden z dosud nejjasnějších příkladů prestižní kulturní instituce, která tiše dodává surovinu pro průmysl AI.

Partnerství s nevysloveným účelem

Podrobnosti o ujednání se objevily na základě žádosti o svobodu informací, která se objevila v zápisech z univerzitních schůzí, které zaznamenávaly obavy zaměstnanců – včetně členů vlastního správního výboru Bodleian – ohledně rizika reputace partnerství se společností stojící za ChatGPT. Zaměstnanci také upozornili na vliv dohody s energeticky náročnou technologickou společností na environmentální závazky univerzity.

Mluvčí OpenAI obhajoval program a řekl, že společnost je „hrdá“, že zajistila, že „současné modely umělé inteligence uchovávají historické znalosti světa pro budoucnost“. "Vzhledem k tomu, že více než miliarda lidí používá tuto technologii v každodenním životě, je důležité, aby odrážela různé kultury, historie a perspektivy," dodal mluvčí.

Od tudorovských balad k doktorským pracím

Rozsah digitalizace je značný. Do června 2025 bylo s OpenAI ze sbírky Bodleian sdíleno 125 000 obrázků naskenovaných z historických disertací, včetně doktorandských prací z evropských a amerických univerzit napsaných v 19. a 20. století. Další naskenovaný materiál zahrnuje vzácnou sbírku 10 000 „balad“ ze šestnáctého století – texty písní a hudební noty, které kdysi kolovaly na rozích ulic Tudor.

Nic z toho není tajné v konvenčním smyslu; velká část historických sbírek Bodleianů jsou veřejná díla a zákon o autorských právech klade jen málo omezení na cvičné modely na texty tak staré. Ale rozdíl mezi digitalizací knihovny pro vědce a zalidněním komerční školicí sady je druh rozdílu, o kterém se historicky očekávalo, že instituce nahlas vyjádří. Oxford to neudělal – a opomenutí není důležité pro to, co říká o zákonných právech, než pro to, co říká o transparentnosti mezi univerzitou a její vlastní komunitou.

Knihovny jako nová datová hranice

Shon po knihovních regálech má jednoduchý ekonomický faktor: otevřenému webu docházejí užitečná data. Jak se škrábané webové stránky nasycují materiálem generovaným umělou inteligencí, školení o tomto obsahu se stává kruhovým a degradovaným a vývojáři se obrátili na fyzické, často historické sbírky knih jako zdroj čerstvého, lidmi psaného textu.

Příznaky jsou viditelné na hlavní ulici. The Guardian uvádí, že antikvariáti zaznamenali záplavu objednávek na obskurní tituly – průvodce po zemědělském nářadí v Africe 18. století, biografie řidičů aut z 50. let – právě proto, že takové knihy pravděpodobně nikde online v digitalizované podobě neexistují. Knihkupci spekulovali, že nákupy představují čerstvá data pro příští generaci modelů AI.

OpenAI sledovala stejnou příručku napříč akademickými a kulturními institucemi. Společnost uzavřela dohody s Boston Public Library, Caltech, MIT a University of Michigan v rámci projektu nazvaného NextGenAI, přičemž Oxford je jediným členem projektu ve Spojeném království. Bodleian, jedna z nejstarších knihoven v Evropě se sbírkou pokrývající tisíciletí, je do jisté míry nejznámějším přírůstkem.

Co to znamená pro kulturní instituce

Epizoda z Oxfordu pravděpodobně vyostří debatu, která již probíhá v muzeích, archivech a knihovnách po celém světě: když technologická společnost nabídne zdarma digitalizaci sbírky, co se vlastně vyměňuje? Digitalizace přináší skutečné veřejné výhody – přístup, uchovávání, vyhledávání. Oxfordské dokumenty však naznačují, že hodnoty toky obousměrně jdou a že použití školicí sady bylo pro OpenAI podstatné, i když nebylo dostatečně podstatné na to, aby bylo oznámeno.

Pro instituce, které se potýkají s napjatými rozpočty, je pokušení pochopitelné: profesionální digitalizace je drahá a společnosti jako OpenAI ji nabízejí zdarma. Zdá se, že členové správního výboru Bodleian, kteří se obávali reputačního rizika, intuitivně pochopili to, co dokumenty FOI později potvrdily – že značka univerzity propůjčovala legitimitu úsilí o získávání dat, ať už to byl záměr nebo ne.

Otázkou nyní je, zda ostatní instituce budou ve svých partnerstvích s umělou inteligencí trvat na doložkách o transparentnosti: explicitní zveřejnění využití školení, neúčasti na citlivých materiálech a veřejné podávání zpráv o tom, co bylo sdíleno a proč. Dokud to neudělají, skvělé světové sbírky se budou i nadále stávat školicími daty – jeden tichý digitalizační projekt za druhým.

---

Stay Ahead of AI

Bitva o tréninková data AI mění průmyslová odvětví daleko za hranice technologií. Získejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.

Přečtěte si další zprávy o AI →