Universitatea din Oxford a permis OpenAI să-și antreneze modelele AI pe textele istorice din Biblioteca sa Bodleian, cu material digitizat folosit pentru a „popula setul de antrenament OpenAI”, conform documentelor interne raportate de The Guardian sâmbătă – un scop care nu a fost niciodată menționat când parteneriatul a fost anunțat public.

Oxford a dezvăluit colaborarea în martie 2025 ca un proiect de digitizare, spunând că utilizarea software-ului OpenAI pentru a scana texte dintr-una dintre cele mai faimoase biblioteci din lume ar face conținutul mai disponibil pentru studenți și cercetători. Ceea ce nu spunea anunțul a fost că materialul va alimenta instruirea modelelor comerciale OpenAI. Documentele interne revizuite de The Guardian fac acest scop explicit, marcând unul dintre cele mai clare exemple de până acum ale unei prestigioase instituții culturale care furnizează în liniște materia primă pentru industria AI.

Un parteneriat cu un scop nedeclarat

Detaliile privind aranjamentul au apărut printr-o solicitare privind libertatea de informare, care a afișat procesele-verbale ședințelor universitare care consemnau preocupările personalului - inclusiv membrii comitetului de guvernare al lui Bodleian - cu privire la riscul reputațional al parteneriatului cu compania din spatele ChatGPT. De asemenea, personalul a subliniat efectul pe care un acord cu o companie de tehnologie consumatoare de energie ar avea asupra angajamentelor universității în materie de mediu.

Un purtător de cuvânt al OpenAI a apărat programul, spunând că compania este „mândru” să se asigure că „modelele AI de astăzi păstrează cunoștințele istorice ale lumii pentru viitor”. „Cu mai mult de un miliard de oameni care folosesc această tehnologie în viața de zi cu zi, este important să reflecte diferite culturi, istorii și perspective”, a adăugat purtătorul de cuvânt.

De la baladele Tudor la teze de doctorat

Amploarea digitizării este substanțială. Până în iunie 2025, 125.000 de imagini scanate din disertații istorice au fost partajate cu OpenAI din colecția Bodleian, inclusiv teze de doctorat de la universități europene și americane scrise în secolele XIX și XX. Alte materiale scanate includ o colecție rară de 10.000 de „balade” din secolul al XVI-lea – versuri de cântece și note muzicale care circulau cândva la colțurile străzilor Tudor.

Nimic din el nu este secret în sensul convențional; mare parte din exploatațiile istorice ale lui Bodleian sunt lucrări din domeniul public, iar legea dreptului de autor impune puține restricții asupra modelelor de instruire pe texte atât de vechi. Dar distincția dintre digitizarea unei biblioteci pentru cercetători și popularea unui set de formare comercială este genul de distincție pe care, din punct de vedere istoric, se aștepta ca instituțiile să o spună cu voce tare. Oxford nu a făcut-o - și omisiunea contează mai puțin pentru ceea ce spune despre drepturile legale decât pentru ceea ce spune despre transparența dintre o universitate și propria comunitate.

Bibliotecile ca noua frontieră de date

Goana după rafturile bibliotecii are un factor economic simplu: web-ul deschis rămâne fără date utile. Pe măsură ce site-urile web răzuite devin saturate cu materiale generate de inteligență artificială, instruirea cu privire la acel conținut devine circulară și degradată, iar dezvoltatorii au apelat la colecții de cărți fizice, adesea istorice, ca o sursă de text proaspăt, scris de om.

Simptomele sunt vizibile pe strada principală. The Guardian raportează că vânzătorii de cărți second-hand au văzut o serie de comenzi pentru titluri obscure - un ghid al instrumentelor agricole în Africa secolului al XVIII-lea, biografii ale șoferilor de mașini din anii 1950 - tocmai pentru că este puțin probabil ca astfel de cărți să existe în formă digitalizată oriunde online. Librăriile au speculat că achizițiile reprezintă date noi pentru următoarea generație de modele AI.

OpenAI a urmărit același manual în mediul academic și instituțiile culturale. Compania a încheiat acorduri cu Biblioteca Publică din Boston, Caltech, MIT și Universitatea din Michigan în cadrul unui proiect numit NextGenAI, Oxford fiind singurul membru al proiectului din Marea Britanie. Bodleian, una dintre cele mai vechi biblioteci din Europa, cu o colecție care se întinde pe milenii, este, la oarecare distanță, cea mai bogată adăugare.

Ce înseamnă pentru instituțiile culturale

Episodul de la Oxford va ascuți probabil o dezbatere care se desfășoară deja prin muzee, arhive și biblioteci din întreaga lume: atunci când o companie de tehnologie oferă să digitizeze o colecție gratuit, ce se schimbă de fapt? Digitalizarea aduce beneficii publice reale — acces, conservare, posibilitate de căutare. Dar documentele Oxford sugerează că valoarea curge în ambele sensuri și că utilizarea setului de instruire a fost materială pentru OpenAI, chiar dacă nu a fost suficient de material pentru a fi anunțat.

Pentru instituțiile care se confruntă cu bugete strânse, tentația este de înțeles: digitizarea profesională este costisitoare, iar companii precum OpenAI se oferă să o facă fără niciun cost. Membrii comitetului de guvernanță al lui Bodleian, care erau îngrijorați de riscul reputațional, par să fi intuit ceea ce documentele FOI au confirmat ulterior - că marca universității dă legitimitate unui efort de achiziție de date, indiferent dacă aceasta a fost sau nu intenția.

Întrebarea este acum dacă alte instituții vor insista asupra clauzelor de transparență în parteneriatele lor cu inteligența artificială: dezvăluirea explicită a utilizării instruirii, renunțarea la materialele sensibile și raportarea publică cu privire la ceea ce a fost distribuit și de ce. Până când o vor face, marile colecții ale lumii vor continua să devină date de instruire — câte un proiect de digitalizare liniștit la un moment dat.

---

Rămâneți înaintea AI

Bătălia pentru datele de instruire AI transformă industriile cu mult dincolo de tehnologie. Obțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.

Citiți mai multe știri AI →