L'Università di Oxford ha consentito a OpenAI di addestrare i suoi modelli di intelligenza artificiale su testi storici della sua Biblioteca Bodleiana, con materiale digitalizzato utilizzato per "popolare il set di formazione OpenAI", secondo i documenti interni riportati da The Guardian sabato - uno scopo che non è mai stato menzionato quando la partnership è stata annunciata pubblicamente.

Oxford ha presentato la collaborazione nel marzo 2025 come progetto di digitalizzazione, affermando che l’utilizzo del software OpenAI per scansionare i testi di una delle biblioteche più famose al mondo renderebbe il contenuto più ampiamente disponibile a studenti e ricercatori. Ciò che l'annuncio non diceva era che il materiale avrebbe alimentato la formazione dei modelli commerciali di OpenAI. I documenti interni esaminati dal Guardian rendono esplicito questo scopo, segnando uno degli esempi più chiari fino ad oggi di una prestigiosa istituzione culturale che fornisce silenziosamente [materia prima per l'industria dell'intelligenza artificiale] (https://aibuzzwire.news).

Una partnership con uno scopo non dichiarato

I dettagli dell'accordo sono emersi attraverso una richiesta di libertà di informazione, che ha prodotto verbali di riunioni universitarie che registravano le preoccupazioni del personale - compresi i membri del comitato di governance della Bodleian - sul rischio reputazionale della collaborazione con la società dietro ChatGPT. Il personale ha inoltre sottolineato l'effetto che un accordo con un'azienda tecnologica ad alto consumo energetico avrebbe sugli impegni ambientali dell'università.

Un portavoce di OpenAI ha difeso il programma, affermando che la società è "orgogliosa" di garantire che "i modelli di intelligenza artificiale di oggi preservino la conoscenza storica del mondo per il futuro". "Con oltre un miliardo di persone che utilizzano questa tecnologia nella vita di tutti i giorni, è importante che rifletta culture, storie e prospettive diverse", ha aggiunto il portavoce.

Dalle ballate Tudor alle tesi di dottorato

La portata della digitalizzazione è notevole. Entro giugno 2025, 125.000 immagini scansionate da dissertazioni storiche erano state condivise con OpenAI dalla collezione Bodleiana, comprese tesi di dottorato di università europee e americane scritte nel XIX e XX secolo. Altro materiale scansionato include una rara raccolta di 10.000 "ballate di strada" del XVI secolo: testi di canzoni e note musicali che un tempo circolavano agli angoli delle strade Tudor.

Niente di tutto ciò è segreto nel senso convenzionale; gran parte del patrimonio storico della Bodleian è costituito da opere di pubblico dominio e la legge sul copyright pone poche restrizioni sui modelli di addestramento su testi così antichi. Ma la distinzione tra digitalizzare una biblioteca per studiosi e popolare un set di formazione commerciale è il tipo di distinzione che storicamente ci si aspetta che le istituzioni affermino ad alta voce. Oxford non lo ha fatto – e l’omissione conta meno per quello che dice sui diritti legali che per quello che dice sulla trasparenza tra un’università e la sua stessa comunità.

Le biblioteche come nuova frontiera dei dati

La corsa agli scaffali delle biblioteche ha un semplice motore economico: il web aperto sta esaurendo i dati utili. Man mano che i siti web rubati si saturano di materiale generato dall’intelligenza artificiale, la formazione su quel contenuto diventa circolare e degradata e gli sviluppatori si sono rivolti a raccolte di libri fisici, spesso storici, come fonte di testo fresco scritto da esseri umani.

I sintomi sono visibili nelle strade principali. Il Guardian riferisce che i venditori di libri di seconda mano hanno assistito a un’ondata di ordini per titoli oscuri – una guida agli attrezzi agricoli nell’Africa del XVIII secolo, biografie di automobilisti degli anni ’50 – proprio perché è improbabile che tali libri esistano in forma digitalizzata ovunque online. I rivenditori di libri hanno ipotizzato che gli acquisti rappresentino dati nuovi per la prossima generazione di modelli di intelligenza artificiale.

OpenAI ha perseguito lo stesso approccio nel mondo accademico e nelle istituzioni culturali. La società ha stretto accordi con la Biblioteca pubblica di Boston, Caltech, MIT e l'Università del Michigan nell'ambito di un progetto chiamato NextGenAI, con Oxford come unico membro del progetto nel Regno Unito. La Bodleian, una delle biblioteche più antiche d'Europa con una collezione che abbraccia millenni, è di gran lunga l'aggiunta più leggendaria.

Cosa significa per le istituzioni culturali

L’episodio di Oxford probabilmente acuirà un dibattito già in corso nei musei, negli archivi e nelle biblioteche di tutto il mondo: quando un’azienda tecnologica si offre di digitalizzare una collezione gratuitamente, cosa viene effettivamente scambiato? La digitalizzazione apporta reali vantaggi pubblici: accesso, conservazione, ricercabilità. Ma i documenti di Oxford suggeriscono che il valore fluisce in entrambe le direzioni e che l’uso del set di formazione era materiale per OpenAI anche se non era abbastanza materiale da annunciare.

Per le istituzioni che si trovano ad affrontare budget limitati, la tentazione è comprensibile: la digitalizzazione professionale è costosa e aziende come OpenAI si offrono di farlo gratuitamente. I membri del comitato di governance della Bodleian, preoccupati per il rischio reputazionale, sembrano aver intuito ciò che i documenti FOI hanno successivamente confermato: che il marchio dell'università stava conferendo legittimità a uno sforzo di acquisizione dati, indipendentemente dal fatto che questo fosse o meno l'intento.

La domanda ora è se altre istituzioni insisteranno su clausole di trasparenza nei loro partenariati sull’intelligenza artificiale: divulgazione esplicita dell’uso della formazione, rinuncia per materiale sensibile e rendicontazione pubblica su ciò che è stato condiviso e perché. Fino a quando non lo faranno, le grandi collezioni del mondo continueranno a diventare dati di formazione: un silenzioso progetto di digitalizzazione alla volta.

---

Stai al passo con l'intelligenza artificiale

La battaglia per i dati di addestramento dell’intelligenza artificiale sta rimodellando i settori ben oltre la tecnologia. Ricevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.

Leggi altre notizie sull'AI →