Universitas Oxford mengizinkan OpenAI untuk melatih model AI-nya berdasarkan teks sejarah dari Perpustakaan Bodleian miliknya, dengan materi digital yang digunakan untuk "mengisi set pelatihan OpenAI," menurut dokumen internal yang dilaporkan oleh The Guardian pada hari Sabtu – sebuah tujuan yang tidak pernah disebutkan ketika kemitraan tersebut diumumkan secara publik.

Oxford meluncurkan kolaborasi tersebut pada Maret 2025 sebagai proyek digitalisasi, dan mengatakan bahwa penggunaan perangkat lunak OpenAI untuk memindai teks dari salah satu perpustakaan paling terkenal di dunia akan membuat konten tersedia lebih luas bagi mahasiswa dan peneliti. Apa yang tidak disebutkan dalam pengumuman tersebut adalah bahwa materi tersebut akan digunakan untuk pelatihan model komersial OpenAI. Dokumen internal yang ditinjau oleh Guardian memperjelas tujuan tersebut, menandai salah satu contoh paling jelas hingga saat ini tentang lembaga kebudayaan bergengsi yang secara diam-diam memasok bahan mentah untuk industri AI.

Kemitraan dengan tujuan yang tidak disebutkan

Rincian pengaturan tersebut muncul melalui permintaan kebebasan informasi, yang menghasilkan notulensi rapat universitas yang mencatat kekhawatiran dari staf – termasuk anggota komite tata kelola Bodleian sendiri – tentang risiko reputasi bermitra dengan perusahaan di balik ChatGPT. Staf juga mengemukakan dampak kesepakatan dengan perusahaan teknologi intensif energi terhadap komitmen lingkungan universitas.

Seorang juru bicara OpenAI membela program tersebut, dengan mengatakan bahwa perusahaannya “bangga” untuk memastikan “model AI saat ini melestarikan pengetahuan sejarah dunia untuk masa depan.” “Dengan lebih dari satu miliar orang menggunakan teknologi ini dalam kehidupan sehari-hari, penting bagi teknologi ini untuk mencerminkan budaya, sejarah, dan perspektif yang berbeda,” tambah juru bicara tersebut.

Dari balada Tudor hingga tesis doktoral

Skala digitalisasi sangat besar. Pada bulan Juni 2025, 125.000 gambar yang dipindai dari disertasi sejarah telah dibagikan dengan OpenAI dari koleksi Bodleian, termasuk tesis PhD dari universitas-universitas Eropa dan Amerika yang ditulis pada abad ke-19 dan ke-20. Materi lain yang dipindai mencakup koleksi langka 10.000 "balada sisi lebar" abad keenam belas — lirik lagu dan not musik yang pernah beredar di sudut jalan Tudor.

Tidak ada satupun yang rahasia dalam pengertian konvensional; sebagian besar kepemilikan bersejarah Bodleian adalah karya domain publik, dan undang-undang hak cipta memberikan sedikit batasan pada model pelatihan pada teks-teks kuno. Namun perbedaan antara digitalisasi perpustakaan untuk para sarjana dan pengisian set pelatihan komersial adalah jenis perbedaan yang secara historis diharapkan untuk diungkapkan dengan jelas oleh lembaga-lembaga. Oxford tidak melakukan hal yang sama – dan penghilangan ini tidak terlalu berarti bagi apa yang dinyatakannya mengenai hak-hak hukum, dibandingkan dengan apa yang dinyatakannya mengenai transparansi antara universitas dan komunitasnya sendiri.

Perpustakaan sebagai data frontier baru

Keterburuan rak perpustakaan mempunyai pendorong ekonomi yang sederhana: web terbuka kehabisan data yang berguna. Ketika situs web yang tergores menjadi jenuh dengan materi yang dihasilkan AI, pelatihan tentang konten tersebut menjadi melingkar dan terdegradasi, dan pengembang beralih ke koleksi buku fisik, seringkali sejarah, sebagai sumber teks segar yang ditulis oleh manusia.

Gejalanya terlihat di jalan raya. The Guardian melaporkan bahwa penjual buku bekas telah melihat serentetan pesanan dengan judul yang tidak jelas – panduan peralatan pertanian di Afrika abad ke-18, biografi pengemudi mobil tahun 1950-an – justru karena buku-buku semacam itu tidak mungkin ada dalam bentuk digital di mana pun secara online. Penjual buku berspekulasi bahwa pembelian tersebut mewakili data baru untuk model AI generasi berikutnya.

OpenAI telah menerapkan pedoman yang sama di seluruh akademisi dan institusi budaya. Perusahaan ini telah mencapai kesepakatan dengan Perpustakaan Umum Boston, Caltech, MIT, dan Universitas Michigan di bawah proyek yang disebut NextGenAI, dengan Oxford sebagai satu-satunya anggota proyek tersebut di Inggris. Bodleian, salah satu perpustakaan tertua di Eropa dengan koleksi yang mencakup ribuan tahun, merupakan perpustakaan tambahan yang paling bertingkat.

Apa artinya bagi institusi kebudayaan

Peristiwa di Oxford kemungkinan akan mempertajam perdebatan yang sudah terjadi di museum, arsip, dan perpustakaan di seluruh dunia: ketika sebuah perusahaan teknologi menawarkan untuk mendigitalkan koleksinya secara gratis, apa yang sebenarnya dipertukarkan? Digitalisasi memberikan manfaat nyata bagi publik — akses, pelestarian, dan kemudahan pencarian. Namun dokumen Oxford menunjukkan bahwa nilai tersebut mengalir dua arah, dan bahwa penggunaan set pelatihan merupakan hal yang penting bagi OpenAI meskipun hal tersebut tidak cukup penting untuk diumumkan.

Bagi institusi yang memiliki anggaran ketat, godaan ini dapat dimengerti: digitalisasi profesional membutuhkan biaya yang mahal, dan perusahaan seperti OpenAI menawarkan untuk melakukannya tanpa biaya. Anggota komite tata kelola Bodleian yang mengkhawatirkan risiko reputasi tampaknya memiliki intuisi terhadap apa yang kemudian dikonfirmasi oleh dokumen FOI — bahwa merek universitas memberikan legitimasi pada upaya akuisisi data, baik itu tujuannya atau tidak.

Pertanyaannya sekarang adalah apakah lembaga-lembaga lain akan memaksakan klausul transparansi dalam kemitraan AI mereka: pengungkapan eksplisit penggunaan pelatihan, penolakan terhadap materi sensitif, dan pelaporan publik tentang apa yang dibagikan dan alasannya. Sampai hal ini terjadi, koleksi-koleksi hebat di dunia akan terus menjadi data pelatihan — sebuah proyek digitalisasi yang diam-diam dalam satu waktu.

---

Tetap Terdepan dalam AI

Perjuangan untuk mendapatkan data pelatihan AI sedang mengubah industri yang jauh melampaui teknologi. Dapatkan berita, analisis, dan terobosan AI terkini — semuanya di satu tempat.

Baca berita AI selengkapnya →