Universiti Oxford membenarkan OpenAI melatih model AInya pada teks sejarah dari Perpustakaan Bodleiannya, dengan bahan digital yang digunakan untuk "mengisi set latihan OpenAI," menurut dokumen dalaman yang dilaporkan oleh The Guardian pada hari Sabtu - tujuan yang tidak pernah disebut apabila perkongsian itu diumumkan secara terbuka.
Oxford melancarkan kerjasama itu pada Mac 2025 sebagai projek pendigitalan, dengan mengatakan bahawa menggunakan perisian OpenAI untuk mengimbas teks daripada salah satu perpustakaan paling terkenal di dunia akan menjadikan kandungan itu tersedia dengan lebih meluas kepada pelajar dan penyelidik. Apa yang tidak dinyatakan oleh pengumuman itu ialah bahan itu akan memberi latihan kepada model komersial OpenAI. Dokumen dalaman yang disemak oleh Guardian menyatakan tujuan itu jelas, menandakan salah satu contoh paling jelas sehingga kini institusi budaya berprestij yang membekalkan [bahan mentah untuk industri AI] secara senyap-senyap (https://aibuzzwire.news).
Perkongsian dengan tujuan yang tidak dinyatakan
Butiran pengaturan itu muncul melalui permintaan kebebasan maklumat, yang memaparkan minit mesyuarat universiti yang merekodkan kebimbangan daripada kakitangan — termasuk ahli jawatankuasa tadbir urus Bodleian sendiri — tentang risiko reputasi bekerjasama dengan syarikat di sebalik ChatGPT. Kakitangan juga membangkitkan kesan perjanjian dengan syarikat teknologi intensif tenaga terhadap komitmen alam sekitar universiti.
Jurucakap OpenAI mempertahankan program itu, berkata syarikat itu "berbangga" untuk memastikan "model AI hari ini mengekalkan pengetahuan sejarah dunia untuk masa depan." "Dengan lebih daripada satu bilion orang menggunakan teknologi ini dalam kehidupan seharian, adalah penting ia mencerminkan budaya, sejarah dan perspektif yang berbeza," tambah jurucakap itu.
Daripada balada Tudor kepada tesis kedoktoran
Skala pendigitalan adalah besar. Menjelang Jun 2025, 125,000 imej yang diimbas daripada disertasi sejarah telah dikongsi dengan OpenAI daripada koleksi Bodleian, termasuk tesis PhD daripada universiti Eropah dan Amerika yang ditulis pada abad ke-19 dan ke-20. Bahan lain yang diimbas termasuk koleksi jarang 10,000 "balada luas" abad keenam belas — lirik lagu dan nota muzik yang pernah diedarkan di sudut jalan Tudor.
Tiada satu pun daripadanya adalah rahsia dalam pengertian konvensional; kebanyakan pegangan sejarah Bodleian adalah karya domain awam, dan undang-undang hak cipta meletakkan sedikit sekatan pada model latihan pada teks yang lama. Tetapi perbezaan antara mendigitalkan perpustakaan untuk cendekiawan dan mengisi set latihan komersil adalah jenis perbezaan yang secara sejarah dijangka dinyatakan dengan lantang oleh institusi. Oxford's tidak — dan peninggalan kurang penting untuk perkara yang dikatakan tentang hak undang-undang berbanding dengan apa yang dikatakan tentang ketelusan antara universiti dan komunitinya sendiri.
Perpustakaan sebagai sempadan data baharu
Tergesa-gesa untuk rak perpustakaan mempunyai pemacu ekonomi yang mudah: web terbuka kehabisan data berguna. Apabila tapak web yang dikikis menjadi tepu dengan bahan yang dijana AI, latihan tentang kandungan itu menjadi bulat dan dihina, dan pembangun telah beralih kepada koleksi buku fizikal, selalunya bersejarah sebagai sumber teks tulisan manusia yang segar.
Gejala kelihatan di jalan raya. The Guardian melaporkan bahawa penjual buku terpakai telah melihat berturut-turut pesanan untuk tajuk yang tidak jelas - panduan kepada peralatan pertanian di Afrika abad ke-18, biografi pemandu kereta 1950-an - tepat kerana buku sedemikian tidak mungkin wujud dalam bentuk digital di mana-mana dalam talian. Penjual buku membuat spekulasi pembelian itu mewakili data baharu untuk model AI generasi akan datang.
OpenAI telah meneruskan buku permainan yang sama merentas institusi akademik dan kebudayaan. Syarikat itu telah mencapai persetujuan dengan Perpustakaan Awam Boston, Caltech, MIT, dan Universiti Michigan di bawah projek yang dipanggil NextGenAI, dengan Oxford sebagai satu-satunya ahli UK projek itu. The Bodleian, salah satu perpustakaan tertua di Eropah dengan koleksi menjangkau beribu tahun, adalah dalam beberapa jarak tambahan yang paling bertingkat.
Maksudnya bagi institusi kebudayaan
Episod Oxford berkemungkinan akan mempertajam perdebatan yang sudah berjalan melalui muzium, arkib dan perpustakaan di seluruh dunia: apabila syarikat teknologi menawarkan untuk mendigitalkan koleksi secara percuma, apakah yang sebenarnya sedang ditukar? Pendigitalan membawa faedah awam yang tulen — akses, pemeliharaan, kebolehcarian. Tetapi dokumen Oxford mencadangkan nilai mengalir kedua-dua arah, dan penggunaan set latihan adalah penting kepada OpenAI walaupun ia tidak cukup material untuk diumumkan.
Bagi institusi yang menghadapi belanjawan yang ketat, godaan itu boleh difahami: pendigitalan profesional adalah mahal, dan syarikat seperti OpenAI menawarkan untuk melakukannya tanpa sebarang kos. Ahli jawatankuasa tadbir urus Bodleian yang bimbang tentang risiko reputasi nampaknya telah memahami apa yang disahkan oleh dokumen FOI kemudiannya — bahawa jenama universiti itu memberi kesahihan kepada usaha pemerolehan data, sama ada niat itu atau tidak.
Persoalannya sekarang ialah sama ada institusi lain akan mendesak klausa ketelusan dalam perkongsian AI mereka: pendedahan eksplisit penggunaan latihan, menarik diri untuk bahan sensitif dan pelaporan awam tentang perkara yang dikongsi dan sebabnya. Sehingga mereka melakukannya, koleksi hebat dunia akan terus menjadi data latihan — satu projek pendigitalan senyap pada satu masa.
---
Kekal Mendahului AIPertempuran untuk data latihan AI sedang membentuk semula industri yang jauh melangkaui teknologi. Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.
Baca lebih banyak berita AI →