ऑक्सफर्ड युनिव्हर्सिटीने OpenAI ला त्याच्या बॉडलियन लायब्ररीतील ऐतिहासिक ग्रंथांवर AI मॉडेल्सचे प्रशिक्षण देण्याची परवानगी दिली, ज्यामध्ये "OpenAI प्रशिक्षण संच भरून काढण्यासाठी" डिजीटाइज्ड साहित्याचा वापर केला जातो, असे अंतर्गत दस्तऐवजांनी शनिवारी द गार्डियनने नोंदवले - भागीदारीची सार्वजनिक घोषणा करताना कधीही उल्लेख केलेला नव्हता.
ऑक्सफर्डने मार्च 2025 मध्ये डिजिटायझेशन प्रकल्प म्हणून सहयोगाचे अनावरण केले, असे म्हटले की जगातील सर्वात प्रसिद्ध लायब्ररींपैकी एकातील मजकूर स्कॅन करण्यासाठी OpenAI सॉफ्टवेअरचा वापर केल्यास विद्यार्थी आणि संशोधकांसाठी सामग्री अधिक व्यापकपणे उपलब्ध होईल. या घोषणेमध्ये असे म्हटले गेले नाही की हे साहित्य OpenAI च्या व्यावसायिक मॉडेलचे प्रशिक्षण देईल. गार्डियनने पुनरावलोकन केलेले अंतर्गत दस्तऐवज हे उद्दिष्ट स्पष्ट करतात, AI उद्योगासाठी कच्चा माल शांतपणे पुरवणाऱ्या प्रतिष्ठित सांस्कृतिक संस्थेच्या आजपर्यंतच्या सर्वात स्पष्ट उदाहरणांपैकी एक आहे.
अनिर्बंध उद्देशाने भागीदारी
व्यवस्थेचे तपशील माहितीच्या स्वातंत्र्याच्या विनंतीद्वारे उदयास आले, ज्याने ChatGPT च्या मागे असलेल्या कंपनीसोबत भागीदारी करण्याच्या प्रतिष्ठेच्या जोखमीबद्दल - बोडलेयनच्या स्वत: च्या प्रशासन समितीच्या सदस्यांसह - कर्मचाऱ्यांच्या चिंतेची नोंद करून विद्यापीठाच्या बैठकीची मिनिटे तयार केली. ऊर्जा-केंद्रित तंत्रज्ञान कंपनीशी केलेल्या कराराचा विद्यापीठाच्या पर्यावरणीय वचनबद्धतेवर होणारा परिणाम देखील कर्मचाऱ्यांनी व्यक्त केला.
ओपनएआयच्या प्रवक्त्याने कार्यक्रमाचा बचाव केला आणि सांगितले की, "आजचे एआय मॉडेल भविष्यासाठी जगाचे ऐतिहासिक ज्ञान जतन करतात" याची खात्री करण्यासाठी कंपनीला "गर्व आहे". "दैनंदिन जीवनात एक अब्जाहून अधिक लोक हे तंत्रज्ञान वापरत असताना, हे विविध संस्कृती, इतिहास आणि दृष्टीकोन प्रतिबिंबित करणे महत्वाचे आहे," प्रवक्त्याने जोडले.
ट्यूडर बॅलड्सपासून ते डॉक्टरेट प्रबंधांपर्यंत
डिजिटायझेशनचे प्रमाण लक्षणीय आहे. जून 2025 पर्यंत, ऐतिहासिक प्रबंधांमधून स्कॅन केलेल्या 125,000 प्रतिमा बोडलियन संग्रहातून OpenAI सोबत शेअर केल्या गेल्या, ज्यात 19व्या आणि 20व्या शतकात लिहिलेल्या युरोपियन आणि अमेरिकन विद्यापीठांमधील PhD प्रबंधांचा समावेश आहे. स्कॅन केलेल्या इतर सामग्रीमध्ये 10,000 सोळाव्या शतकातील "ब्रॉडसाइड बॅलड्स" - गाण्याचे बोल आणि संगीताच्या नोट्सचा एक दुर्मिळ संग्रह समाविष्ट आहे जो एकदा ट्यूडरच्या रस्त्याच्या कोपऱ्यांवर प्रसारित झाला होता.
पारंपारिक अर्थाने त्यातील काहीही गुप्त नाही; बोडलेयनच्या ऐतिहासिक धारणांपैकी बहुतेक सार्वजनिक-डोमेन कामे आहेत आणि कॉपीराइट कायदा जुन्या मजकुरावर प्रशिक्षण मॉडेलवर काही निर्बंध घालतो. परंतु विद्वानांसाठी लायब्ररीचे डिजिटायझेशन करणे आणि व्यावसायिक प्रशिक्षण संच तयार करणे यातील फरक हा एक प्रकारचा फरक आहे जो ऐतिहासिकदृष्ट्या संस्थांनी मोठ्याने सांगणे अपेक्षित आहे. ऑक्सफर्डने तसे केले नाही — आणि विद्यापीठ आणि त्याच्या स्वतःच्या समुदायामधील पारदर्शकतेबद्दल काय म्हणते यापेक्षा कायदेशीर अधिकारांबद्दल काय म्हणतात याला वगळणे कमी महत्त्वाचे आहे.
नवीन डेटा फ्रंटियर म्हणून लायब्ररी
लायब्ररी शेल्फ् 'चे अव रुप साठी गर्दी एक साधा आर्थिक ड्राइव्हर आहे: ओपन वेब उपयुक्त डेटा संपत आहे. स्क्रॅप केलेल्या वेबसाइट्स AI-व्युत्पन्न केलेल्या सामग्रीसह संतृप्त झाल्यामुळे, त्या सामग्रीवरील प्रशिक्षण गोलाकार आणि निकृष्ट होत जाते आणि विकासक ताजे, मानवी-लिखित मजकूराचा स्रोत म्हणून भौतिक, अनेकदा ऐतिहासिक, पुस्तक संग्रहाकडे वळले आहेत.
हाय स्ट्रीटवर लक्षणे दिसतात. द गार्डियनने अहवाल दिला आहे की सेकेंडहँड पुस्तक विक्रेत्यांनी अस्पष्ट शीर्षकांसाठी ऑर्डर्सचा एक प्रकार पाहिला आहे - 18 व्या शतकातील आफ्रिकेतील कृषी अवजारांसाठी एक मार्गदर्शक, 1950 च्या कार चालकांची चरित्रे - तंतोतंत कारण अशी पुस्तके ऑनलाइन कोठेही डिजिटल स्वरूपात अस्तित्वात असण्याची शक्यता नाही. पुस्तक विक्रेत्यांनी असा अंदाज लावला की खरेदी एआय मॉडेल्सच्या पुढील पिढीसाठी नवीन डेटा दर्शवते.
OpenAI ने शैक्षणिक आणि सांस्कृतिक संस्थांमध्ये समान प्लेबुकचा पाठपुरावा केला आहे. कंपनीने नेक्स्टजेनएआय नावाच्या प्रकल्पांतर्गत बोस्टन पब्लिक लायब्ररी, कॅलटेक, एमआयटी आणि मिशिगन विद्यापीठाशी करार केला आहे, ज्यामध्ये ऑक्सफोर्ड हा प्रकल्पाचा एकमेव यूके सदस्य आहे. बोडलेयन, युरोपमधील सर्वात जुन्या ग्रंथालयांपैकी एक आहे ज्याचा संग्रह सहस्राब्दी पसरलेला आहे, काही अंतराने सर्वात मजली जोड आहे.
सांस्कृतिक संस्थांसाठी याचा अर्थ काय आहे
ऑक्सफर्ड एपिसोड जगभरातील संग्रहालये, संग्रहण आणि लायब्ररींद्वारे आधीच सुरू असलेल्या वादाला धार लावण्याची शक्यता आहे: जेव्हा एखादी टेक कंपनी विनामूल्य संग्रह डिजीटल करण्याची ऑफर देते तेव्हा प्रत्यक्षात कशाची देवाणघेवाण केली जाते? डिजिटायझेशनमुळे खरे सार्वजनिक फायदे मिळतात - प्रवेश, संरक्षण, शोधता. परंतु ऑक्सफर्ड दस्तऐवज सूचित करतात की मूल्य दोन्ही मार्गांनी प्रवाहित होते, आणि प्रशिक्षण-सेटचा वापर OpenAI साठी मटेरियल होता जरी ते घोषित करण्यासाठी पुरेसे साहित्य नव्हते.
तंग बजेटचा सामना करणाऱ्या संस्थांसाठी, मोह समजण्यासारखा आहे: व्यावसायिक डिजिटायझेशन महाग आहे आणि OpenAI सारख्या कंपन्या ते कोणत्याही खर्चाशिवाय करण्याची ऑफर देत आहेत. बॉडलियनच्या गव्हर्नन्स कमिटीचे सदस्य ज्यांना प्रतिष्ठा जोखमीची चिंता होती त्यांनी FOI दस्तऐवजांनी नंतर जे पुष्टी केली ते समजले असे दिसते - की विद्यापीठाचा ब्रँड डेटा संपादनाच्या प्रयत्नांना कायदेशीरपणा देत होता, मग तो हेतू असो वा नसो.
आता प्रश्न असा आहे की इतर संस्था त्यांच्या AI भागीदारीमध्ये पारदर्शकतेच्या कलमांचा आग्रह धरतील का: प्रशिक्षण वापराचे स्पष्ट प्रकटीकरण, संवेदनशील सामग्रीसाठी निवड रद्द करणे आणि काय सामायिक केले आणि का केले याबद्दल सार्वजनिक अहवाल. ते करेपर्यंत, जगातील महान संग्रह प्रशिक्षण डेटा बनत राहतील — एका वेळी एक शांत डिजिटायझेशन प्रकल्प.
---
एआयच्या पुढे राहाएआय प्रशिक्षण डेटाची लढाई तंत्रज्ञानाच्या पलीकडे असलेल्या उद्योगांना आकार देत आहे. नवीनतम AI बातम्या, विश्लेषण आणि यश मिळवा — सर्व एकाच ठिकाणी.
अधिक एआय बातम्या वाचा →