طبق اسناد داخلی گزارش شده توسط گاردین در روز شنبه، دانشگاه آکسفورد به OpenAI اجازه داد تا مدلهای هوش مصنوعی خود را بر روی متون تاریخی کتابخانه Bodleian خود، با مواد دیجیتالی مورد استفاده برای "پر کردن مجموعه آموزشی OpenAI" آموزش دهد - هدفی که در زمان اعلام عمومی این مشارکت هرگز ذکر نشد.
آکسفورد در مارس 2025 از این همکاری به عنوان یک پروژه دیجیتالی سازی پرده برداری کرد و گفت که استفاده از نرم افزار OpenAI برای اسکن متون یکی از مشهورترین کتابخانه های جهان، محتوا را به طور گسترده در دسترس دانشجویان و محققان قرار می دهد. چیزی که در این اطلاعیه بیان نشده بود این بود که این مطالب آموزش مدل های تجاری OpenAI را تغذیه می کند. اسناد داخلی بررسی شده توسط گاردین این هدف را آشکار می کند و یکی از واضح ترین نمونه های تا به امروز از یک موسسه فرهنگی معتبر است که بی سر و صدا [مواد اولیه صنعت هوش مصنوعی] را تامین می کند (https://aibuzzwire.news).
مشارکت با هدفی نامشخص
جزئیات این ترتیب از طریق یک درخواست آزادی اطلاعات ظاهر شد، که صورتجلسات جلسه دانشگاه را نشان داد که نگرانیهای کارکنان - از جمله اعضای کمیته مدیریت خود Bodleian - در مورد خطر شراکت با شرکت پشت ChatGPT را ثبت میکرد. کارکنان همچنین تأثیر معامله با یک شرکت فناوری انرژی بر تعهدات زیست محیطی دانشگاه را مطرح کردند.
یک سخنگوی OpenAI از این برنامه دفاع کرد و گفت که این شرکت "مفتخر" است که مطمئن شود "مدل های هوش مصنوعی امروزی دانش تاریخی جهان را برای آینده حفظ می کنند." این سخنگو افزود: «با بیش از یک میلیارد نفر که از این فناوری در زندگی روزمره استفاده می کنند، مهم است که فرهنگ ها، تاریخ ها و دیدگاه های مختلف را منعکس کند.
از تصنیف های تودور تا پایان نامه های دکترا
مقیاس دیجیتالی شدن قابل توجه است. تا ژوئن 2025، 125000 تصویر اسکن شده از پایان نامه های تاریخی، از جمله پایان نامه های دکترا از دانشگاه های اروپایی و آمریکایی که در قرن 19 و 20 نوشته شده اند، با OpenAI از مجموعه Bodleian به اشتراک گذاشته شد. سایر مطالب اسکن شده شامل مجموعه نادری از 10000 "تصنیف گسترده" قرن شانزدهمی است - اشعار آهنگ و نت های موسیقی که زمانی در گوشه و کنار خیابان تودور پخش می شد.
هیچ یک از آن به معنای متعارف مخفی نیست. بسیاری از داراییهای تاریخی Bodleian آثاری با دامنه عمومی هستند، و قانون کپی رایت محدودیتهای کمی برای مدلهای آموزشی در متون قدیمی قائل است. اما تمایز بین دیجیتالی کردن یک کتابخانه برای دانش پژوهان و پر کردن یک مجموعه آموزشی تجاری، نوعی تمایز است که در طول تاریخ از مؤسسات انتظار میرفت آن را با صدای بلند بیان کنند. آکسفورد این کار را نکرد - و این حذف برای آنچه در مورد حقوق قانونی می گوید اهمیت کمتری دارد تا برای آنچه که در مورد شفافیت بین دانشگاه و جامعه خود می گوید.
کتابخانه ها به عنوان مرز داده جدید
عجله برای قفسههای کتابخانهها یک محرک اقتصادی ساده دارد: دادههای مفید وب باز در حال اتمام است. از آنجایی که وبسایتهای خراشیده شده با مواد تولید شده توسط هوش مصنوعی اشباع میشوند، آموزش در مورد آن محتوا دایرهای و ضعیف میشود و توسعهدهندگان به مجموعههای فیزیکی، اغلب تاریخی، کتاب بهعنوان منبعی از متنهای تازه و نوشتهشده توسط انسان روی آوردهاند.
علائم در خیابان قابل مشاهده است. گاردین گزارش میدهد که کتابفروشان دست دوم انبوهی از سفارشها را برای عناوین مبهم - راهنمای ابزارهای کشاورزی در آفریقای قرن هجدهم، زندگینامه رانندگان خودروهای دهه 1950 - دیدهاند، دقیقاً به این دلیل که بعید است چنین کتابهایی به شکل دیجیتالی در هیچ کجای آنلاین وجود داشته باشند. کتابفروشان حدس می زنند که خریدها نشان دهنده داده های تازه برای نسل بعدی مدل های هوش مصنوعی است.
OpenAI همان کتاب بازی را در دانشگاه ها و مؤسسات فرهنگی دنبال کرده است. این شرکت تحت پروژه ای به نام NextGenAI با کتابخانه عمومی بوستون، کلتک، MIT و دانشگاه میشیگان قراردادهایی منعقد کرده است که آکسفورد تنها عضو پروژه در بریتانیا است. Bodleian، یکی از قدیمیترین کتابخانههای اروپا با مجموعهای که هزاران سال را در بر میگیرد، تا حدودی مشهورترین کتابخانه است.
چه معنایی برای نهادهای فرهنگی دارد
اپیزود آکسفورد احتمالاً بحثی را که در حال حاضر در موزهها، بایگانیها و کتابخانههای سراسر جهان در جریان است تشدید میکند: وقتی یک شرکت فناوری پیشنهاد میکند مجموعهای را به صورت رایگان دیجیتالی کند، در واقع چه چیزی رد و بدل میشود؟ دیجیتالی شدن مزایای عمومی واقعی را به ارمغان می آورد - دسترسی، حفظ، قابلیت جستجو. اما اسناد آکسفورد نشان میدهند که ارزش به دو طرف جریان دارد و استفاده از مجموعه آموزشی برای OpenAI مهم است، حتی اگر به اندازه کافی برای اعلام نباشد.
برای مؤسساتی که با بودجه های محدود روبرو هستند، این وسوسه قابل درک است: دیجیتالی کردن حرفه ای گران است و شرکت هایی مانند OpenAI پیشنهاد می کنند این کار را بدون هزینه انجام دهند. به نظر می رسد اعضای کمیته مدیریت Bodleian که نگران خطرات شهرت بودند، آنچه را که اسناد FOI بعداً تأیید کردند، درک کرده اند - اینکه نام تجاری دانشگاه مشروعیتی به تلاش برای کسب داده می دهد، خواه این هدف بوده باشد یا نباشد.
اکنون سؤال این است که آیا سایر مؤسسات بر شروط شفافیت در مشارکتهای هوش مصنوعی خود پافشاری میکنند: افشای صریح استفاده از آموزش، انصراف از مطالب حساس، و گزارش عمومی در مورد آنچه به اشتراک گذاشته شده و چرا. تا زمانی که این کار انجام نشود، مجموعههای بزرگ جهان همچنان به دادههای آموزشی تبدیل میشوند - یک پروژه دیجیتالی سازی آرام در یک زمان.
---
از هوش مصنوعی جلوتر بمانیدنبرد برای داده های آموزشی هوش مصنوعی در حال تغییر شکل صنایع بسیار فراتر از فناوری است. آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
اخبار هوش مصنوعی را بیشتر بخوانید →