طبق اسناد داخلی گزارش شده توسط گاردین در روز شنبه، دانشگاه آکسفورد به OpenAI اجازه داد تا مدل‌های هوش مصنوعی خود را بر روی متون تاریخی کتابخانه Bodleian خود، با مواد دیجیتالی مورد استفاده برای "پر کردن مجموعه آموزشی OpenAI" آموزش دهد - هدفی که در زمان اعلام عمومی این مشارکت هرگز ذکر نشد.

آکسفورد در مارس 2025 از این همکاری به عنوان یک پروژه دیجیتالی سازی پرده برداری کرد و گفت که استفاده از نرم افزار OpenAI برای اسکن متون یکی از مشهورترین کتابخانه های جهان، محتوا را به طور گسترده در دسترس دانشجویان و محققان قرار می دهد. چیزی که در این اطلاعیه بیان نشده بود این بود که این مطالب آموزش مدل های تجاری OpenAI را تغذیه می کند. اسناد داخلی بررسی شده توسط گاردین این هدف را آشکار می کند و یکی از واضح ترین نمونه های تا به امروز از یک موسسه فرهنگی معتبر است که بی سر و صدا [مواد اولیه صنعت هوش مصنوعی] را تامین می کند (https://aibuzzwire.news).

مشارکت با هدفی نامشخص

جزئیات این ترتیب از طریق یک درخواست آزادی اطلاعات ظاهر شد، که صورتجلسات جلسه دانشگاه را نشان داد که نگرانی‌های کارکنان - از جمله اعضای کمیته مدیریت خود Bodleian - در مورد خطر شراکت با شرکت پشت ChatGPT را ثبت می‌کرد. کارکنان همچنین تأثیر معامله با یک شرکت فناوری انرژی بر تعهدات زیست محیطی دانشگاه را مطرح کردند.

یک سخنگوی OpenAI از این برنامه دفاع کرد و گفت که این شرکت "مفتخر" است که مطمئن شود "مدل های هوش مصنوعی امروزی دانش تاریخی جهان را برای آینده حفظ می کنند." این سخنگو افزود: «با بیش از یک میلیارد نفر که از این فناوری در زندگی روزمره استفاده می کنند، مهم است که فرهنگ ها، تاریخ ها و دیدگاه های مختلف را منعکس کند.

از تصنیف های تودور تا پایان نامه های دکترا

مقیاس دیجیتالی شدن قابل توجه است. تا ژوئن 2025، 125000 تصویر اسکن شده از پایان نامه های تاریخی، از جمله پایان نامه های دکترا از دانشگاه های اروپایی و آمریکایی که در قرن 19 و 20 نوشته شده اند، با OpenAI از مجموعه Bodleian به اشتراک گذاشته شد. سایر مطالب اسکن شده شامل مجموعه نادری از 10000 "تصنیف گسترده" قرن شانزدهمی است - اشعار آهنگ و نت های موسیقی که زمانی در گوشه و کنار خیابان تودور پخش می شد.

هیچ یک از آن به معنای متعارف مخفی نیست. بسیاری از دارایی‌های تاریخی Bodleian آثاری با دامنه عمومی هستند، و قانون کپی رایت محدودیت‌های کمی برای مدل‌های آموزشی در متون قدیمی قائل است. اما تمایز بین دیجیتالی کردن یک کتابخانه برای دانش پژوهان و پر کردن یک مجموعه آموزشی تجاری، نوعی تمایز است که در طول تاریخ از مؤسسات انتظار می‌رفت آن را با صدای بلند بیان کنند. آکسفورد این کار را نکرد - و این حذف برای آنچه در مورد حقوق قانونی می گوید اهمیت کمتری دارد تا برای آنچه که در مورد شفافیت بین دانشگاه و جامعه خود می گوید.

کتابخانه ها به عنوان مرز داده جدید

عجله برای قفسه‌های کتابخانه‌ها یک محرک اقتصادی ساده دارد: داده‌های مفید وب باز در حال اتمام است. از آنجایی که وب‌سایت‌های خراشیده شده با مواد تولید شده توسط هوش مصنوعی اشباع می‌شوند، آموزش در مورد آن محتوا دایره‌ای و ضعیف می‌شود و توسعه‌دهندگان به مجموعه‌های فیزیکی، اغلب تاریخی، کتاب به‌عنوان منبعی از متن‌های تازه و نوشته‌شده توسط انسان روی آورده‌اند.

علائم در خیابان قابل مشاهده است. گاردین گزارش می‌دهد که کتاب‌فروشان دست دوم انبوهی از سفارش‌ها را برای عناوین مبهم - راهنمای ابزارهای کشاورزی در آفریقای قرن هجدهم، زندگی‌نامه رانندگان خودروهای دهه 1950 - دیده‌اند، دقیقاً به این دلیل که بعید است چنین کتاب‌هایی به شکل دیجیتالی در هیچ کجای آنلاین وجود داشته باشند. کتابفروشان حدس می زنند که خریدها نشان دهنده داده های تازه برای نسل بعدی مدل های هوش مصنوعی است.

OpenAI همان کتاب بازی را در دانشگاه ها و مؤسسات فرهنگی دنبال کرده است. این شرکت تحت پروژه ای به نام NextGenAI با کتابخانه عمومی بوستون، کلتک، MIT و دانشگاه میشیگان قراردادهایی منعقد کرده است که آکسفورد تنها عضو پروژه در بریتانیا است. Bodleian، یکی از قدیمی‌ترین کتابخانه‌های اروپا با مجموعه‌ای که هزاران سال را در بر می‌گیرد، تا حدودی مشهورترین کتابخانه است.

چه معنایی برای نهادهای فرهنگی دارد

اپیزود آکسفورد احتمالاً بحثی را که در حال حاضر در موزه‌ها، بایگانی‌ها و کتابخانه‌های سراسر جهان در جریان است تشدید می‌کند: وقتی یک شرکت فناوری پیشنهاد می‌کند مجموعه‌ای را به صورت رایگان دیجیتالی کند، در واقع چه چیزی رد و بدل می‌شود؟ دیجیتالی شدن مزایای عمومی واقعی را به ارمغان می آورد - دسترسی، حفظ، قابلیت جستجو. اما اسناد آکسفورد نشان می‌دهند که ارزش به دو طرف جریان دارد و استفاده از مجموعه آموزشی برای OpenAI مهم است، حتی اگر به اندازه کافی برای اعلام نباشد.

برای مؤسساتی که با بودجه های محدود روبرو هستند، این وسوسه قابل درک است: دیجیتالی کردن حرفه ای گران است و شرکت هایی مانند OpenAI پیشنهاد می کنند این کار را بدون هزینه انجام دهند. به نظر می رسد اعضای کمیته مدیریت Bodleian که نگران خطرات شهرت بودند، آنچه را که اسناد FOI بعداً تأیید کردند، درک کرده اند - اینکه نام تجاری دانشگاه مشروعیتی به تلاش برای کسب داده می دهد، خواه این هدف بوده باشد یا نباشد.

اکنون سؤال این است که آیا سایر مؤسسات بر شروط شفافیت در مشارکت‌های هوش مصنوعی خود پافشاری می‌کنند: افشای صریح استفاده از آموزش، انصراف از مطالب حساس، و گزارش عمومی در مورد آنچه به اشتراک گذاشته شده و چرا. تا زمانی که این کار انجام نشود، مجموعه‌های بزرگ جهان همچنان به داده‌های آموزشی تبدیل می‌شوند - یک پروژه دیجیتالی سازی آرام در یک زمان.

---

از هوش مصنوعی جلوتر بمانید

نبرد برای داده های آموزشی هوش مصنوعی در حال تغییر شکل صنایع بسیار فراتر از فناوری است. آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

اخبار هوش مصنوعی را بیشتر بخوانید →