Згідно з внутрішніми документами, опублікованими The Guardian у суботу, Оксфордський університет дозволив OpenAI навчати свої моделі штучного інтелекту на історичних текстах із своєї Бодліанської бібліотеки з оцифрованим матеріалом, який використовувався для «заповнення навчального набору OpenAI» — мета, яка ніколи не згадувалася, коли було публічно оголошено про партнерство.

Оксфорд оприлюднив співпрацю в березні 2025 року як проект оцифрування, заявивши, що використання програмного забезпечення OpenAI для сканування текстів з однієї з найвідоміших бібліотек світу зробить контент більш доступним для студентів і дослідників. У оголошенні не було сказано, що цей матеріал стане підтримкою навчання комерційних моделей OpenAI. Внутрішні документи, переглянуті Guardian, чітко вказують на цю мету, відзначаючи один із найяскравіших на сьогоднішній день прикладів того, як престижна культурна установа спокійно постачає [сировину для індустрії ШІ] (https://aibuzzwire.news).

Партнерство з невизначеною метою

Деталі домовленості з’явилися через запит на свободу інформації, який виявив протоколи університетських зборів із записами занепокоєння персоналу — включно з членами власного комітету управління Bodleian — щодо репутаційного ризику партнерства з компанією, що стоїть за ChatGPT. Співробітники також підняли питання про вплив угоди з енергоємною технологічною компанією на екологічні зобов’язання університету.

Представник OpenAI захистив програму, заявивши, що компанія «пишається» тим, що «сучасні моделі ШІ зберігають світові історичні знання для майбутнього». «Оскільки понад мільярд людей використовують цю технологію в повсякденному житті, важливо, щоб вона відображала різні культури, історії та погляди», – додав речник.

Від балад Тюдорів до докторських дисертацій

Масштаб оцифрування є значним. До червня 2025 року 125 000 зображень, відсканованих з історичних дисертацій, були надіслані в OpenAI з Бодліанської колекції, включаючи докторські дисертації європейських і американських університетів, написані в 19 і 20 століттях. Інші скановані матеріали включають рідкісну колекцію з 10 000 «широких балад» шістнадцятого століття — тексти пісень і музичні ноти, які колись поширювалися на розі вулиць Тюдорів.

Нічого з цього не є секретом у загальноприйнятому розумінні; значна частина історичних фондів Bodleian є творами суспільного надбання, і закон про авторське право накладає деякі обмеження на навчання моделей на таких старих текстах. Але різниця між оцифруванням бібліотеки для науковців і заповненням комерційного навчального набору — це різновид різниці, про яку історично очікується, що інституції повинні проголошувати вголос. Оксфорд цього не зробив — і це упущення має значення не так для того, що там сказано про законні права, ніж для того, що там сказано про прозорість між університетом і його власною спільнотою.

Бібліотеки як новий кордон даних

Погоня за бібліотечними полицями має просту економічну причину: у відкритому Інтернеті закінчуються корисні дані. Оскільки скопійовані веб-сайти насичуються матеріалами, створеними штучним інтелектом, навчання цьому вмісту стає циклічним і погіршується, і розробники звернулися до фізичних, часто історичних, книжкових колекцій як до джерела свіжого тексту, написаного людьми.

Симптоми помітні на головній вулиці. The Guardian повідомляє, що продавці букіністів бачили хвилю замовлень на незрозумілі назви — посібник із сільськогосподарського знаряддя в Африці 18-го століття, біографії водіїв автомобілів 1950-х років — саме тому, що такі книги навряд чи існують у оцифрованій формі десь онлайн. Книгопродавці припустили, що покупки представляють свіжі дані для наступного покоління моделей ШІ.

OpenAI застосовує ту саму методику в академічних колах і культурних установах. Компанія уклала угоди з Бостонською публічною бібліотекою, Каліфорнійським технологічним інститутом, Массачусетським технологічним інститутом і Мічиганським університетом у рамках проекту під назвою NextGenAI, де Оксфорд є єдиним учасником проекту від Великобританії. Бодліанська, одна з найстаріших бібліотек у Європі, колекція якої охоплює тисячоліття, є певною мірою найвідомішим доповненням.

Що це означає для закладів культури

Оксфордський епізод, ймовірно, загострить дискусію, яка вже точиться в музеях, архівах і бібліотеках по всьому світу: коли технологічна компанія пропонує безкоштовно оцифрувати колекцію, чим насправді обмінюється? Оцифрування приносить справжню суспільну вигоду — доступ, збереження, можливість пошуку. Але оксфордські документи свідчать про те, що цінність рухається в обидві сторони, і що використання навчального набору було суттєвим для OpenAI, навіть якщо це було недостатньо суттєвим, щоб оголосити.

Для установ, які мають обмежений бюджет, спокуса зрозуміла: професійна оцифровка коштує дорого, і такі компанії, як OpenAI, пропонують робити це безкоштовно. Члени комітету з управління Bodleian, які стурбовані репутаційним ризиком, схоже, інтуїтивно здогадалися про те, що пізніше підтвердили документи FOI, — що бренд університету надає легітимність зусиллям зі збору даних, незалежно від того, чи це було наміром.

Питання зараз полягає в тому, чи будуть інші установи наполягати на застереженнях про прозорість у своїх партнерствах зі штучним інтелектом: чітке розкриття інформації про використання навчання, відмова від конфіденційних матеріалів і публічне звітування про те, що було поширено та чому. Поки вони цього не зроблять, великі світові колекції продовжуватимуть перетворюватися на навчальні дані — один тихий проект оцифрування за раз.

---

Будьте попереду ШІ

Боротьба за навчальні дані штучного інтелекту змінює індустрії далеко за межі технологій. Отримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.

Читати більше новин AI →