Uniwersytet Oksfordzki pozwolił OpenAI trenować swoje modele sztucznej inteligencji na podstawie tekstów historycznych z Biblioteki Bodleian, przy użyciu zdigitalizowanych materiałów wykorzystywanych do „zapełniania zestawu szkoleniowego OpenAI”, zgodnie z wewnętrznymi dokumentami zgłoszonymi w sobotę przez The Guardian – cel, który nigdy nie został wspomniany podczas publicznego ogłoszenia partnerstwa.
W marcu 2025 r. Oxford przedstawił tę współpracę jako projekt digitalizacji, twierdząc, że wykorzystanie oprogramowania OpenAI do skanowania tekstów z jednej z najsłynniejszych bibliotek na świecie sprawi, że treści będą szerzej dostępne dla studentów i badaczy. W ogłoszeniu nie podano, że materiał będzie podstawą do szkolenia komercyjnych modeli OpenAI. Wewnętrzne dokumenty sprawdzone przez Guardiana wyraźnie wskazują na ten cel, stanowiąc jeden z najwyraźniejszych jak dotąd przykładów prestiżowej instytucji kulturalnej, która po cichu dostarcza surowce dla branży sztucznej inteligencji.
Partnerstwo z nieokreślonym celem
Szczegóły porozumienia wyszły na jaw dzięki prośbie o wolność dostępu do informacji, w ramach której znalazły się protokoły posiedzeń uniwersyteckich zawierające zastrzeżenia pracowników – w tym członków komitetu zarządzającego Bodleian – dotyczące ryzyka utraty reputacji wynikającego ze współpracy z firmą stojącą za ChatGPT. Pracownicy poruszyli także kwestię wpływu, jaki umowa z energochłonną firmą technologiczną będzie miała na zobowiązania uniwersytetu w zakresie ochrony środowiska.
Rzecznik OpenAI bronił programu, mówiąc, że firma jest „dumna” z zapewnienia, że „dzisiejsze modele sztucznej inteligencji chronią światową wiedzę historyczną na przyszłość”. „Ponieważ ponad miliard ludzi korzysta z tej technologii na co dzień, ważne jest, aby odzwierciedlała ona różne kultury, historie i perspektywy” – dodał rzecznik.
Od ballad Tudorów po prace doktorskie
Skala cyfryzacji jest znaczna. Do czerwca 2025 r. w OpenAI z kolekcji Bodleian udostępniono 125 000 obrazów zeskanowanych z rozpraw historycznych, w tym prac doktorskich z uniwersytetów europejskich i amerykańskich napisanych w XIX i XX wieku. Inne zeskanowane materiały obejmują rzadki zbiór 10 000 szesnastowiecznych „ballad burtowych” — tekstów piosenek i nut, które niegdyś krążyły na rogach ulic Tudorów.
Nic z tego nie jest tajemnicą w konwencjonalnym sensie; większość historycznych zbiorów Bodleiana to dzieła należące do domeny publicznej, a prawo autorskie nakłada niewiele ograniczeń na modele uczenia się na tak starych tekstach. Jednak rozróżnienie między digitalizacją biblioteki dla naukowców a zapełnieniem komercyjnego zestawu szkoleniowego jest tym rodzajem rozróżnienia, o którym od dawna oczekiwano, że instytucje będą głośno wyrażać. Oksford tak nie zrobił – a pominięcie to ma mniejsze znaczenie dla tego, co mówi o prawach prawnych, niż dla tego, co mówi o przejrzystości między uniwersytetem a jego własną społecznością.
Biblioteki jako nowa granica danych
Pośpiech w zdobywaniu półek bibliotecznych ma prosty czynnik ekonomiczny: w otwartej sieci brakuje przydatnych danych. W miarę jak zeskrobane witryny internetowe stają się nasycone materiałami generowanymi przez sztuczną inteligencję, szkolenia dotyczące tych treści stają się cykliczne i ulegają degradacji, a programiści zwracają się do fizycznych, często historycznych, księgozbiorów jako źródła świeżego, napisanego przez ludzi tekstu.
Objawy są widoczne na głównej ulicy. The Guardian donosi, że sprzedawcy książek z drugiej ręki zaobserwowali falę zamówień na mało znane tytuły – przewodnik po narzędziach rolniczych w Afryce w XVIII wieku, biografie kierowców samochodów z lat 50. XX wieku – właśnie dlatego, że jest mało prawdopodobne, aby takie książki istniały w Internecie w formie cyfrowej. Księgarze spekulowali, że zakupy stanowią świeże dane dla nowej generacji modeli sztucznej inteligencji.
OpenAI stosuje ten sam schemat w środowiskach akademickich i instytucjach kulturalnych. Firma zawarła umowy z Bostońską Biblioteką Publiczną, Caltech, MIT i Uniwersytetem Michigan w ramach projektu o nazwie NextGenAI, którego Oxford jest jedynym członkiem projektu w Wielkiej Brytanii. Bodleian, jedna z najstarszych bibliotek w Europie, której zbiory obejmują tysiące lat, jest zdecydowanie najbardziej zabytkowym obiektem.
Co to oznacza dla instytucji kultury
Epizod z Oksfordu prawdopodobnie zaostrzy debatę toczącą się już w muzeach, archiwach i bibliotekach na całym świecie: kiedy firma technologiczna oferuje bezpłatną digitalizację kolekcji, co tak naprawdę podlega wymianie? Cyfryzacja przynosi rzeczywiste korzyści publiczne — dostęp, ochronę i możliwość wyszukiwania. Jednak dokumenty z Oksfordu sugerują, że wartość przepływa w obie strony i że wykorzystanie zestawu szkoleniowego było istotne dla OpenAI, nawet jeśli nie było na tyle istotne, aby to ogłosić.
W przypadku instytucji dysponujących napiętymi budżetami pokusa jest zrozumiała: profesjonalna cyfryzacja jest kosztowna, a firmy takie jak OpenAI oferują wykonanie jej bezpłatnie. Wydaje się, że członkowie komitetu zarządzającego Bodleian, którzy obawiali się ryzyka utraty reputacji, przeczuli to, co później potwierdziły dokumenty FOI – że marka uniwersytetu legitymizowała wysiłki związane z pozyskiwaniem danych, niezależnie od tego, czy taki był zamysł, czy nie.
Pytanie brzmi teraz, czy inne instytucje będą nalegać na klauzule przejrzystości w swoich partnerstwach z zakresu sztucznej inteligencji: wyraźne ujawnianie wykorzystania szkoleń, rezygnacja z materiałów wrażliwych oraz publiczne raportowanie na temat tego, co zostało udostępnione i dlaczego. Dopóki tego nie zrobią, wspaniałe zbiory świata będą nadal danymi szkoleniowymi — pojedynczym cichym projektem digitalizacji na raz.
---
Wyprzedź sztuczną inteligencjęBitwa o dane szkoleniowe AI zmienia branże wykraczające daleko poza technologię. Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.
Przeczytaj więcej aktualności o sztucznej inteligencji →