Согласно внутренним документам, опубликованным The Guardian в субботу, Оксфордский университет разрешил OpenAI обучать свои модели ИИ на исторических текстах из своей Бодлианской библиотеки, используя оцифрованные материалы для «заполнения обучающего набора OpenAI» — цель, которая никогда не упоминалась, когда о партнерстве было публично объявлено.
Оксфорд представил сотрудничество в марте 2025 года как проект по оцифровке, заявив, что использование программного обеспечения OpenAI для сканирования текстов из одной из самых известных библиотек мира сделает контент более доступным для студентов и исследователей. В объявлении не говорилось о том, что этот материал будет использован для обучения коммерческим моделям OpenAI. Внутренние документы, рассмотренные Guardian, ясно указывают на эту цель, являя собой один из самых ярких на сегодняшний день примеров того, как престижное культурное учреждение незаметно поставляет [сырье для индустрии искусственного интеллекта] (https://aibuzzwire.news).
Партнерство с неустановленной целью
Подробности договоренности стали известны благодаря запросу о свободе информации, в результате которого были обнаружены протоколы университетских собраний, в которых зафиксированы опасения сотрудников, в том числе членов собственного комитета управления Bodleian, по поводу репутационного риска партнерства с компанией, стоящей за ChatGPT. Сотрудники также подняли вопрос о том, какое влияние окажет сделка с энергоемкой технологической компанией на экологические обязательства университета.
Представитель OpenAI выступил в защиту программы, заявив, что компания «гордится» тем, что «сегодняшние модели ИИ сохраняют мировые исторические знания для будущего». «Поскольку более миллиарда человек используют эту технологию в повседневной жизни, важно, чтобы она отражала разные культуры, истории и перспективы», — добавил представитель.
От тюдоровских баллад до докторских диссертаций
Масштабы цифровизации значительны. К июню 2025 года в OpenAI было передано 125 000 изображений, отсканированных из исторических диссертаций, из Бодлианской коллекции, включая докторские диссертации из европейских и американских университетов, написанные в 19 и 20 веках. Другой отсканированный материал включает редкую коллекцию из 10 000 «широких баллад» шестнадцатого века — текстов песен и музыкальных нот, которые когда-то распространялись на углах улиц эпохи Тюдоров.
Ничто из этого не является секретом в общепринятом смысле; большая часть исторических фондов Бодлиана является произведениями, являющимися общественным достоянием, а закон об авторском праве налагает мало ограничений на обучение моделей на таких старых текстах. Но различие между оцифровкой библиотеки для ученых и пополнением коммерческого учебного набора — это такое различие, о котором учреждения исторически должны были заявлять вслух. Оксфорд этого не сделал, и это упущение имеет меньшее значение для того, что он говорит о законных правах, чем для того, что он говорит о прозрачности между университетом и его собственным сообществом.
Библиотеки как новый рубеж данных
Погоня за библиотечными полками имеет простую экономическую причину: в открытой сети заканчиваются полезные данные. По мере того, как очищенные веб-сайты перенасыщаются материалами, созданными искусственным интеллектом, обучение этому контенту становится цикличным и деградирует, и разработчики обращаются к физическим, часто историческим, книжным коллекциям как к источнику свежего, написанного человеком текста.
Симптомы видны на главной улице. The Guardian сообщает, что продавцы подержанных книг столкнулись с потоком заказов на малоизвестные издания — справочник по сельскохозяйственным орудиям в Африке 18-го века, биографии водителей автомобилей 1950-х годов — именно потому, что такие книги вряд ли будут существовать в оцифрованной форме где-либо в Интернете. Книготорговцы предположили, что эти покупки представляют собой свежие данные для следующего поколения моделей искусственного интеллекта.
OpenAI применяет одну и ту же стратегию в академических кругах и учреждениях культуры. Компания заключила соглашения с Бостонской публичной библиотекой, Калифорнийским технологическим институтом, Массачусетским технологическим институтом и Мичиганским университетом в рамках проекта под названием NextGenAI, причем Оксфорд является единственным участником проекта из Великобритании. Бодлианская библиотека, одна из старейших библиотек в Европе, коллекция которой насчитывает тысячелетия, является, пожалуй, самым легендарным дополнением.
Что это значит для учреждений культуры
Эпизод в Оксфорде, вероятно, обострит дебаты, которые уже ведутся в музеях, архивах и библиотеках по всему миру: когда технологическая компания предлагает бесплатно оцифровать коллекцию, что на самом деле происходит в обмен? Оцифровка приносит реальную общественную пользу — доступ, сохранение, возможность поиска. Но оксфордские документы предполагают, что ценность распространяется в обе стороны, и что использование обучающего набора было важным для OpenAI, даже если оно не было достаточно существенным, чтобы его объявлять.
Для учреждений с ограниченным бюджетом искушение понятно: профессиональная оцифровка стоит дорого, и такие компании, как OpenAI, предлагают сделать это бесплатно. Члены комитета по управлению Бодлианского университета, которые беспокоились о репутационном риске, похоже, интуитивно поняли то, что позже подтвердили документы FOI, — что бренд университета придавал легитимность усилиям по сбору данных, независимо от того, было ли это намерением.
Вопрос теперь в том, будут ли другие учреждения настаивать на положениях о прозрачности в своих партнерствах в области ИИ: явном раскрытии использования обучения, отказе от конфиденциальных материалов и публичной отчетности о том, что было передано и почему. Пока они этого не сделают, великие коллекции мира будут продолжать превращаться в обучающие данные — по одному тихому проекту оцифровки за раз.
---
Будьте впереди ИИБитва за данные для обучения ИИ меняет отрасли, выходящие далеко за рамки технологий. Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.
Читать больше новостей об искусственном интеллекте →