Die Universität Oxford erlaubte OpenAI, ihre KI-Modelle anhand historischer Texte aus ihrer Bodleian Library zu trainieren, wobei digitalisiertes Material verwendet wurde, um „das OpenAI-Trainingsset zu füllen“, wie aus internen Dokumenten hervorgeht, über die The Guardian am Samstag berichtete – ein Zweck, der bei der öffentlichen Bekanntgabe der Partnerschaft nie erwähnt wurde.
Oxford stellte die Zusammenarbeit im März 2025 als Digitalisierungsprojekt vor und erklärte, dass der Einsatz der OpenAI-Software zum Scannen von Texten aus einer der berühmtesten Bibliotheken der Welt die Inhalte für Studenten und Forscher breiter zugänglich machen würde. Was in der Ankündigung nicht gesagt wurde, war, dass das Material das Training der kommerziellen Modelle von OpenAI unterstützen würde. Interne Dokumente, die vom Guardian überprüft wurden, machen diesen Zweck deutlich und stellen eines der bislang klarsten Beispiele dafür dar, dass eine renommierte Kulturinstitution stillschweigend [Rohmaterial für die KI-Industrie] liefert (https://aibuzzwire.news).
Eine Partnerschaft mit einem unausgesprochenen Zweck
Einzelheiten der Vereinbarung wurden durch eine Anfrage zur Informationsfreiheit bekannt, bei der in Sitzungsprotokollen der Universität Bedenken von Mitarbeitern – einschließlich Mitgliedern des Bodleian-eigenen Governance-Ausschusses – über das Reputationsrisiko einer Partnerschaft mit dem Unternehmen hinter ChatGPT verzeichnet waren. Die Mitarbeiter wiesen auch darauf hin, welche Auswirkungen ein Deal mit einem energieintensiven Technologieunternehmen auf die Umweltverpflichtungen der Universität haben würde.
Ein OpenAI-Sprecher verteidigte das Programm und sagte, das Unternehmen sei „stolz“, sicherzustellen, dass „die KI-Modelle von heute das historische Wissen der Welt für die Zukunft bewahren“. „Da mehr als eine Milliarde Menschen diese Technologie im Alltag nutzen, ist es wichtig, dass sie unterschiedliche Kulturen, Geschichten und Perspektiven widerspiegelt“, fügte der Sprecher hinzu.
Von Tudor-Balladen bis hin zu Doktorarbeiten
Das Ausmaß der Digitalisierung ist erheblich. Bis Juni 2025 wurden 125.000 gescannte Bilder historischer Dissertationen aus der Bodleian-Sammlung mit OpenAI geteilt, darunter Doktorarbeiten europäischer und amerikanischer Universitäten, die im 19. und 20. Jahrhundert verfasst wurden. Zu den weiteren gescannten Materialien gehört eine seltene Sammlung von 10.000 „Balladen“ aus dem 16. Jahrhundert – Liedtexte und Musiknoten, die einst an den Straßenecken der Tudor-Zeit kursierten.
Nichts davon ist im herkömmlichen Sinne geheim; Viele der historischen Bestände des Bodleian sind gemeinfreie Werke, und das Urheberrecht sieht kaum Einschränkungen für das Training von Modellen für so alte Texte vor. Aber der Unterschied zwischen der Digitalisierung einer Bibliothek für Wissenschaftler und der Bestückung eines kommerziellen Schulungssets ist die Art von Unterscheidung, die Institutionen in der Vergangenheit lautstark aussprechen mussten. In Oxford war dies nicht der Fall – und die Auslassung ist weniger wichtig für die Aussage über gesetzliche Rechte als vielmehr für die Aussage über die Transparenz zwischen einer Universität und ihrer eigenen Gemeinschaft.
Bibliotheken als neue Datengrenze
Der Ansturm auf Bibliotheksregale hat einen einfachen wirtschaftlichen Grund: Dem offenen Internet gehen die nützlichen Daten aus. Da gecrackte Websites mit KI-generiertem Material gesättigt werden, wird die Schulung zu diesen Inhalten zirkulär und degradiert, und Entwickler haben sich physischen, oft historischen Buchsammlungen als Quelle für frischen, von Menschen geschriebenen Text zugewandt.
Die Symptome sind auf der Hauptstraße sichtbar. Der Guardian berichtet, dass Secondhand-Buchhändler eine Flut von Bestellungen für obskure Titel verzeichneten – einen Leitfaden für landwirtschaftliche Geräte im Afrika des 18. Jahrhunderts oder Biografien von Autofahrern der 1950er Jahre – gerade weil es unwahrscheinlich ist, dass solche Bücher irgendwo online in digitalisierter Form existieren. Buchhändler spekulierten, dass die Käufe neue Daten für die nächste Generation von KI-Modellen darstellen.
OpenAI hat in allen akademischen und kulturellen Institutionen das gleiche Prinzip verfolgt. Das Unternehmen hat Vereinbarungen mit der Boston Public Library, Caltech, MIT und der University of Michigan im Rahmen eines Projekts namens NextGenAI getroffen, wobei Oxford das einzige britische Mitglied des Projekts ist. Die Bodleian-Bibliothek, eine der ältesten Bibliotheken Europas mit einer Sammlung aus Jahrtausenden, ist mit Abstand die geschichtsträchtigste Ergänzung.
Was es für Kulturinstitutionen bedeutet
Die Oxford-Episode wird wahrscheinlich eine Debatte verschärfen, die bereits in Museen, Archiven und Bibliotheken weltweit läuft: Wenn ein Technologieunternehmen anbietet, eine Sammlung kostenlos zu digitalisieren, was wird dann tatsächlich ausgetauscht? Die Digitalisierung bringt echte öffentliche Vorteile mit sich – Zugang, Bewahrung, Durchsuchbarkeit. Die Oxford-Dokumente deuten jedoch darauf hin, dass der Wert in beide Richtungen fließt und dass die Verwendung des Trainingssatzes für OpenAI von wesentlicher Bedeutung war, auch wenn sie nicht wesentlich genug war, um sie anzukündigen.
Für Institutionen mit knappen Budgets ist die Versuchung verständlich: Professionelle Digitalisierung ist teuer, und Unternehmen wie OpenAI bieten dies kostenlos an. Die Mitglieder des Governance-Ausschusses der Bodleian University, die sich Sorgen über Reputationsrisiken machten, scheinen geahnt zu haben, was die FOI-Dokumente später bestätigten – dass die Marke der Universität einer Datenerfassungsmaßnahme Legitimität verlieh, unabhängig davon, ob dies beabsichtigt war oder nicht.
Die Frage ist nun, ob andere Institutionen in ihren KI-Partnerschaften auf Transparenzklauseln bestehen werden: explizite Offenlegung der Trainingsnutzung, Opt-outs für sensibles Material und öffentliche Berichterstattung darüber, was geteilt wurde und warum. Bis dahin werden die großen Sammlungen der Welt weiterhin zu Trainingsdaten werden – ein stilles Digitalisierungsprojekt nach dem anderen.
---
Der KI einen Schritt voraus seinDer Kampf um KI-Trainingsdaten verändert Branchen weit über die Technologie hinaus. Erhalten Sie die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.
Weitere KI-Neuigkeiten lesen →