土曜日にガーディアン紙が報じた内部文書によると、オックスフォード大学は、OpenAIがボドリアン図書館の歴史文書に基づいてAIモデルをトレーニングすることを許可しており、デジタル化された資料は「OpenAIトレーニングセットに追加」するために使用されたという。この目的は、提携が公表された時点では決して言及されていなかった。

オックスフォード大学は2025年3月にデジタル化プロジェクトとしてこの提携を発表し、OpenAIソフトウェアを使用して世界で最も有名な図書館の1つからテキストをスキャンすることで、学生や研究者がコンテンツをより広く利用できるようになると述べた。発表では述べられていなかったのは、この資料が OpenAI の商用モデルのトレーニングに利用されるということだった。ガーディアン紙が精査した内部文書にはその目的が明示されており、権威ある文化機関が静かに[AI産業の原材料]を供給しているこれまでで最も明白な例の1つとなっている(https://aibuzzwire.news)。

目的が明示されていないパートナーシップ

この取り決めの詳細は情報公開請求を通じて明らかになり、ChatGPTを運営する企業と提携することによる風評リスクについて、ボドリアン大学のガバナンス委員会のメンバーを含むスタッフらの懸念を記録した大学の会議議事録が判明した。スタッフらはまた、エネルギー集約型テクノロジー企業との契約が大学の環境への取り組みに与える影響についても取り上げた。

OpenAIの広報担当者はこのプログラムを擁護し、同社が「今日のAIモデルが世界の歴史的知識を将来に向けて確実に保存できることを誇りに思っている」と述べた。 「10億人以上の人々が日常生活でこのテクノロジーを使用しているため、異なる文化、歴史、視点を反映することが重要です」と広報担当者は付け加えた。

チューダー朝のバラードから博士論文まで

デジタル化の規模は相当なものだ。 2025 年 6 月までに、19 世紀と 20 世紀に書かれたヨーロッパとアメリカの大学の博士論文を含む、ボドリアン コレクションにある歴史的な論文からスキャンされた 125,000 枚の画像が OpenAI と共有されました。スキャンされたその他の資料には、かつてチューダー朝の街角で流通していた歌詞や音符など、16 世紀の「ブロードサイド バラード」10,000 枚の貴重なコレクションが含まれています。

従来の意味では、そのどれもが秘密ではありません。ボドリアンの歴史的所蔵品の多くはパブリックドメインの著作物であり、著作権法では、それほど古いテキストのモデルのトレーニングにほとんど制限を設けていません。しかし、学者のための図書館をデジタル化することと、商用トレーニングセットを充実させることとの区別は、歴史的に教育機関が声高に表明することが期待されてきた種類の区別である。オックスフォード大学はそうではなかった。そして、この省略は法的権利についての記述よりも、大学とそのコミュニティとの間の透明性についての記述よりも重要である。

新しいデータフロンティアとしてのライブラリ

図書館の棚への殺到には、単純な経済的要因があります。それは、オープンなウェブでは有用なデータが不足しているということです。スクレイピングされた Web サイトが AI によって生成されたマテリアルで飽和するにつれて、そのコンテンツに関するトレーニングは循環して質が低下し、開発者は、人間が書いた新鮮なテキストのソースとして、物理的な、多くの場合歴史的な書籍コレクションに注目するようになりました。

症状は大通りで顕著に現れます。ガーディアン紙の報道によると、古本屋では、18世紀アフリカの農具ガイドや1950年代の自動車運転手の伝記など、無名なタイトルの注文が相次ぎ、まさにそのような本がデジタル化された形式でオンライン上に存在する可能性が低いためだという。書店員らは、この購入品が次世代の AI モデルのための最新データを表していると推測した。

OpenAI は、学術界や文化機関全体で同じ戦略を追求してきました。同社は、NextGenAIと呼ばれるプロジェクトの下でボストン公共図書館、カリフォルニア工科大学、MIT、ミシガン大学と協定を締結しており、オックスフォードは同プロジェクトの唯一の英国メンバーとなっている。ボドリアン図書館は、数千年にわたるコレクションを誇るヨーロッパ最古の図書館のひとつで、最も歴史のある図書館です。

文化機関にとっての意味

オックスフォードのエピソードは、世界中の博物館、アーカイブ、図書館ですでに起こっている議論をさらに先鋭化させる可能性がある:テクノロジー企業がコレクションを無料でデジタル化すると申し出たとき、実際に何が交換されるのか?デジタル化は、アクセス、保存、検索可能性など、真の公共の利益をもたらします。しかし、オックスフォードの文書は、値が双方向に流れること、そしてたとえそれが発表するほど重要ではなかったとしても、トレーニングセットの使用がOpenAIにとって重要であることを示唆している。

予算が厳しい教育機関にとって、この誘惑は当然です。専門的なデジタル化には費用がかかり、OpenAI のような企業はそれを無料で行うことを申し出ています。風評リスクを懸念していたボドリアン大学のガバナンス委員会のメンバーらは、後にFOI文書で確認されたこと、つまり、それが意図的かどうかは別として、大学のブランドがデータ収集の取り組みに正当性を与えていることを直観したようだ。

現在の問題は、他の機関が AI パートナーシップにおいて透明性条項、つまりトレーニングの使用の明示的な開示、機密性の高いマテリアルのオプトアウト、共有された内容とその理由に関する公開報告を主張するかどうかです。それが実現するまで、世界中の素晴らしいコレクションは、一度に 1 つの静かなデジタル化プロジェクトとしてトレーニング データになり続けます。

---

AI の先を行く

AI トレーニング データをめぐる戦いは、テクノロジーをはるかに超えた業界を再構築しています。最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AIニュースをもっと読む→